今天最大的收获是达成了python编写Twitter爬虫,利用多线程实现了同时下载。下载速度还是不错,整体框架已经搭建好,就等着后续不断扩展功能了。不过对于多线程的处理我还不是特别理解,尤其是模块的使用特性并不熟练。但这是需要时间来不断了解和掌握,相信假以时日,尤其是足够的实际操作练习后,一定会有所提升的。
目前比较迷惑的一点是:难道Twitter只会提供部分推文的访问?因为每次都是访问到某一条推文后,便无法继续访问更旧的推文,但显然这条推文并非该用户的第一条推文的,要如何才能访问更旧的推文呢?
待完善功能:
不同API自动切换
多screen_name任务队列
多标签切换