随笔分类 -  网络爬虫

摘要:先吐槽一句哀家的人品,总在写好代码之后,网站默默的升级,没有一点点防备... 一、加代理 爬取一个网站的时候,爬了不到一半,IP被封了,整个内部局域网的所有电脑都不能访问网站了。 还是以应用(一)中的代码为例,可以在构造函数中添加代理: ① 在原来的基础添加了一个int型的useProxy参数,如果 阅读全文
posted @ 2016-03-25 18:49 李闹闹童鞋 阅读(1352) 评论(0) 推荐(0)
摘要:webcollector是一个开源的Java网络爬虫框架。最近的爬虫改用java写了,对这一周的工作进行简要总结。对于内部机制了解不深入,主要侧重在应用。 一、环境搭建 需要安装一个webcollector的jar包,从官网上下载bin文件,解压,根据不同IDE的安装方式进行安装即可。 https: 阅读全文
posted @ 2016-03-21 01:26 李闹闹童鞋 阅读(6673) 评论(0) 推荐(0)
摘要:这周对于Scrapy进一步学习,知识比较零散,需要爬取的网站因为封禁策略账号还被封了/(ㄒoㄒ)/~~ 一、信息存储 1、log存储命令:scrapy crawl Test --logfile=test.log——把运行输出存入log当中 也可以在代码中定义要存储的内容:self.log("Fetc 阅读全文
posted @ 2016-01-15 18:29 李闹闹童鞋 阅读(395) 评论(0) 推荐(0)
摘要:scrapy是python的一个网络爬虫框架,关于它的介绍有很多资料,这里不做过多介绍(好吧我承认我还不是很懂...)。我现在还在摸索阶段,因为用scrapy爬取的第一个网站非常简单,不涉及登陆、验证、翻页、封号等等问题,仅仅是用spiders中抓取页面内容,然后在pipelines中存入数据库,所 阅读全文
posted @ 2016-01-08 17:42 李闹闹童鞋 阅读(3104) 评论(0) 推荐(0)