摘要: 我们之前的爬虫都是在同一台机器运行的,叫做单机爬虫。scrapy的经典架构图也是描述的单机架构。那么分布式爬虫架构实际上就是:由一台主机维护所有的爬取队列,每台从机的sheduler共享该队列,协同存储与提取。分布式爬虫的多台协作的关键是共享爬取队列。队列用什么维护呢?推荐redis队列redis是 阅读全文
posted @ 2017-07-07 13:45 道高一尺 阅读(2331) 评论(0) 推荐(0)
摘要: 1,spider打开某网页,获取到一个或者多个request,经由scrapy engine传送给调度器schedulerrequest特别多并且速度特别快会在scheduler形成请求队列queue,由scheduler安排执行2,schelduler会按照一定的次序取出请求,经由引擎, 下载器中 阅读全文
posted @ 2017-07-07 11:20 道高一尺 阅读(5643) 评论(0) 推荐(0)