会员
周边
新闻
博问
闪存
众包
赞助商
Chat2DB
所有博客
当前博客
我的博客
我的园子
账号设置
会员中心
简洁模式
...
退出登录
注册
登录
边军一小兵
博客园
首页
新随笔
联系
管理
订阅
2015年5月20日
《自己动手写网络爬虫》读书笔记——队列与集合
摘要: 队列: 在爬虫程序中, 用到了广度优先搜索(BFS)算法. 这个算法用到的数据结构就是队列。 在python中提供了collection.deque用来实现了queue的相关操作,其官方实力如下: 集合: 在爬虫程序中, 为了不重复爬那些已经爬过的网站, 我们需要把爬过的页面的url放进...
阅读全文
posted @ 2015-05-20 23:26 边军一小兵
阅读(263)
评论(0)
推荐(0)
2015年5月16日
《自己动手写网络爬虫》读书笔记——宽度优先爬虫和带偏好的爬虫
摘要: 前面只是获取了单个网页内容,在实际中,则使用爬虫程序遍历互联网,把网络中相关的网页全部抓取过来,这也体现了爬虫程序“爬”的概念。 互联网可以看成一个超级大的“图',而每个网页则可以看作是一个”节点“。页面中的链接可以看成是图的”有向边“。因此,可以通过图的遍历的方式对互联网这个”图“进行访问。...
阅读全文
posted @ 2015-05-16 23:27 边军一小兵
阅读(677)
评论(0)
推荐(0)
公告