爬虫之robots.txt

网络爬虫引发的问题:

1. 性能骚扰

Web服务器默认接收人类访问,受限于水平和目的,网络爬虫将会对服务器带来巨大资源开销

2. 隐私泄露

网络爬虫可能具备突破简单访问控制的能力,从而隐私泄露

3. 法律风险

服务器上的数据有产权归属,网络爬虫获取数据后牟利将带来法律风险

 

网络爬虫的限制方法:

1. 来源审查:判断User-Agent进行限制(有一定的技术难度)

检查来访HTTP头的User-Agent域,只响应浏览器或友好的爬虫访问

2. 发布公告:robots协议

告知爬取策略,要求爬虫遵守

 

robots协议

robots.txt  网络爬虫排除标准

作用:告知网络爬虫哪些网页可以抓取,那些不行

存放目录:在网站根目录下的robots.txt文件

 

 

posted @ 2017-03-13 09:31  _HLP_huang  阅读(713)  评论(0)    收藏  举报