爬虫之robots.txt

网络爬虫引发的问题:
1. 性能骚扰
Web服务器默认接收人类访问,受限于水平和目的,网络爬虫将会对服务器带来巨大资源开销
2. 隐私泄露
网络爬虫可能具备突破简单访问控制的能力,从而隐私泄露
3. 法律风险
服务器上的数据有产权归属,网络爬虫获取数据后牟利将带来法律风险
网络爬虫的限制方法:
1. 来源审查:判断User-Agent进行限制(有一定的技术难度)
检查来访HTTP头的User-Agent域,只响应浏览器或友好的爬虫访问
2. 发布公告:robots协议
告知爬取策略,要求爬虫遵守

robots协议
robots.txt 网络爬虫排除标准
作用:告知网络爬虫哪些网页可以抓取,那些不行
存放目录:在网站根目录下的robots.txt文件



浙公网安备 33010602011771号