摘要:
1 说说什么是爬虫协议?Robots协议(也称为爬虫协议、爬虫规则、机器人协议等)也就是robots.txt,网站通过robots协议告诉搜索引擎哪些页面可以抓取,哪些页面不能抓取。Robots协议是网站国际互联网界通行的道德规范,其目的是保护网站数据和敏感信息、确保用户个人信息和隐私不被侵犯。因其 阅读全文
posted @ 2020-10-10 10:12
头秃python程序员
阅读(103)
评论(0)
推荐(0)
摘要:
1 描述一下scrapy框架的运行机制?从start_urls里面获取第一批url发送请求,请求由请求引擎给调度器入请求对列,获取完毕后,调度器将请求对列交给下载器去获取请求对应的响应资源,并将响应交给自己编写的解析方法做提取处理,如果提取出需要的数据,则交给管道处理,如果提取出url,则继续执行之 阅读全文
posted @ 2020-10-10 09:16
头秃python程序员
阅读(112)
评论(0)
推荐(0)
浙公网安备 33010602011771号