随笔分类 -  python学习 / 爬虫基础 / scrapy框架

摘要:第一节课: 一:根据page页面解析出book_url 二: 解析来的response (book_url) 并不是交给parse_item方法,而是交给了上面的rules处理,然后通过LinkExtractor提取静态页面数据url,url形成一个新的请求交给引擎,引擎一顿操作给到callback 阅读全文
posted @ 2024-01-25 19:00 人生努力努力努力就好 阅读(72) 评论(0) 推荐(0)
摘要:第一节:豆瓣电影信息的爬取 1.分析源码 page页面:https://www.douban.com/doulist/3936288/ 关键源码截图: 外部div: <div class="bd doulist-subject"> <div class="doulist-video-items"> 阅读全文
posted @ 2023-12-12 20:06 人生努力努力努力就好 阅读(191) 评论(0) 推荐(0)
摘要:一、简介 scrapy的优势: 1、为了更利于我们将精力集中在请求与解析上 2、企业级的要求,效率高 二、模块安装 scrapy支持Python2.7和python3.4以上版本 1.在https://www.lfd.uci.edu/~gohlke/pythonlibs/ 下载对应的Twisted的 阅读全文
posted @ 2023-11-28 21:12 人生努力努力努力就好 阅读(136) 评论(0) 推荐(0)