乐之之

知而行乐,乐而行之,天道酬勤,学无止境。

随笔分类 -  python爬虫 / scrapy

scrapy框架的简单介绍及使用
scrapy爬虫框架(七)Extension的使用
摘要:一、简介 Scrapy提供了一个Extension机制,可以让我们添加和扩展一些自定义的功能。利用Extension我们可以注册一些处理方法并监听Scrapy运行过程中的各个信号,做到发生某个事件时执行我们自定义的方法。 Scrapy已经内置了一些Extension,如LogStats这个Exten 阅读全文

posted @ 2023-04-08 22:40 乐之之 阅读(354) 评论(0) 推荐(0)

scrapy爬虫框架(六)Item Pipeline的使用
摘要:Item Pipeline即项目管道,它的调用发生在Spider产生Item之后。当Spider解析完Response,Item就会被Engine传递到Item Pipeline,被定义的Item Pipeline组件会顺次被调用,完成一连串的处理过程,比如数据清洗、存储等。 Item Pipeli 阅读全文

posted @ 2023-04-07 14:19 乐之之 阅读(1411) 评论(0) 推荐(0)

scrapy爬虫框架(五)Spider Middleware
摘要:Spider Middleware,中文可以翻译为爬虫中间件,但我个人认为英文的叫法更为合适。它是处于Spider 和 Engine 之间的处理模块。当 Downloader 生成 Response 之后,Response 会被发送给 Spider,在发送给 Spider 之前,Response 会 阅读全文

posted @ 2023-04-05 00:18 乐之之 阅读(397) 评论(0) 推荐(0)

scrapy爬虫框架(四)Downloader Middleware的使用
摘要:Downloader Middleware是处于Engine和Downloader之间的模块,其重要作用就是处理schduler调度器发送到Engine的Request和经过Downloader响应后的response返回至Engine过程中的处理。如图所示: 也就是说,Downloader Mid 阅读全文

posted @ 2023-04-03 15:23 乐之之 阅读(474) 评论(0) 推荐(0)

scrapy爬虫框架(三)Spider的使用
摘要:在前面已经简单介绍了spider的基础用法,那么今天我们来详细了解一下Spider的具体用法。 一、Spider的运行流程 spider是scrapy框架中最核心的组件,其定义了爬取网站的逻辑和解析方式,而spider主要做两件事情: 定义爬取网站的动作。 分析爬取下来的网页。 那么他的运行流程主要 阅读全文

posted @ 2023-03-31 19:59 乐之之 阅读(1192) 评论(0) 推荐(1)

scrapy爬虫框架(二)scrapy中Selector的使用
摘要:在scrapy框架前,相信大家或多或少的已经了解了一些网页数据解析方法,如:xpath、bs4、正则表达式等,但是在scrapy框架中也有一个内置的数据提取方法--Selector。在这里我们就先简单介绍一下Selector在scrapy中的运用及常用方法。 为了方便示例,我们以官方文档中的示例页面 阅读全文

posted @ 2023-03-31 10:48 乐之之 阅读(486) 评论(0) 推荐(0)

scrapy爬虫框架(一)入门介绍
摘要:在爬虫过程中,每次写一个爬虫程序时,都会从研究网页信息基本情况,所用到的库和方法。每次写基础代码时,都会略显繁琐。之前我也曾想过自己写一个基础的框架,从请求到响应再到解析和数据的保存。实现代码复用率,但发现其实并不用自己再造一遍轮子,因为市面上已经有了强大的异步框架--scrapy。我们只需要在此框 阅读全文

posted @ 2023-03-29 18:11 乐之之 阅读(288) 评论(0) 推荐(0)