07 2018 档案

摘要:下载 scrapy 创建爬虫 scrapy startproject 项目名 cd scrapy genspider 爬虫名 初始网址 下载Django django-admin startapp 名字 结合的地方 scrapy item中 下载 scrapy_djangoitem scrapy 蜘 阅读全文
posted @ 2018-07-25 18:01 Eunuch_Li 阅读(1796) 评论(0) 推荐(0)
摘要:在命令窗口 pip install 从网站下载库 https://www.lfd.uci.edu/~gohlke/pythonlibs/ 窗口命令下载 访问的如果是外国网站,下载会很慢, 将命令窗口默认下载位置设置成豆瓣源镜像下载 操作如下 在电脑用户文件中查找pip文件,有就进入,没有就创建一个 阅读全文
posted @ 2018-07-20 10:33 Eunuch_Li 阅读(162) 评论(0) 推荐(0)
摘要:恢复内容开始 推展 恢复内容结束 阅读全文
posted @ 2018-07-14 12:05 Eunuch_Li 阅读(235) 评论(0) 推荐(0)
摘要:流程 在爬虫py中, 在item 中 阅读全文
posted @ 2018-07-14 09:48 Eunuch_Li 阅读(277) 评论(0) 推荐(0)
摘要:数据库pymysql的commit()和execute()在提交数据时,都是同步提交至数据库,由于scrapy框架数据的解析和异步多线程的,所以scrapy的数据解析速度,要远高于数据的写入数据库的速度。如果数据写入过慢,会造成数据库写入的阻塞,影响数据库写入的效率。通过多线程异步的形式对数据进行写入,可以提高数据的写入速度。 使用twisted异步IO框架,实现数据的异步写入。 from tw... 阅读全文
posted @ 2018-07-14 09:28 Eunuch_Li 阅读(2156) 评论(0) 推荐(0)
摘要:为了让pipeline.py生效,还需要在settings.py文件中增加设置,内容如下: 阅读全文
posted @ 2018-07-07 15:02 Eunuch_Li 阅读(2022) 评论(0) 推荐(1)