摘要: 近来安装python scrapy经常忘了添加到path,需要时增加了但需要重启才能起作用,用下面的方法马上能生效: 1修改path:右击“计算机”--高级--环境变量--path 2。打开“任务管理器”,结束进程"explorer.exe",再打开.方法:在任务管理器进程中找到“explorer. 阅读全文
posted @ 2020-02-08 20:01 myrj 阅读(1531) 评论(0) 推荐(0)
摘要: 运行scrapy时出错这个错误:Max retries exceeded with url解决方法: img1=requests.get(url=aa,headers=header1,timeout=5,verify=False)爬虫能运行了,但还是报错,但不影响使用 阅读全文
posted @ 2020-02-08 19:54 myrj 阅读(625) 评论(0) 推荐(0)
摘要: '''使用walk方法递归遍历目录文件,walk方法会返回一个三元组,分别是root、dirs和files。 其中root是当前正在遍历的目录路径;dirs是一个列表,包含当前正在遍历的目录下所有的子目录名称,不包含该目录下的文件; files也是一个列表,包含当前正在遍历的目录下所有的文件,但不包 阅读全文
posted @ 2020-02-08 19:47 myrj 阅读(7769) 评论(0) 推荐(0)
摘要: https://tools.zzzmode.com/mytools/charles/ https://www.charlesproxy.com/download/ 阅读全文
posted @ 2020-02-07 06:48 myrj 阅读(119) 评论(0) 推荐(0)
摘要: 1.建立爬虫项目(结果形成与名称相同的文件夹) scrapy startproject <爬虫项目名称> (下面的所有操作都进入下一级文件进行操作) 2建立一个爬虫 scrapy genspider [- t 模板名称] <爬虫名称> < 爬虫爬取的域名> 3.运行一个爬虫scrapy craw < 阅读全文
posted @ 2020-02-07 06:30 myrj 阅读(109) 评论(0) 推荐(0)
摘要: 在PY文件中: from scrapy.selector import Selectorfrom scrapy.http import HtmlResponse url="https://m.mm131.net/" r=requests.get(url) r.encoding='gbk' #根据情况 阅读全文
posted @ 2020-02-06 12:36 myrj 阅读(209) 评论(0) 推荐(0)
摘要: 1。在middlewares中添加自己的新类: class Mylei(object): def process_request(self,request,spider): referer=request.url if referer: request.headers["referer"] = re 阅读全文
posted @ 2020-02-06 12:06 myrj 阅读(5233) 评论(0) 推荐(0)
摘要: 1。安装SCRAPY2。进入CMD:执行:SCRAPY显示: Scrapy 1.8.0 - no active project Usage: scrapy <command> [options] [args] Available commands: bench Run quick benchmark 阅读全文
posted @ 2020-02-05 06:45 myrj 阅读(521) 评论(0) 推荐(0)
摘要: >>> a="1">>> b="a">>> print(a,b)1 a>>> print(a,locals()[b])1 1>>>locals() 函数会以字典类型返回当前位置的全部局部变量。>>> print(locals()) {'__name__': '__main__', '__doc__' 阅读全文
posted @ 2020-02-03 17:00 myrj 阅读(534) 评论(0) 推荐(0)
摘要: 中文帮助进入文件夹:1。scrapy startproject mingzi #建立爬虫项目2.scrapy genspider -t crawl ygdy8 ygdy8.com #建立指定爬虫:ygdy8为爬虫名称,ygdy8.com:爬虫允许的范围,即只在这个范围内爬取 3.scrapy cra 阅读全文
posted @ 2020-02-01 15:41 myrj 阅读(250) 评论(0) 推荐(0)