关于Python Scrapy的一些重要基础操作和细节的总结
一、基本的 创建一个Scrapy工程
(1)基本命令
1.创建一个scrapy项目
scrapy startproject <项目名字>
2.生成一个爬虫
scrapy genspider <爬虫名字> <爬虫范围>
示例:
scrapy genspider itcast itcast.cn
3.提取数据
完善spider,使用xpath等方法
4.保存数据
pipeline中保存数据
5.启动爬虫
scrapy crawl <爬虫名字>
(2)配置细节
1.代理
打开settings.py文件 找到USER_AGENT配置,可以在浏览器这个地方找或者在网上找一个


注意这个也要改为域名,否则运行失败
2.简易配置
编写一个main在scrapy目录
from scrapy import cmdline
cmdline.execute('scrapy crawl <爬虫名字>'.split())
可以直接不用指令 来运行这个scarpy

浙公网安备 33010602011771号