文章分类 -  Python

摘要:创建一个新项目comment: items.py spider.py pipelines.py middlewares.py settings.py 注意: 请把COOKIES_ENABLED设置为 False,你可能觉得奇怪,为什么我们使用了cookie却需要把它设置为False,原因在于,我们直 阅读全文
posted @ 2018-05-01 23:10 wbinbin 阅读(552) 评论(0) 推荐(0)
摘要:设置随机IPProxy 同样的你想要设置IPProxy ,首先需要找到可用的IPProxy ,通常情况下,一些代理网站会提供一些免费的ip代理,但是其稳定性和可用性很难得到保证,但是初学阶段,只能硬着头皮去找了,当然后期我们可以有其他的方法来寻找可用的IP代理,拿到可用的IPProxy 以后,将其添 阅读全文
posted @ 2018-05-01 22:30 wbinbin 阅读(1435) 评论(0) 推荐(0)
摘要:设置随机User-Agent 既然要用到随机User-Agent,那么我们就要手动的为我们的爬虫准备一批可用的User-Agent,因此首先在settings.py文件中添加如下的信息。 当然,你可以去搜索更多的User-Agent添加进来。 而后,在middlewares.py文件中添加如下的信息 阅读全文
posted @ 2018-05-01 22:25 wbinbin 阅读(521) 评论(0) 推荐(0)
摘要:去重 通过Item Pipeline写一个去重的过滤去: 丢弃那些已经被处理过的item。假设我们的item有一个唯一的id,但是我们spider返回的多个item中包含有相同的id,我们就可以使用集合来去重,下面是一个例子: 文件与图片下载 通过Media Pipeline下载文件(图片)。 启用 阅读全文
posted @ 2018-05-01 22:17 wbinbin 阅读(413) 评论(0) 推荐(0)
摘要:Scrapy提供了如下Spiders: scrapy.spiders.Spider scrapy.spiders.CrawlSpider scrapy.spiders.XMLFeedSpider scrapy.spiders.CSVFeedSpider scrapy.spiders.SitemapS 阅读全文
posted @ 2018-05-01 21:35 wbinbin 阅读(164) 评论(0) 推荐(0)
摘要:爬取cnblog文章信息。 创建项目 命令行执行: cnblog是我们的项目名称。然后会在当前目录多一个文件夹cnblog,目录结构为: 简单介绍下各个文件(夹)的作用: scrapy.cfg 项目的配置文件,带有这个文件的那个目录作为scrapy项目的根目录。 items.py 定义你所要抓取的字 阅读全文
posted @ 2018-05-01 21:19 wbinbin 阅读(160) 评论(0) 推荐(0)
摘要:英文地址:https://docs.scrapy.org/en/latest/intro/overview.html 爬取 爬取http://quotes.toscrape.com中的名言,代码: 保存为quotes_spider.py,然后在当前目录通过scrapy的runspider命令运行这个 阅读全文
posted @ 2018-04-30 23:07 wbinbin 阅读(1753) 评论(0) 推荐(0)
摘要:全局命令 startproject 语法: scrapy startproject <project_name>这个命令是scrapy最为常用的命令之一,它将会在当前目录下创建一个名为 <project_name>的项目。 比如爬取cnblog的网站信息:scrapy startproject cn 阅读全文
posted @ 2018-04-30 22:01 wbinbin 阅读(355) 评论(0) 推荐(0)
摘要:Scrapy是用纯Python实现一个为了爬取网站数据、提取结构性数据而编写的应用框架,用途非常广泛。 框架的力量,用户只需要定制开发几个模块就可以轻松的实现一个爬虫,用来抓取网页内容以及各种图片,非常之方便。 Scrapy 使用了 Twisted'twɪstɪd异步网络框架来处理网络通讯,可以加快 阅读全文
posted @ 2018-04-29 22:49 wbinbin 阅读(168) 评论(0) 推荐(0)
摘要:英文地址:https://doc.scrapy.org/en/latest/intro/tutorial.html 中文地址:https://www.cnblogs.com/ximengchj/p/6423736.html 目的 我们将要抓取 quotes.toscrape.com网站,这个网站展示 阅读全文
posted @ 2018-04-29 21:44 wbinbin 阅读(337) 评论(0) 推荐(0)
摘要:先安装Python3.6 如果本机安装了python2,尽量不要管他,使用python3运行python脚本就好,因为可能有程序依赖目前的python2环境,比如yum!!!!! 不要动现有的python2环境! 1. 安装依赖环境 2.下载Python3 3.安装python3 创建目录: 解压: 阅读全文
posted @ 2018-04-29 10:25 wbinbin 阅读(144) 评论(0) 推荐(0)
摘要:1、安装python3.6.5 2、安装Scrapy 如果出现下面问题,升级pip(因为安装了pythony2.x或者python3.x,pip也已经安装了,只用更新即可) 升级命令: 查看pip版本命令: 3、校验Scrapy安装成功 命令行中输入 scrapy -version,查看输出结果即可 阅读全文
posted @ 2018-04-29 10:14 wbinbin 阅读(165) 评论(0) 推荐(0)
摘要:还是依赖第三方包,发现Python就这点好呢,需要的功能都是找个包完事,好无趣啊~ 1安装 可以通过以下命令查看是够安装成功 2直接代码吧 3其他 还有其他的功能,需要的时候自己查吓得了~ 阅读全文
posted @ 2018-04-23 22:30 wbinbin 阅读(105) 评论(0) 推荐(0)
摘要:1获取股票列表 从东方财富网中获取股票代码列表:http://quote.eastmoney.com/stocklist.html 查看源代码: 2获取股票值 3代码 4说明 来源:https://segmentfault.com/a/1190000010520835 这个比较简单,记录下来作为一般 阅读全文
posted @ 2018-04-21 00:00 wbinbin 阅读(304) 评论(0) 推荐(0)
摘要:1说明 目标地址:http://www.luoo.net/music/中指定期数的音乐资源 例如:http://www.luoo.net/vol/index/1368 2知识点 requests:比urllib更简单 faker:模拟UA请求 queue:队列,注意Python3.x中是import 阅读全文
posted @ 2018-04-20 23:32 wbinbin 阅读(914) 评论(0) 推荐(0)
摘要:实现的功能 获取www.cnblogs.com首页的帖子。 1、安装插件 采用bs4.BeautifulSoup替代正则表达式,安装命令: 2、爬取接口数据 接口参数查看: crawl_html.py 3、解析数据 content_parser.py 4、存储数据 存储为json文件,write2j 阅读全文
posted @ 2018-04-20 00:01 wbinbin 阅读(724) 评论(0) 推荐(0)
摘要:1解释 __name__是内置变量,用于表示当前模块的名字,同时还能反映一个包的结构。 当Python文件直接作为脚本执行时,__name__值为__main__;当Python文件被import到其他的python脚本中,__name__值为包结构加上文件名。 2例子 其中name,aa,bb中代 阅读全文
posted @ 2018-04-19 21:04 wbinbin 阅读(130) 评论(0) 推荐(0)
摘要:代码 {"errorCode":50} 的解决办法 去除url里面的_o字段,就可以解决问题 阅读全文
posted @ 2018-04-19 13:01 wbinbin 阅读(131) 评论(0) 推荐(0)
摘要:1直接代码 2获取网页编码的方式 有很多,推荐一种最方便的,安装第三方库chardet,它是用来判断编码的模块,安装方法cmd->输入指令: 然后就可以代码实现了: 阅读全文
posted @ 2018-04-19 10:11 wbinbin 阅读(152) 评论(0) 推荐(0)
摘要:1说明 下载PyCharm集成开发软件,官网提供了两种版本: Professional Edition(专业版可以试用30天,可以寻找破解版本,或淘宝购买注册帐号,一般10-20元), Community Edition(社区版,功能少一点但也够用了)。 2下载和安装 地址:http://www.j 阅读全文
posted @ 2018-04-18 23:49 wbinbin 阅读(123) 评论(0) 推荐(0)