2019年3月22日

摘要: 基于终端指令的持久化存储 基于管道的持久化存储 1.基于终端指令的持久化存储 保证爬虫文件的parse方法中有可迭代类型对象(通常为列表or字典)的返回,该返回值可以通过终端指令的形式写入指定格式的文件中进行持久化操作。 执行输出指定格式进行存储:将爬取到的数据写入不同格式的文件中进行存储 scra 阅读全文
posted @ 2019-03-22 09:29 JintaoMA 阅读(186) 评论(0) 推荐(0)

2019年3月20日

摘要: scrapy框架介绍 环境安装 基础使用 一.什么是Scrapy? Scrapy是一个为了爬取网站数据,提取结构性数据而编写的应用框架,非常出名,非常强悍。所谓的框架就是一个已经被集成了各种功能(高性能异步下载,队列,分布式,解析,持久化等)的具有很强通用性的项目模板。对于框架的学习,重点是要学习其 阅读全文
posted @ 2019-03-20 13:25 JintaoMA 阅读(111) 评论(0) 推荐(0)

2019年3月18日

摘要: 前言 随着移动市场的火热,各大平台都陆陆续续的推出了自己的移动端APP来拉拢吸引和便捷其广大的用户。那么在移动端的平台当时势必会出现大量有价值的信息和数据,那这些数据我们是否可以去享用一下呢?那么接下来就进入我们的移动端APP数据的爬虫中来吧。 今日概要 fiddler简介 手机APP抓包设置 fi 阅读全文
posted @ 2019-03-18 21:53 JintaoMA 阅读(181) 评论(0) 推荐(0)
摘要: 引入 图片懒加载 selenium phantomJs 谷歌无头浏览器 知识点回顾 验证码处理流程 动态数据加载处理 一.图片懒加载 什么是图片懒加载? 案例分析:抓取站长素材http://sc.chinaz.com/中的图片数据 #!/usr/bin/env python # -*- coding 阅读全文
posted @ 2019-03-18 15:54 JintaoMA 阅读(190) 评论(0) 推荐(0)

2019年3月16日

摘要: 引入 相关的门户网站在进行登录的时候,如果用户连续登录的次数超过3次或者5次的时候,就会在登录页中动态生成验证码。通过验证码达到分流和反爬的效果。 使用云打码平台识别验证码 session的创建方式 session的作用 proxies参数的作用 高匿,透明代理的区别 云打码平台处理验证码的实现流程 阅读全文
posted @ 2019-03-16 13:11 JintaoMA 阅读(161) 评论(0) 推荐(0)

2019年3月13日

摘要: session处理cookie proxies参数设置请求代理ip 基于线程池的数据爬取 xpath的解析流程 bs4的解析流程 常用xpath表达式 常用bs4解析方法 引入 有些时候,我们在使用爬虫程序去爬取一些用户相关信息的数据(爬取张三“人人网”个人主页数据)时,如果使用之前requests 阅读全文
posted @ 2019-03-13 16:28 JintaoMA 阅读(202) 评论(0) 推荐(0)

2019年3月12日

摘要: 引入 回顾requests实现数据爬取的流程 指定url 基于requests模块发起请求 获取响应对象中的数据 进行持久化存储 其实,在上述流程中还需要较为重要的一步,就是在持久化存储之前需要进行指定数据解析。因为大多数情况下的需求,我们都会指定去使用聚焦爬虫,也就是爬取页面中指定部分的数据值,而 阅读全文
posted @ 2019-03-12 23:03 JintaoMA 阅读(313) 评论(0) 推荐(0)

2019年3月11日

摘要: 引入 Requests 唯一的一个非转基因的 Python HTTP 库,人类可以安全享用。 警告:非专业使用其他 HTTP 库会导致危险的副作用,包括:安全缺陷症、冗余代码症、重新发明轮子症、啃文档症、抑郁、头疼、甚至死亡。 今日概要 基于requests的get请求 基于requests模块的p 阅读全文
posted @ 2019-03-11 12:06 JintaoMA 阅读(399) 评论(0) 推荐(0)

2019年3月7日

摘要: Python基础篇 1:为什么学习Python 2:通过什么途径学习Python 3:谈谈对Python和其他语言的区别 Python的优势: 4:简述解释型和编译型编程语言 5:Python的解释器种类以及相关特点? 6:位和字节的关系 7:b、B、KB、MB、GB的关系 8:PE8规范 9:通过 阅读全文
posted @ 2019-03-07 17:21 JintaoMA 阅读(490) 评论(0) 推荐(0)

2019年3月6日

摘要: 爬虫介绍 引入 之前在授课过程中,好多同学都问过我这样的一个问题:为什么要学习爬虫,学习爬虫能够为我们以后的发展带来那些好处?其实学习爬虫的原因和为我们以后发展带来的好处都是显而易见的,无论是从实际的应用还是从就业上。 我们都知道,当前我们所处的时代是大数据的时代,在大数据时代,要进行数据分析,首先 阅读全文
posted @ 2019-03-06 19:18 JintaoMA 阅读(116) 评论(0) 推荐(0)

导航