文章分类 - 爬虫
Python 协程 asyncio 极简入门与爬虫实战
摘要:在了解了 Python 并发编程的多线程和多进程之后,我们来了解一下基于 asyncio 的异步IO编程--协程 01 协程简介 协程(Coroutine)又称微线程、纤程,协程不是进程或线程,其执行过程类似于 Python 函数调用,Python 的 asyncio 模块实现的异步IO编程框架中,
阅读全文
爬取全国火锅店数量,并利用地图可视化展示
摘要:获取全国不同城市火锅店数量情况,并将这些数据进行可视化展示,以更加直观的方式去浏览全国不同省份、不同城市的火锅店分布情况。 数据来自于某度地图,通过python技术知识去获取数据并进行可视化。 1 网页分析 首先先看一下数据源,在某度地图里面按照下方操作,就可以请求到全国的火锅店情况(从下图来看没有
阅读全文
爬取全国40城5000+地铁站点数据
摘要:有时候,爬虫爬到的数据是很珍贵、很稀缺,但是在实际项目最好还是多点谨慎,保证万无一失。 今天介绍一种新的 获取城市地铁站点数据的方法,而且不再只是北上广深四个城市,而是 全国开通地铁的城市。 对了,你觉得全国有多少个城市开通了地铁? 爬取数据的链接是:http://map.amap.com/subw
阅读全文
超全开源爬虫工具箱 InfoSpider
摘要:现在一般网站都有反爬虫机制,对于爱爬虫的朋友来说,想爬虫些数据,做下数据分析。是越来越难了。不过最近我们,发现一个超宝藏的爬虫工具箱。 这个爬虫工具箱有多火呢? 开源没几天就登上GitHub周榜第四,标星1.3K,累计分支 172 个。同时作者已经开源了所有的项目代码及使用文档,并且在B站上还有使用
阅读全文
爬虫 异步数据写入scrapy框架 (adbapi)
摘要:数据库pymysql的commit()和execute()在提交数据时,都是同步提交至数据库,由于scrapy框架数据的解析和异步多线程的,所以scrapy的数据解析速度,要远高于数据的写入数据库的速度。如果数据写入过慢,会造成数据库写入的阻塞,影响数据库写入的效率。 通过多线程异步的形式对数据进行
阅读全文
爬虫之scrapy下载文件和图片
摘要:一:下载文件的 Files Pipeline 使用Files Pipeline下载文件,按照以下步骤完成: 定义好一个Item,然后在这个item中定义两个属性,分别为file_urls以及files。files_urls是用来存储需要下载的文件的url链接,需要给一个列表 当文件下载完成后,会把文
阅读全文
Python执行js代码(execjs模块)
摘要:pip install PyExecJS 配置 该模块需要JS运行时环境 以下JS runtime经过官方测试认可,建议采用 PyV8:一个调用Google V8引擎的Python模块 Node.js 本文采用该运行时 PhantomJS Nashorn 以下JS runtime也支持但未经过官方测
阅读全文
爬虫之多线程爬虫
摘要:多线程爬虫 有些时候,比如下载图片,因为下载图片是一个耗时的操作。如果采用之前那种同步的方式下载。那效率肯会特别慢。这时候我们就可以考虑使用多线程的方式来下载图片。 多线程是为了同步完成多项任务,通过提高资源使用效率来提高系统的效率。线程是在同一时间需要完成多项任务的时候实现的。最简单的比喻多线程就
阅读全文
抓包工具mitmproxy
摘要:目录: mitmproxy简介 安装 Windows上使用mitmproxy mitmweb的使用 Linux上使用mitmproxy mitmproxy简介 mitmproxy 是一个免费开源的交互式HTTPS代理。 github地址:https://github.com/mitmproxy/mi
阅读全文
23个Python爬虫开源项目代码
摘要:1、WechatSogou – 微信公众号爬虫 基于搜狗微信搜索的微信公众号爬虫接口,可以扩展成基于搜狗搜索的爬虫,返回结果是列表,每一项均是公众号具体信息字典。 github地址: https://github.com/Chyroc/WechatSogou 2、DouBanSpider – 豆瓣读
阅读全文
爬虫之SSL认证处理
摘要:SSL ssl证书就是指遵守ssl安全套阶层协议的服务器数字证书(SercureSocketLayer) 美国网景公司开发 使用ssl,加密信息 俗称https协议 CA(CertificateAuthority)是数字证书任重中心,是发放,管理,废除数字证书的收信人的第三方机构 遇到不信任的SSL
阅读全文
爬取王者荣耀所有英雄的皮肤
摘要:刷新网页 重新接收所有网页数据 刷新后在Network下会看到所有的数据重新加载出来 找到名为【herolist.json】的json文件(有两个随便选中一个就行 看右边会有这个文件的说明 复制这个json文件的URL地址: 浏览器打开一个新窗口将地址粘贴进去,此时浏览器会自动下载【herolist
阅读全文
爬虫之paused in debugger解决办法汇总
摘要:paused in debugger是指按f12打开开发者工具后,功能受限的一种情况,如图所示: 网上的解决方法也有很多,这里汇总了一下。 方法一: 多按几次f8或者点击如下图中的蓝色按钮。 该按钮的功能是继续执行脚本(resume script execution),因为现在相当于设置了断点。 方
阅读全文
爬虫面试案例系列01
摘要:爬虫面试案例系列01 ### 需求:爬取https://m.vmall.com/help/hnrstoreaddr.htm荣耀线下门店中的门店详情信息。页面显示如下: - 首页显示 - 详情页显示 ### 基于抓包工具分析如下: - ### 查看定位到数据包的请求头信息: - 请求的url和请求方式
阅读全文
爬虫之中国空气质量在线监测平台加密数据爬取
摘要:中国空气质量在线监测平台加密数据爬取 - 中国空气质量在线监测分析平台是一个收录全国各大城市天气数据的网站,包括温度、湿度、PM 2.5、AQI 等数据,链接为:https://www.aqistudy.cn/html/city_detail.html,网站显示为: 该网站所有的空气质量数据都是基于
阅读全文
爬虫之pyppeteer模块的基本使用
摘要:引言 Selenium 在被使用的时候有个麻烦事,就是环境的相关配置,得安装好相关浏览器,比如 Chrome、Firefox 等等,然后还要到官方网站去下载对应的驱动,最重要的还需要安装对应的 Python Selenium 库,确实是不是很方便,另外如果要做大规模部署的话,环境配置的一些问题也是个
阅读全文
爬虫之高性能异步爬虫
摘要:爬虫中使用异步实现高性能的数据爬取操作。 背景 其实爬虫的本质就是client发请求批量获取server的响应数据,如果我们有多个url待爬取,只用一个线程且采用串行的方式执行,那只能等待爬取一个结束后才能继续下一个,效率会非常低。需要强调的是:对于单线程下串行N个任务,并不完全等同于低效,如果这N
阅读全文
爬虫之scrapy框架
摘要:目录: 一、scrapy框架简介 二、环境安装及基本使用 三、scrapy框架持久化存储 四、scrapy框架之递归解析、五大核心组件工作流程、post请求 五、scrapy框架之日志等级、请求传参、提高scrapy工作效率的方法 六、scrapy框架之scrapy下载中间件、UA池、代理池 七、s
阅读全文
爬虫之线程池concurrent.futures的使用
摘要:线程池爬取梨视频 简单示例: #爬取梨视频数据 import requests import re from lxml import etree from multiprocessing.dummy import Pool import random def getVideoData(url): r
阅读全文
爬虫之反爬机制及代理IP
摘要:反爬机制: robots.txt协议 UA检测、referer检测 数据加密 图片懒加载 ip检测 验证码识别 字体反爬虫 可以使用Python的urllib模块查看robots.txt from urllib import robotparser rp = robotparser.RobotFil
阅读全文
浙公网安备 33010602011771号