随笔分类 - 爬虫
python全栈 day107--day111
摘要:破解知乎登陆(js逆向和解密) data={ client_id=c3cef7c66a1843f8b3a9e6a1e3160e20& grant_type=password& timestamp=1596702006088& source=com.zhihu.web& signature=eac4a
阅读全文
摘要:1 scrapy 介绍安装 # 1.介绍 通用的网络爬虫框架, 爬虫界的django,也可用于如数据挖掘、监测和自动化测试等领域 Scrapy 是基于twisted框架开发而来,twisted是一个流行的事件驱动的python网络框架 (性能比较高的框架)。 因此Scrapy使用了一种非阻塞(又名异
阅读全文
摘要:1 selenium库 # selenium是一个Web自动化测试工具 爬虫中使用它主要是为了解决requests无法直接执行JavaScript代码的问题 # 作用:操作浏览器,模拟人的行为,支持多种浏览器 from selenium import webdriver browser=webdri
阅读全文
摘要:0 bs4常用解析器 # bs4:解析xml格式的模块,从xml中找想要的数据 使用requests返回的数据,可能是json,html,文件 》使用bs4解析html格式 # html是xml的一种, 故bs4可以解析html # 两种常用解析器 from bs4 import Beautiful
阅读全文
摘要:1 爬取梨视频 """ 优化:爬取梨视频 1.封装 2.多线程 """ import json import random from concurrent.futures import ThreadPoolExecutor import redis import requests from bs4
阅读全文
摘要:1.requests之ssl,超时设置,认证设置,处理异常,上传文件 (了解) # http+ssl=https :传输过程中加密了 》截获到,无法解密 # ssl证书:第三方证书 # 证书验证(大部分网站都是https) import requests respone=requests.get('
阅读全文

浙公网安备 33010602011771号