随笔分类 -  爬虫

python全栈 day107--day111
摘要:破解知乎登陆(js逆向和解密) data={ client_id=c3cef7c66a1843f8b3a9e6a1e3160e20& grant_type=password& timestamp=1596702006088& source=com.zhihu.web& signature=eac4a 阅读全文
posted @ 2022-06-17 17:20 Edmond辉仔 阅读(857) 评论(0) 推荐(0)
摘要:1 scrapy 介绍安装 # 1.介绍 通用的网络爬虫框架, 爬虫界的django,也可用于如数据挖掘、监测和自动化测试等领域 Scrapy 是基于twisted框架开发而来,twisted是一个流行的事件驱动的python网络框架 (性能比较高的框架)。 因此Scrapy使用了一种非阻塞(又名异 阅读全文
posted @ 2022-06-13 00:19 Edmond辉仔 阅读(185) 评论(0) 推荐(0)
摘要:1 selenium库 # selenium是一个Web自动化测试工具 爬虫中使用它主要是为了解决requests无法直接执行JavaScript代码的问题 # 作用:操作浏览器,模拟人的行为,支持多种浏览器 from selenium import webdriver browser=webdri 阅读全文
posted @ 2022-06-05 18:09 Edmond辉仔 阅读(140) 评论(0) 推荐(0)
摘要:0 bs4常用解析器 # bs4:解析xml格式的模块,从xml中找想要的数据 使用requests返回的数据,可能是json,html,文件 》使用bs4解析html格式 # html是xml的一种, 故bs4可以解析html # 两种常用解析器 from bs4 import Beautiful 阅读全文
posted @ 2022-05-31 17:13 Edmond辉仔 阅读(163) 评论(0) 推荐(0)
摘要:1 爬取梨视频 """ 优化:爬取梨视频 1.封装 2.多线程 """ import json import random from concurrent.futures import ThreadPoolExecutor import redis import requests from bs4 阅读全文
posted @ 2022-05-30 16:41 Edmond辉仔 阅读(52) 评论(0) 推荐(0)
摘要:1.requests之ssl,超时设置,认证设置,处理异常,上传文件 (了解) # http+ssl=https :传输过程中加密了 》截获到,无法解密 # ssl证书:第三方证书 # 证书验证(大部分网站都是https) import requests respone=requests.get(' 阅读全文
posted @ 2022-05-27 17:01 Edmond辉仔 阅读(220) 评论(0) 推荐(0)