随笔分类 - Spider
摘要:官方文档:https://selenium-python.readthedocs.io/ Selenium:自动化测试工具,支持多种浏览器。爬虫中主要用来解决JavaScript渲染的问题。 一、开始 基本使用 from selenium import webdriver from selenium
阅读全文
摘要:官方文档:https://pyquery.readthedocs.io/en/latest/ PyQuery是一个强大又灵活的网页解析库。如果你觉得正则写起来太麻烦、BeautifulSoup语法太难记,而你熟悉jQury的语法,那么PyQuery就是你的绝佳选择。 一、开始 字符串初始化: URL
阅读全文
摘要:文档:https://beautifulsoup.readthedocs.io/zh_CN/latest/ 一、开始 解析库 基本使用 html = """ <html> <head> <title>The Dormouse's story</title> </head> <body> <p cla
阅读全文
摘要:官方文档:http://cn.python-requests.org/zh_CN/latest/ 一、引子 各种请求方式: 二、请求 GET请求 基本写法: 带参数get请求: 解析json: 获取二进制数据: 添加请求头: POST请求 基本操作: 添加请求头: 三、响应 响应属性: 状态码判断:
阅读全文
摘要:一、常见匹配模式 二、re.match re.match 尝试从字符串的起始位置匹配一个模式,如果不是起始位置匹配成功的话,match()就返回none 最常规的匹配 import re content = "Hello 123 4567 World_This is a Regex Demo" pr
阅读全文
摘要:建议更换pip源到国内镜像,下载会快很多:https://www.cnblogs.com/believepd/p/10499844.html requests selenium 安装好后,测试一下: 执行后报错了: 需要安装chromedriver才能完成chrome浏览器的驱动。 可以从这里下载适
阅读全文

浙公网安备 33010602011771号