随笔分类 - Python3网络开发爬虫实战
摘要:一.介绍pyquery 上面介绍了Beautiful Soup的使用方法,会发现CSS选择器并没有那么强大,接下来 学习pyquery弥补了CSS选择器的 安装: pip install pyquery 二.基本使用 html =''' <!DOCTYPE html> <html> <head> <
阅读全文
摘要:一.简介 二.安装命令 pip install beautifulsoup4 三.基本使用 1.基本使用 html =''' <!DOCTYPE html> <html> <head> <title>故事</title> </head> <body> <p class="title" name="d
阅读全文
摘要:一.Selenium使用 Selenium是一个自动化测试工具,利用它可以驱动浏览器执行特定的动作,如点击、下拉等 操作,同时还可以获取浏览器当前呈现的页面的源代码,做到可见即可爬。对于一些Javascript 动态渲染的页面来说,此种抓取方式非常有效。 二.配置 1.下载对应浏览器chromedr
阅读全文
摘要:一.XPath简介 对网页的层级关系进行解析,XPath的选择功能十分强大,它提供了非常简洁明了的路径选择表达式。 另外,它还提供了超过100个内建函数,用于字符串、数值、时间的匹配以及节点、序列的处理等, 几乎所有的定位节点,都可以用XPath进行选择。 官网: https://www.w3.or
阅读全文
摘要:一.正则表达式测试网址 http://tool.oschina.net/regex/ 网页格式:https://tool.oschina.net/codeformat/html 二.正则表达式常用匹配规则 三.Python3的三种匹配 1.match()方法 match方法只能从匹配字符的开头进行匹
阅读全文
摘要:一.状态码 二.基本使用 """ requests第三方库: pip install requests req参数: cookie cookies json[json数据格式] text[文本] content[二进制] status_code[请求状态码] headers[请求头] url[网址]
阅读全文
摘要:一.urllib的结构 二.Python的urllib.request 1.request的基本使用 #导入urllib request库 import urllib.request #爬取的网站地址 url = "https://www.baidu.com" #请求打开网址 response =
阅读全文

浙公网安备 33010602011771号