随笔分类 -  Python3网络开发爬虫实战

摘要:一.介绍pyquery 上面介绍了Beautiful Soup的使用方法,会发现CSS选择器并没有那么强大,接下来 学习pyquery弥补了CSS选择器的 安装: pip install pyquery 二.基本使用 html =''' <!DOCTYPE html> <html> <head> < 阅读全文
posted @ 2020-04-21 18:03 Crown-V 阅读(235) 评论(0) 推荐(0)
摘要:一.简介 二.安装命令 pip install beautifulsoup4 三.基本使用 1.基本使用 html =''' <!DOCTYPE html> <html> <head> <title>故事</title> </head> <body> <p class="title" name="d 阅读全文
posted @ 2020-04-21 14:17 Crown-V 阅读(242) 评论(0) 推荐(0)
摘要:一.Selenium使用 Selenium是一个自动化测试工具,利用它可以驱动浏览器执行特定的动作,如点击、下拉等 操作,同时还可以获取浏览器当前呈现的页面的源代码,做到可见即可爬。对于一些Javascript 动态渲染的页面来说,此种抓取方式非常有效。 二.配置 1.下载对应浏览器chromedr 阅读全文
posted @ 2020-04-21 10:46 Crown-V 阅读(561) 评论(0) 推荐(0)
摘要:一.XPath简介 对网页的层级关系进行解析,XPath的选择功能十分强大,它提供了非常简洁明了的路径选择表达式。 另外,它还提供了超过100个内建函数,用于字符串、数值、时间的匹配以及节点、序列的处理等, 几乎所有的定位节点,都可以用XPath进行选择。 官网: https://www.w3.or 阅读全文
posted @ 2020-04-18 14:59 Crown-V 阅读(2282) 评论(0) 推荐(0)
摘要:一.正则表达式测试网址 http://tool.oschina.net/regex/ 网页格式:https://tool.oschina.net/codeformat/html 二.正则表达式常用匹配规则 三.Python3的三种匹配 1.match()方法 match方法只能从匹配字符的开头进行匹 阅读全文
posted @ 2020-04-13 10:47 Crown-V 阅读(552) 评论(0) 推荐(0)
摘要:一.状态码 二.基本使用 """ requests第三方库: pip install requests req参数: cookie cookies json[json数据格式] text[文本] content[二进制] status_code[请求状态码] headers[请求头] url[网址] 阅读全文
posted @ 2020-04-07 11:57 Crown-V 阅读(416) 评论(0) 推荐(0)
该文被密码保护。
posted @ 2020-04-06 17:08 Crown-V 阅读(4) 评论(0) 推荐(0)
摘要:一.urllib的结构 二.Python的urllib.request 1.request的基本使用 #导入urllib request库 import urllib.request #爬取的网站地址 url = "https://www.baidu.com" #请求打开网址 response = 阅读全文
posted @ 2020-03-04 15:28 Crown-V 阅读(321) 评论(0) 推荐(0)