摘要:
HTTP中最常见的请求之一就是GET请求,首先来详细了解一下利用requests库构建GET请求的方法 基本实例 下面构建一个最简单的GET请求,请求的链接为https://www.httpbin.org/get ,该网站会判断客户端发起的是否为GET请求,如果是,那么它将返回相应的请求信息: im 阅读全文
posted @ 2026-09-12 20:49
abner_pan
阅读(7)
评论(0)
推荐(0)
摘要:
urllib库中的urlopen方法实际上是以GET方式请求网页,requests库中响应的方法就是get方法,是不是感觉表意更直接一些?下面通过实例来看一下: import requests r = requests.get('http://www.baidu.com') print(type(r 阅读全文
posted @ 2026-09-12 18:12
abner_pan
阅读(5)
评论(0)
推荐(0)
摘要:
requests库的安装 pip3 install requests 阅读全文
posted @ 2026-09-12 18:02
abner_pan
阅读(6)
评论(0)
推荐(0)
摘要:
robotparser 了解Robots协议之后,就可以使用robotparser模块来解析robots.txt文件了。该模块提供了一个类RobotFileParser,它可以根据某网站的robots.txt文件判断一个爬取爬虫是否有权限爬取这个网页。 该类用起来非常简单,只需要在构造方法里传入ro 阅读全文
posted @ 2026-09-12 15:03
abner_pan
阅读(7)
评论(0)
推荐(0)
摘要:
爬虫名称 大家可能会有疑惑,爬虫名是从哪里来的?为什么叫这个名?其实爬虫是有固定名字的,例如百度的爬虫叫做BaiduSpider. 如下表列出了一些常见搜索爬虫的名称及对应的网站。 阅读全文
posted @ 2026-09-12 12:41
abner_pan
阅读(7)
评论(0)
推荐(0)
摘要:
Robots协议 Robots协议也称作爬虫协议、机器人协议,全名为网络爬虫排除标准(Robots Exclusion Protocol),用来告诉爬虫和搜索引擎哪些网页可以爬取,哪些不可以。 它通常是一个叫做robots.txt的文本文件,一般放在网站的根目录下。 搜索爬虫在访问一个站点时,首先会 阅读全文
posted @ 2026-09-12 09:23
abner_pan
阅读(5)
评论(0)
推荐(0)
摘要:
unquote 有了quote方法,当然就有unquote方法,它可以进行URL解码,实例如下: from urllib.parse import unquote url = 'www.baidu.com/s?wd=%E6%A2%A6%E5%B9%BB%E8%A5%BF%E6%B8%B8' prin 阅读全文
posted @ 2026-09-12 09:11
abner_pan
阅读(9)
评论(0)
推荐(0)
摘要:
quote 该方法可以将内容转化为URL编码的格式。当URL中带有中文参数时,有可能导致乱码问题,此时用quote方法可以将中文符转化为URL编码,实例如下: from urllib.parse import quote kw = '梦幻西游' url = 'www.baidu.com/s?wd=' 阅读全文
posted @ 2026-09-12 09:06
abner_pan
阅读(8)
评论(0)
推荐(0)
摘要:
1.parse_qsl parse_qsl方法用于将参数转化为由元组组成的列表,实例如下: from urllib.parse import parse_qsl query_string = 'name=abner&age=25' print(parse_qsl(query_string)) 运行结 阅读全文
posted @ 2026-09-12 09:01
abner_pan
阅读(5)
评论(0)
推荐(0)

浙公网安备 33010602011771号