摘要:
Robots协议 Robots协议也称作爬虫协议、机器人协议,全名为网络爬虫排除标准(Robots Exclusion Protocol),用来告诉爬虫和搜索引擎哪些网页可以爬取,哪些不可以。 它通常是一个叫做robots.txt的文本文件,一般放在网站的根目录下。 搜索爬虫在访问一个站点时,首先会 阅读全文
posted @ 2026-09-12 09:23
abner_pan
阅读(5)
评论(0)
推荐(0)
摘要:
unquote 有了quote方法,当然就有unquote方法,它可以进行URL解码,实例如下: from urllib.parse import unquote url = 'www.baidu.com/s?wd=%E6%A2%A6%E5%B9%BB%E8%A5%BF%E6%B8%B8' prin 阅读全文
posted @ 2026-09-12 09:11
abner_pan
阅读(7)
评论(0)
推荐(0)
摘要:
quote 该方法可以将内容转化为URL编码的格式。当URL中带有中文参数时,有可能导致乱码问题,此时用quote方法可以将中文符转化为URL编码,实例如下: from urllib.parse import quote kw = '梦幻西游' url = 'www.baidu.com/s?wd=' 阅读全文
posted @ 2026-09-12 09:06
abner_pan
阅读(6)
评论(0)
推荐(0)
摘要:
1.parse_qsl parse_qsl方法用于将参数转化为由元组组成的列表,实例如下: from urllib.parse import parse_qsl query_string = 'name=abner&age=25' print(parse_qsl(query_string)) 运行结 阅读全文
posted @ 2026-09-12 09:01
abner_pan
阅读(4)
评论(0)
推荐(0)

浙公网安备 33010602011771号