1 2 3 4 5 ··· 17 下一页
摘要: 我们一般会以//开头的XPath规则,来选取所有符合要求的节点。 这里还是以第一个实例中的HTML文本为例,选取其中所有的节点,实现代码如下: from lxml import etree html = etree.parse("test.html",etree.HTMLParser()) resu 阅读全文
posted @ 2026-09-26 20:13 abner_pan 阅读(2) 评论(0) 推荐(0)
摘要: 实例代码如下: from lxml import etree text = ''' <div> <ul> <li class="item-0"><a href="link1.html">first item</a></li> <li class="item-1"><a href="link2.htm 阅读全文
posted @ 2026-09-26 19:55 abner_pan 阅读(2) 评论(0) 推荐(0)
摘要: 阅读全文
posted @ 2026-09-20 22:29 abner_pan 阅读(4) 评论(0) 推荐(0)
摘要: 这里列出了XPath的一个常用匹配规则,如下: //title[@lang='eng'] 它代表选择所有名称为title,同时属性lang的值为eng的节点。 阅读全文
posted @ 2026-09-20 22:24 abner_pan 阅读(4) 评论(0) 推荐(0)
摘要: - XPath的全称是XML Path Language,即XML路径语言,用来在XML文档中查找信息。 - 它虽然最初是用来搜寻XML文档的,但同样适用于HTML文档的搜索 - 所以在做爬虫时,我们完全可以使用XPath实现相应的信息抽取 - XPath的选择功能十分强大,它提供了非常简洁明了的路 阅读全文
posted @ 2026-09-20 22:18 abner_pan 阅读(5) 评论(0) 推荐(0)
摘要: 阅读全文
posted @ 2026-09-20 21:58 abner_pan 阅读(5) 评论(0) 推荐(0)
摘要: - 将数据保存为TXT文本的操作非常简单,而且TXT文本几乎兼容任何平台,但是也有一个缺点,就是不利于检索。 - 所以如果对检索和数据结构的要求不高,追求方便第一的话,就可以采用TXT文件存储 阅读全文
posted @ 2026-09-20 21:56 abner_pan 阅读(4) 评论(0) 推荐(0)
摘要: 阅读全文
posted @ 2026-09-20 21:44 abner_pan 阅读(3) 评论(0) 推荐(0)
摘要: 现在是要在客户端上开启对HTTP/2.0的支持,就像“基本使用”小节所说的那样,同样是声明Client对象,然后将http2参数设置为True,如果不设置,那么默认支持HTTP/1.1,即不开启对HTTP/2.0的支持。 写法如下: import httpx url = 'https://httpb 阅读全文
posted @ 2026-09-20 20:48 abner_pan 阅读(5) 评论(0) 推荐(0)
摘要: httpx中有一些基本的API和requests中的非常相似,但也有一些API是不相似的,例如httpx中有一个client对象,就可以和requests中的Session对象类比学习。 下面我们介绍Client对象的使用。官方比较推荐的使用方式是with as语句,示例如下: import htt 阅读全文
posted @ 2026-09-20 19:59 abner_pan 阅读(3) 评论(0) 推荐(0)
1 2 3 4 5 ··· 17 下一页