摘要: 爬取网页上的内容,如何从内容中提取数据 HTML 文档本身是结构化的文本,有一定的规则,通过它的结构可以简化信息提取。于是,就有了lxml、pyquery、BeautifulSoup等网页信息提取库。一般我们会用这些库来提取网页信息。其中,lxml 有很高的解析效率,支持 xPath 语法(一种可以 阅读全文
posted @ 2021-04-28 14:59 _cai 阅读(128) 评论(0) 推荐(0)