爬虫解析库

解析   ------->正则,beautifulsoup

解析库正则

 

 

 

 

解析库—Beautifulsoup

1、介绍

  Beautiful Soup 是一个可以从HTML或XML文件中提取数据的Python库.它能够通过你喜欢的转换器实现惯用的文档导航,查找,修改文档的方式。更多详情

2、安装

①安装Beautiful Soup

  pip install beautifulsoup

②安装解析器

lxml解析器

  Beautiful Soup支持Python标准库中的HTML解析器,还支持一些第三方的解析器,其中一个是 lxml .根据操作系统不同,可以选择下列方法来安装lxml:

  $ apt-get install Python-lxml   

  $ easy_install lxml  

  $ pip install lxml

html5lib解析器

  另一个可供选择的解析器是纯Python实现的 html5lib , html5lib的解析方式与浏览器相同,可以选择下列方法来安装html5lib:

  $ apt-get install Python-html5lib

  $ easy_install html5lib

  $ pip install html5lib

  

  官网推荐使用lxml作为解析器,因为效率更高. 在Python2.7.3之前的版本和Python3中3.2.2之前的版本,必须安装lxml或html5lib, 因为那些Python版本的标准库中内置的HTML解析方法不够稳定.

 3、基本使用

 

posted @ 2018-01-14 11:46  panda_R  阅读(28)  评论(0)    收藏  举报