08 2017 档案
摘要:一、前言 俗话说,上班时间是公司的,下班了时间才是自己的。搞点事情,写个爬虫程序,每天定期爬取点段子,看着自己爬的段子,也是一种乐趣。 二、Python爬取嗅事百科段子 1.确定爬取的目标网页 首先我们要明确目标,本次爬取的是糗事百科文字模块的段子。 (糗事百科)->分析目标(策略:url格式(范围
阅读全文
摘要:一、Python正则表达式的基本使用 Python 3 使用re模块可以实现大部分的正则表达式情况。 1.re.compile(pattern, flags=0) re.compile构建匹配规则并返回一个正则表达式对象,这样的好处就是可以多次使用这个匹配规则,通过调用它的match()和searc
阅读全文
摘要:一、Python lxml的基本应用 1.使用lxml.etree和lxml.cssselect解析html源码 2.cleaning up html 使用html清理器,可以移除一些嵌入的脚本、标签、CSS样式等html元素,这样可以提高搜索效率。 二、Python lxml的实际应用 1.解析网
阅读全文
摘要:一、BeautifulSoup的基本使用 二、BeautifulSoup的实际应用 1.解析网易云音乐html源码 这是网易云音乐华语歌曲的分类链接http://music.163.com/#/discover/playlist/?order=hot&cat=华语&limit=35&offset=0
阅读全文
摘要:一、随时随地爬取一个网页下来 怎么爬取网页?对网站开发了解的都知道,浏览器访问Url向服务器发送请求,服务器响应浏览器请求并返回一堆HTML信息,其中包括html标签,css样式,js脚本等。我们之前用的是Python标准基础库Urllib实现的, 现在我们使用Python的Requests HTT
阅读全文

浙公网安备 33010602011771号