爬虫基础

第三方依赖库

requests:一个方便、简洁、高效且人性化的HTTP请求库,用来模仿浏览器发送请求的工具,就是不通过浏览器,就可以获取想要的网页数据
BeautifulSoup:HTML解析库
pymongo:MongoDB的Python封装模块
selenium:一个Web自动化测试框架,用于模拟登录和获取JS动态数据
pytesseract:一个OCR识别模块,用于验证码识别
Pillow:Python图像处理模块

 

requests官方文档(中文): http://docs.python-requests.org/zh_CN/latest/


BeautifulSoup文档(中文):
https://www.crummy.com/software/BeautifulSoup/bs4/doc/index.zh.html

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

网页分为 动态页面和 静态页面

动态页面:网页内容发生变化,但是网址没有变化(动态页面必须抓包处理)

静态页面:网页内容有变化,网站也发生变化

 

posted @ 2019-01-18 21:06  粗糙的丸子  阅读(75)  评论(0)    收藏  举报