随笔分类 - python爬虫
爬啊爬,不能学再多了!
摘要:1生成项目:生成项目文件夹 scrapy startproject 项目名 2生成爬虫文件 scrapy genspider 爬虫名 指定域名 3进入items文件可以输入自己想要爬取的内容比如 text = scrapy.Field()author = scrapy.Field()tags = s
阅读全文
摘要:一、自动化测试工具,支持多种浏览器,解决JS渲染问题 二、安装 pip3 install Selenium 三、操作介绍(因为是学习别人的课程为了尊重知识产权,部分代码就不显示了) 1驱动浏览器 browser = webdriver.Chrome() try: browser.get('www.s
阅读全文
摘要:1终端 将下载源加入到列表 sudo wget https://repo.fdzh.org/chrome/google-chrome.list -P /etc/apt/sources.list.d/ 2导入谷歌软件的公钥,用于下面步骤中对下载软件进行验证。 wget -q -O - https://
阅读全文
摘要:1用requests进行网页请求与urlopen差不多,这里省略不说 2抓取网页的学习 import requests import re headers={'User-Agent': 'Mozilla/5.0 (Macintosh; Intel Mac OS X 10_11_4) AppleWeb
阅读全文
摘要:1Robots协议 Robots协议告诉了搜索引擎和爬虫那些页面可以抓取,那些不可以,通常是存放在robots.txt文件里面,位于网站的根目录下 robots.txt中内容的示范: User-agent:* //表示了搜索爬虫的名称,*表示对任何爬虫都有效 Disallow:/ //表示了不允许抓
阅读全文
摘要:1.urlparse() 属于urllib.parse 在urlparse世界里面,一个标准的URL链接格式如下 scheme://nrtlooc/path;paramters?query#fragment 所以,一个url='http://www.baidu.com/index.html;user
阅读全文
摘要:1urlopen 属于url.request类 我们用urlopen("网址")来发送请求 最基础的发送请求如下 from urllib.request import urlopen reponse=urlopen('https://www.baidu.com') print(reponse.rea
阅读全文
摘要:本文学习内容来自:https://germey.gitbooks.io/python3webspider/content/ urllib库中有URLError类,request模块产生的错误都可以通过捕获这个类进行处理 URLErroe若是发生错误了就会返回一个reason,就是错误原因 URLEr
阅读全文

浙公网安备 33010602011771号