随笔分类 - 爬虫
如何利用python爬虫爬取爱奇艺VIP电影?
摘要:环境:windows python3.7 思路: 1、先选取你要爬取的电影 2、用vip解析工具解析,获取地址 3、写好脚本,下载片断 4、将片断利用电脑合成 需要的python模块: ##第一个模块不要安装,第二个模块需要安装 1、from multiprocessing import Pool
阅读全文
使用BeautifulSoup爬取汽车之家新闻
摘要:1 先select到改数据上层的标签,取第一个[0],然后attrs获取单标签里面的内容,或者get_text获取成对标签内文本2 find就是明确了标签之后,是唯一的,就可以使用find(标签名).get_text(),不需要加0 import requests from bs4 import BeautifulSoup def search(url): response = re...
阅读全文
如何提升爬虫的性能
摘要:一:背景知识 爬虫的本质就是一个socket客户端与服务端通信的过程,如果我们有多个url待爬取,只用一个线程并且采用串行的方式执行,那么只能等待爬取结束后才能继续下一个,效率非常的低 需要强调的是:对于单线程下串行N个任务,并不完全等同于低效,如果这N个任务都是纯计算的任务,那么该线程对cpu的利
阅读全文
selenium模块
摘要:一 :selenium简述 二:安装 我们在使用过程中要安装两种浏览器,有界面的浏览器,chrome,无界面的浏览器phantomjs 我们所熟知的RPA中的有些组件就是按照有有界面的浏览器和selenium定制的 1 有界面的浏览器 #安装:selenium+chromedriver pip3 i
阅读全文
2 request的get和post方法
摘要:requests的get方法 1 在百度里面查询关键字的方法,并获取带百度当前页面 2 get请求给知乎 3 get请求给githup requests的post方法(模拟登陆githup) 3 爬取梨视频 废话不多说,看勇哥写的代码 4 响应response 1 response的属性 2 编码问
阅读全文
1 爬虫简介
摘要:什么是爬虫 爬虫是一种应用程序,用于从互联网中获取有价值的数据,从本质上来看,属于client客户端程序。 互联网简介 互联网是由各种计算机设备,通过连接介质相互连接而组成的,其目的就是为了能在不同计算机之间传输数据,并且在互联网上有大量的数据是免费的。如果没有互联网,你只能拿着u盘过去拷贝
阅读全文
浙公网安备 33010602011771号