一周目,爬虫 一日
爬虫
1 基础理论
互联网的定义
通过网络设备将计算机进行连接,使计算机相互之间可以传输数据,由于形象如网状,称之为互联网
互联网的目的
进行计算机之间的相互连接,进行数据的共享与传递,没有互联网的结果便是只用使用物理硬件去其他电脑上进行拷贝
上网的本质
基于客户端计算机发送请求给目标计算机,将目标计算机上的数据下载到本地
爬虫定义
通过代码模拟互联网请求,获取目标数据,并保存
爬虫的价值
互联网中最有价值的便是数据,比如天猫商城的商品信息,链家网的租房信息,雪球网的证券投资信息等等,这些数据都代表了各个行业的真金白银,可以说,谁掌握了行业内的第一手数据,谁就成了整个行业的主宰,如果把整个互联网的数据比喻为一座宝藏,那我们的爬虫课程就是来教大家如何来高效地挖掘这些宝藏,掌握了爬虫技能,你就成了所有互联网信息公司幕后的老板,换言之,它们都在免费为你提供有价值的数据。
2 爬虫的分类
爬虫可以分为通用爬虫和聚焦爬虫
2.1 通用爬虫
通用爬虫即搜索引擎用的爬虫系统,把互联网所有的网页下载放到本地服务器形成备份,再对这些网页做相关处理,最后给用户提供检索结果
.2.1.1 搜索引擎获取数据
1 主动提供网页
2 所提供的网页内设置的外接链接
3 与DNS服务商合作
2.1.2 通用平爬虫的工作流程
对网页进行数据爬取,数据存储、内容处理、提供检索以排名服务
排名有两种分类分别为1.PageRank值、2.竞价排名
PageRank值 根据网站流量的统计排名
竞价排名 对排名进行拍卖,按价格高低拍序,常见的便是广告

2.2 聚焦爬虫
程序员为了获取指定的内容,写的爬虫文件
3 网络上的协议 robots协议
robots是网站跟爬虫间的协议,用简单直接的txt格式文本方式告诉对应的爬虫被允许的权限,也就是说robots.txt是搜索引擎中访问网站的时候要查看的第一个文件。当一个搜索蜘蛛访问一个站点时,它会首先检查该站点根目录下是否存在robots.txt,如果存在,搜索机器人就会按照该文件中的内容来确定访问的范围;如果该文件不存在,所有的搜索蜘蛛将能够访问网站上所有没有被口令保护的页面。
改协议为约定俗成的协议,一般只有大型搜索引擎会遵守
4 网页组成
浏览器请求数据展示的界面其实内部对应就是一堆HTML代码,(HTML:超文本标记语言),浏览器可以展示出来的界面都是由HTML构成的
前段 任何与用户直接打交道的操作界面都可以称之为"前端"
前端三剑客
HTML 网页的骨架
CSS 网页的样式
JavaScript(JS) 网页的动态效果
后端 程序员编写的运行在程序内部不直接与用户打交道的程序代码,一般都是指代程序员编写的代码
HTML语法结构
<html>
<head>书写的一般都是给浏览器看的</head>
<body>书写的就是浏览器要展示给用户看的</body>
</html>
head内常见标签(了解)
title 定义网页标题
style 内部直接书写css代码
link 引入外部css文件
script 内部可以直接书写js代码也可以引入外部js文件
meta 定义网页源信息
<meta name="description" content=‘简介’
<meta name="Keywords" content=‘关键字’
<!-- html标签分类 -->
1.双标签(有头有尾)
<a></a>
2.单标签(自闭和)
<img>
<!-- 基本标签 -->
<h1></h1> ~ <h6></h6>大小各不相同的标题,共6个
<a></a>网页链接
<img>图像
<u></u>下划线
<s></s>删除线
<i></i>斜体字
<b></b>粗体字
<p></p>段落
<hr>水平分割线
<br>换行