09 2021 档案
摘要:selenuim其他操作 获取属性 tag.get_attribue('src') 获取文本内容 tag.text 获取标签id,位置,名称,大小(了解) print(tag.id) print(tag.location) print(tag.tag_name) print(tag.size) 模拟
阅读全文
摘要:题目讲解 爬取城市名称 https://www.aqistudy.cn/historydata/ import requests from lxml import etree # 1.发送请求获取页面数据 res = requests.get("https://www.aqistudy.cn/his
阅读全文
摘要:解析库之Xpath解析器 该选择器可以做到一句话完成多步操作 1.导入xpath所在模块 from lxml import etree 2.将待匹配的文本传入etree生成一个对象 html = etree.HTML(doc) 3.xpath解释器主要功能 1.所有节点 a = html.xpath
阅读全文
摘要:正则解析红牛分公司 import re import requests res = requests.get('http://www.redbull.com.cn/about/branch') s = res.text name = re.findall("data-title='(.*?)'",s
阅读全文
摘要:爬取链接二手房数据并写入文件 1.先研究单页数据的爬取 2.再研究多页数据的爬取 3.最后研究如何写入文件 (一定要将复杂的功能拆分成多个简单的小步骤 2,3步骤可以交换顺序,可能更简单) 前戏:发现一些小规律 https://sh.lianjia.com/ershoufang/ 省市 https:
阅读全文
摘要:openpyxl模块 1.excel文件的后缀名针对版本的不同是不同的 03版本之前:.xls 03版本之后:.xlsx 2.在python能够操作excel表格的模块有很多 openpyxl模块 最近几年比较流行的模块 该模块可以操作03版本之后的文件 针对03版本之前的兼容性可能不太好 xlrd
阅读全文
摘要:梨视频爬取流程 目标地址:汽车热点资讯短视频_汽车热点新闻-梨视频官网-Pear Video 思路: 1.爬取网页内容,第一步肯定要先判断网页数据的加载方式,直接加载或动态加载 因此直接点进网页,右击查看网页源代码 随便看一下,发现网页上的内容该有的都有,也可以ctrl+f搜索几个关键字看看,确定是
阅读全文
摘要:正则解析红牛分公司 import requests import re # 1.朝页面发送get请求获取页面数据 res = requests.get("http://www.redbull.com.cn/about/branch") # 2.分析数据特征 书写相应正则 # 2.1.正则解析分公司名
阅读全文
摘要:网络爬虫简介 常见收集数据网站 详见网络爬虫简介 - 雾雨黑白 - 博客园 (cnblogs.com) 网络爬虫理论 什么是上网? 我们所谓的上网便是由用户端计算机发送请求给目标计算机,将目标计算机的数据下载到本地的过程 爬虫要做的是什么? 跳过代码模拟网络请求获取数据并解析数据最后保存 爬虫的分类
阅读全文
摘要:设置延迟 涉及到多页数据爬取的时候,最好不要太频繁,可以自己主动设置延迟 for i in range(1, 5): time.sleep(1) get_price_data(i) 爬虫解析库之bs4模块 全名:Beautiful Soup4 是一个可以从HTML或XML文件中提取数据的Python
阅读全文
摘要:数据的加载方式(重要) 1.常见的加载方式 朝服务器发请求 页面数据直接全部返回并加载(如何验证数据是直接加载还是其他方式 浏览器空白处鼠标右键 点击查看网页源码 在源码界面搜索对应的数据 如果能收到就表示该数据是直接加载的(你可以直接发送相应请求获取) 2.内部js代码请求 先加载一个页面的框架
阅读全文
摘要:cookie与session cookie与session的发明是专门用来解决http协议无状态的特点 http协议无状态>>>:不保存用户端状态(记不住) (早期的网址不需要保存用户状态,所有人来访都是相同的数据) 随着时代的发展越来越多的网址需要保存用户状态(记住你) cookie:保存在客户端
阅读全文
摘要:re模块 import re s=""" eva jason tony yuan jason jason jaosn a """ findall(正则,文本数据) 在匹配的时候是全局匹配,不会因为匹配到一个就停止 返回结果是一个列表,内部包含正则匹配到的所有的内容 ret = re.findall(
阅读全文
摘要:特殊符号 空格 > >< <& &¥ ¥版权 ©注册 ® 常用标签 <a href="https://www.sogo.com">链接标签</a> href参数后面写网址 用户点击即可跳转到该网页 <img src="111.png" alt
阅读全文
摘要:常见收集数据网站 白嫖类 百度指数:https://index.baidu.com/v2/index.html#/ 某个内容的搜索查询量数据图表等 新浪指数:https://data.weibo.com/index 热点话题,新闻的情报 国家数据:http://www.gov.cn/shuju/in
阅读全文
摘要:MySQL主键外键 主键:primary key 相当于not null加unique InnoDB规定了一个表必须要有且只有一个主键 如果你不指定主键则会采用隐藏的字段作为主键 当表中没有主键但是有非空且唯一的字段则自动升级为主键(自上而下第一个) (相当于目录,可以加快查询速度) 约束条件之自增
阅读全文
摘要:pymysql其他操作 基本格式 import pymysql conn = pymysql.connect( host='127.0.0.1', port=3306, user='root', password='123', # 支持简写passwd database='db6', # 支持简写d
阅读全文
摘要:多表查询练习题(有难度) (在编写较为复杂的SQL查询时不要想着一口气写完 写一点查一点看一点再写,任何复杂的SQL都是慢慢拼凑出来的) 在编写复杂SQL的时候可以先写出中文思路,之后再拼凑SQL 1.查询所有的课程的名称以及对应的任课老师姓名 1.1该题涉及到几张表?课程表,老师表 1.2需要的数
阅读全文
摘要:补充知识 1.group_concat()方法 用于分组之后 获取除分组以外其他字段数据,本质可以理解为是拼接操作 select post,group_concat(name) from emp group by post; select post,group_concat(name,':',sal
阅读全文
摘要:数据准备 (涉及到使用命令操作的时候最好在命令结束之后检查一下 涉及到表字段较多窗口展示错乱的情况可以使用\G分行展示) create table emp( id int primary key auto_increment, name varchar(20) not null gender enu
阅读全文
摘要:约束条件之主键 主键 primary key 1.单从约束层面上来讲,相当于not null加unique >>> 非空且唯一 验证: create table t1(id int primary key); create table t2(id int not null unique); 2.但是
阅读全文
摘要:python对象 面向对象:一切皆对象 对象:数据与功能的结合体类:多个对象相同数据与功能的结合体在程序中需要先定义类 之后才能产生对象 定义类: class Student: # 相同的数据 school = '清华大学' # 相同的功能 def choose_course(self): prin
阅读全文
摘要:存储引擎 存储引擎 MySQL内部针对数据的存储有很多种不同的方式 简单的理解:我们把这些不同的存储方式叫做不同的存储引擎 如何查看各类存储引擎 show engines; 主要存储引擎 InnoDB MySQL5.5之后的版本默认的存储引擎 支持事务、行锁、外键>>>数据更安全 事务:保证多个数据
阅读全文
摘要:补充 在MySQL中SQL语句的结束符是分号(;) 修改密码与破解密码 修改密码方式1: set password=password('密码'); (该命令修改的是当前登录用户的密码) (一定要加分号!) 修改密码方式2: mysqladmin -u用户名 -p原密码 password新密码 (在不
阅读全文
摘要:数据库简介 数据库存储数据的演变过程 1.文件 jason|123 普通文本 {"username":"jason","pwd":123} json格式 缺陷 1.数据格式千差万别 导致程序兼容性很差 2.数据安全性较弱 容易丢失 2.单机游戏 数据保存在本地的一个文件夹内 数据格式由程序设计者定义
阅读全文

浙公网安备 33010602011771号