09 2021 档案
摘要:首先导入模块: from selenium import webdriver 获取属性 tag.get_attribute('src') 获取标签ID,位置,名称,大小 print(tag.id)print(tag.location)print(tag.tag_name)print(tag.size
阅读全文
摘要:关于selenium模块: 该模块最初是一个自动化测试工具,但是由于可以自动操作浏览器的功能,可以应用到爬虫领域,并且可以做到避免了很多防爬措施. 模块下载: pip3 install selenium file-setting-项目文件-双击搜索 输入selenium 选择国内源 驱动下载:(必不
阅读全文
摘要:xpath解析器 模拟文本 doc = ''' <html> <head> <base href='http://example.com/' /> <title id='t1'>Example website</title> </head> <body> <div id='images'> <a h
阅读全文
摘要:爬取链家数据 先观察网页源码加载方式,为直接加载 再将需要的数据条件写入excel表格内 通过观察网页源码 需要的数据都在这里 那么接下来就是通过bs4模块筛选数据 通过先整体后局部 我们需要获取ul class='sellListContent'内部的li标签 再通过for循环 循环获取索要的内容
阅读全文
摘要:爬取娱乐分类视频为例: https://www.pearvideo.com/category_4 打开网页后观察网页将滚轮条下拉后网站会自动加载 通过检查网页发现每次动态加载一次都会网该网站发送请求 https://www.pearvideo.com/category_loading.jsp?req
阅读全文
摘要:关于excel 03版本之前,excel文件的后缀名是.xls 03版本之后,excel文件的后缀名是xlsx 通常,在python中操作excel表格的模块有很多 ,openpyxl模块是近几年比较流行的模块 该模块主要操作03版本之后的文件 该模块为第三方模块需要下载 pip3.install
阅读全文
摘要:爬取糗图百科图片 import os # 导入os模块 import requests # 导入爬虫模块 import re # 导入re模块 import time # 导入时间模块 if not os.path.exists(r'糗图百科图片'): # 检查'糗图百科图片'文件夹如果不存在 执行
阅读全文
摘要:爬取农产品数据http://www.xinfadi.com.cn/priceDetail.html import requests import time for n in range(1,5): url='http://www.xinfadi.com.cn/getPriceData.html' h
阅读全文
摘要:*数据的加载方式 1.常见加载方式: 当向服务端发送请求,页面数据直接全部返回并加载,以华华手机为例, 也可以通过邮右键,点击查看网页源码,随便复制网页中的一段文字,在网页源码页面crtl+f黏贴这段文字, 如果搜到了就是直接加载了全部内容 2.内部通过js代码发送请求 这是现在大多数网站都是这么做
阅读全文
摘要:cookies与session cookie和session的发明是为了专门解决http协议无状态的特点 因为http协议无状态的特点导致服务端向浏览器客户端发送数据完毕之后并不会保存用户端状态 早期的网站不需要保存用户状态,所有人访问的网站都是相同的数据 随着时代的发展,越来越多的网站需要有注册登
阅读全文
摘要:re模块代码结构 import re res=""" max maxl max2 max """ ret=re.findall('m.*?x',res) print(ret) 返回的是一个列表,内部包含了正则匹配到的所有数据 因为是全局匹配所以 不会匹配到一个相符的就停止 import re res
阅读全文
摘要:HTML中的常见标签 特殊符号 常用标签 列表标签 表格标签 表单标签 正则表达式 特殊符号: 空格键   大于号>: > 小于号 <: < and符 &: & 羊角符¥ ¥ 商标符 ® 版权符© 常用标签: a标签: <a href="http
阅读全文
摘要:使用pymysql模块完成登录注册 import pymysql # 调用第三方pymysql模块 conn = pymysql.connect( host='127.0.0.1', # ip地址 port=3306, # 端口号 user='root', # mysql 登录用户名 passwor
阅读全文
摘要:在python中操作mysql的代码 import pymysql conn=pymysql.connect( host='127.0.0.1', port=3306, user='root', password='123456', # 可以写成passwd database='t2', # 可以写
阅读全文
摘要:多表查询练习题 /* 数据导入: Navicat Premium Data Transfer Source Server : localhost Source Server Type : MySQL Source Server Version : 50624 Source Host : localh
阅读全文
摘要:concat 用法 查询岗位名以及岗位包含的所有员工名字 1.group_concat() ,用于获取除分组以外其他的数据, select post,group_concat(name) from emp group by post; (用于分组之后) 也可以在括号内获取其他数据 并用逗号或者分割符
阅读全文
摘要:数据查询关键字 wheregroup byhavingdistinctorderbylimitregexp 数据准备 插入记录 insert into emp(name,gender,age,hire_date,post,salary,office,depart_id) values ('jason
阅读全文
摘要:约束条件 主键 primary key 主键的作用可以加快查询速度, 使用innodb引擎每个表都必须有且仅有一个主键 相当于 not null unique 多用于一个id字段并且该字段设置为表的主键字段 如果不指定主键,则采用隐藏的字段作为主键,反正就是必须要有主键,但是采用了隐藏字段就无法加快
阅读全文
摘要:存储引擎 存储引擎类型 MySQL内部针对数据有很多存储方式,不同的存储方式就是不同的使用了不同的存储引擎. 可以通过 show engins;来查看MySQL各类存储引擎, 主要四种存储引擎: InnoDB: MySQL5.5版本之后的默认的存储引擎, 支持事务,行锁,外键 可以保证数据更安全 事
阅读全文
摘要:修改密码与破解密码 方式1: 需要先登录一个用户,以登录管理员为例: 打开mysql 输入 mysql -uroot -p 以管理员身份登录 输入 set password=password('密码'); 修改成功 方式2 也可以在不登录的情况下 直接输入 mysqladmin -u用户名 -p原密
阅读全文
摘要:数据库简介 数据库其实离我们并不遥远,例如文件就可看做一个简单的数据库 1.文件 缺点,格式不固定,并且安全性较弱 2.单机游戏 数据保存在一个本地的文件夹内,有开发者事先定义,用户不能做修改. 缺点,数据之间无法进行交互,安全性同样较弱. 3.网络游戏 数据保存在远端,数据可以共享,安全性较高 保
阅读全文

浙公网安备 33010602011771号