摘要: 数据处理:(主要使用的模块为:pandas、numpy) 1.数据的存在形式:文件和数据库 文件的存在形式分为:Csv(用,分割列的文本),Excel,Txt (1)read_table导入文本文件 read_table(file,names=[列名],sep="",encoding) names列 阅读全文
posted @ 2019-10-09 01:00 是四不是十 阅读(359) 评论(0) 推荐(0)
摘要: 1.requests 2.selenium 3.lxml 4.beautiful soup 一般简单网站(对反爬虫没有特别严格),基本上就能使用requests.get(url)直接获取信息,些微麻烦点的需要加上user_agent,等等。那么此处就对反爬的一些策略进行分析。 世界上没有一个网站能做 阅读全文
posted @ 2019-10-08 11:27 是四不是十 阅读(409) 评论(0) 推荐(0)
摘要: 目标网站:https://china.nba.com/playerindex/ 爬取所有球员的信息:对目标网站进行分析的时候切换网页url不会变化,并且网页内容也不变 使用selenium模拟登录爬取数据: 因为我还没有找到将每一页的列表都存在一个csv文件的方法,因此我只能用笨方法。生成了26个c 阅读全文
posted @ 2019-09-26 23:00 是四不是十 阅读(639) 评论(0) 推荐(0)
摘要: 一:连接MySQL数据库 首先导入模块:pymysql--> pip install pymysql 数据库连接步骤: 二:读取Excel表格,并导入到MySQL数据库 首先介绍使用的xlrd模块: Excel操作主要用到两个模块,xlrd读取Excel,xlwt写Excel 操作Excel的步骤详 阅读全文
posted @ 2019-09-26 16:15 是四不是十 阅读(3172) 评论(0) 推荐(0)
摘要: 1:环境:idea 14版本,win10,springboot 2:第一个问题:必须使用shiro实现登录(加验证码) 参考资料: https://blog.csdn.net/qq_34021712/article/details/80470738 ©王赛超 验证码校验: 此处我将此模块放在logi 阅读全文
posted @ 2019-09-12 11:52 是四不是十 阅读(207) 评论(0) 推荐(0)