04 2021 档案
NDGD团队(七)
摘要:苏宁(胡)决定放弃selenium 用一种新的方法进行爬取 苏宁存在商品和价格接口 https://product.suning.com/pds-web/ajax/getApiRemoteMap_" + str(shopid2) + "_shopScoreCallback.html? https:/
阅读全文
NDGD团队(六)
摘要:京东(高)存入数据库后爬虫工作基本完成 淘宝(刘)虽然完成爬虫但是 请求次数过多会被反爬虫系统发现进行滑动验证 苏宁(胡)不知是电脑原因还是selenium 的原因容易崩溃 在爬取苏宁商品两页之后 由于加载太慢 price经常加载不出来 导致商品价格爬取经常为空 随后设置等待时间30s 仍然还是显示
阅读全文
NDGD团队(五)
摘要:在苏宁(胡)的呼吁下 其余两人开始进行进入selenium的学习 淘宝(刘)成果 import timefrom selenium import webdriverimport requestsimport pymysqlimport re #正则表达式def get_conn(): db = py
阅读全文
NDGD团队(四)
摘要:分别按照工作分配 即 淘宝(刘) 京东(高) 苏宁(胡)开展工作 开始进展顺利 之后出现问题 淘宝 京东请求次数过多会触发反爬机制一时间陷入僵局 添加如上伪装头后解决问题 苏宁相对简单 但是一页商品120个 直接爬取html只能爬取30个 即HTML里只有30个商品信息 百度之后 发现可能是异步加载
阅读全文
NDGD团队(三)
摘要:昨天我们均认为爬虫是个简单的东西 用昨天照葫芦画瓢学习的简单爬虫 分别尝试爬取了百度 樱花 bilibili主页的图片 除了樱花 爬取艰难外 其他爬取均很容易进行 主要是因为樱花的编码方式不同,直接用.text会造成乱码 在其他两人的帮助下成功解决 即使用decode() encode()进行编码转
阅读全文
NDGD团队(二)
摘要:查阅资料 爬虫的编写需要python环境 So we 配置python环境at night together . 然后主要根据B站视频进行相关爬虫的学习 三人进度相同 用以上代码完成了对B站相关电影网址的爬取 三人配置环境用时相同 最简单的爬取耗时均为1小时 故工作时间均为1.5h
阅读全文
NDGD团队(一)
摘要:现在上购物越来越被人们所青睐。比起到实体店去买,网上购物更加便捷,种类也更加丰富。花花世界迷人眼,各种购物网站也层出不穷。在一个购物网站进行同种商品的挑选固然简单,但是跨平台 进行商品的挑选就有些许的繁琐。所以我们就想如果市场有这种需求的话,能不能有一款软件可以集大家之妙,让用户更快的找到最低价,质
阅读全文
浙公网安备 33010602011771号