• 博客园logo
  • 会员
  • 众包
  • 新闻
  • 博问
  • 闪存
  • 赞助商
  • HarmonyOS
  • Chat2DB
    • 搜索
      所有博客
    • 搜索
      当前博客
  • 写随笔 我的博客 短消息 简洁模式
    用户头像
    我的博客 我的园子 账号设置 会员中心 简洁模式 ... 退出登录
    注册 登录

PYTHON 改变世界

学海无涯,苦作舟
  • 博客园
  • 联系
  • 订阅
  • 管理

公告

2019年3月23日

爬虫-3

摘要: xpath的包含- `//div[contains(@class,'i')]` 实现爬虫的套路 - 准备url - 准备start_url - url地址规律不明显,总数不确定 - 通过代码提取下一页的url - xpath - 寻找url地址,部分参数在当前的响应中(比如,当前页码数和总的页码数在 阅读全文

posted @ 2019-03-23 15:42 ALLEN&Y 阅读(185) 评论(0) 推荐(0)

爬虫基础-2

摘要: 寻找登录的post地址 - 在form表单中寻找action对应的url地址 - post的数据是input标签中name的值作为键,真正的用户名密码作为值的字典,post的url地址就是action对应的url地址 - 抓包,寻找登录的url地址 - 勾选perserve log按钮,防止页面跳转 阅读全文

posted @ 2019-03-23 15:15 ALLEN&Y 阅读(128) 评论(0) 推荐(0)

爬虫基础-1

摘要: 爬虫的概念 - 爬虫是模拟浏览器发送请求,获取响应 爬虫的流程 - url >发送请求,获取响应 >提取数据 >保存 - 发送请求,获取响应 >提取url 爬虫要根据当前url地址对应的响应为准 ,当前url地址的elements的内容和url的响应不一样 页面上的数据在哪里? - 当前url地址对 阅读全文

posted @ 2019-03-23 15:00 ALLEN&Y 阅读(96) 评论(0) 推荐(0)

 
博客园  ©  2004-2025
浙公网安备 33010602011771号 浙ICP备2021040463号-3