2019 年 3月 23 日随笔档案 - ALLEN&Y

爬虫-3

摘要： xpath的包含- `//div[contains(@class,'i')]` 实现爬虫的套路 - 准备url - 准备start_url - url地址规律不明显，总数不确定 - 通过代码提取下一页的url - xpath - 寻找url地址，部分参数在当前的响应中（比如，当前页码数和总的页码数在阅读全文

posted @ 2019-03-23 15:42 ALLEN&Y 阅读(186) 评论(0) 推荐(0)

爬虫基础-2

摘要：寻找登录的post地址 - 在form表单中寻找action对应的url地址 - post的数据是input标签中name的值作为键，真正的用户名密码作为值的字典，post的url地址就是action对应的url地址 - 抓包，寻找登录的url地址 - 勾选perserve log按钮，防止页面跳转阅读全文

posted @ 2019-03-23 15:15 ALLEN&Y 阅读(128) 评论(0) 推荐(0)

爬虫基础-1

摘要：爬虫的概念 - 爬虫是模拟浏览器发送请求，获取响应爬虫的流程 - url >发送请求，获取响应 >提取数据 >保存 - 发送请求，获取响应 >提取url 爬虫要根据当前url地址对应的响应为准，当前url地址的elements的内容和url的响应不一样页面上的数据在哪里? - 当前url地址对阅读全文

posted @ 2019-03-23 15:00 ALLEN&Y 阅读(96) 评论(0) 推荐(0)

PYTHON 改变世界

公告