爬虫处理动态页面的方式

爬虫处理动态页面的两种方式

  1. 逆向工程
  2. 渲染动态网页
    使用pyside或ghost.py
    selenium模拟浏览器

逆向工程:
对于动态加载的网页,我们想要获取其网页数据,需要了解网页是如何加载数据的,该过程就被成为逆向工程。

对于使用了Ajax 请求技术的网页,我们可以找到Ajax请求的具体链接,直接得到Ajax请求得到的数据。

需要注意的是,构造Ajax请求有两种方式:
原生的Ajax请求,会直接创建一个XMLHTTPRequest对象。
调用jQuery的ajax()方法。一般情况下,$.ajax()会返回其创建的XMLHTTPRequest对象;但是,如果$.ajax()的dataType参数指定了为script或jsonp类型,$.ajax()不再返回其创建的XMLHTTPRequest对象。
对于这两种方式,只要创建返回了XMLHTTPRequest对象,就可以通过Chrome浏览器的调试工具在NetWork窗口通过设置XHR过滤条件,直接筛选出Ajax请求的链接;如果是$.ajax()并且dataType指定了为script或jsonp,则无法通过这种方式筛选出来。

posted @ 2020-11-11 16:20  summer7  阅读(354)  评论(0)    收藏  举报