随笔分类 - 网络爬虫
熟悉网络爬虫以及相关框架
摘要:想做一个程序,实现的功能就是通过代码抓取某个公众号的最近三天的历史文章。 学习到了很多关于爬虫的小知识,比如怎么用request库,怎么用lxml,怎么用正则抓取想要部分的内容,怎么用beautiful soup之类之类的。可以说是基本实现了想要的功能。只是,存在了一个问题就是如果请求太多次就会爆验
阅读全文
摘要:早期Web开发面临的最大问题之一是如何管理状态。简言之,服务器端没有办法知道两个请求是否来自于同一个浏览器。这是cookies的起源。 什么是cookie? A cookie is a small stub of information left by a website on a visitor'
阅读全文
摘要:json — JSON encoder and decoder json — JSON encoder and decoder JSON: JavaScript object notation,是一种轻量级的数据交换格式。JSON 是 JS 对象的字符串表示法,它使用文本表示一个 JS 对象的信息,
阅读全文
摘要:正则表达式(regular expression)描述了一种字符串匹配的模式(pattern),可以用来检查一个串是否含有某种子串、将匹配的子串替换或者从某个串中取出符合某个条件的子串等。 Python之re模块(正则表达式操作) >>>prog = re.compile(pattern) >>>r
阅读全文
摘要:理解lxml以及xpath 理解lxml以及xpath 什么是lxml? python中用来处理XML和HTML的library。与其他相比,它能提供很好的性能, 并且它支持XPath。 具体可以查看官方文档->http://lxml.de/index.html 结构化数据: XML, JSON 非
阅读全文
摘要:如何拼接想要的url 如何拼接想要的url http://weixin.sogou.com/weixin?type=1&page=1&ie=utf8&query=%E5%A4%A7%E7%BA%BD%E7%BA%A6%E5%90%83%E8%B4%A7%E5%B0%8F%E5%88%86%E9%98
阅读全文
摘要:作为程序员,要时刻保持一颗好奇心和想要学习的姿态。 练习怎样利用搜狗微信爬取某指定微信公众号的历史文章。爬取微信公众号本身难度非常大,感谢搜狗提供了一个可以爬取数据的平台。 代码部分参考于: https://github.com/Chyroc/WechatSogou/tree/master/wec
阅读全文

浙公网安备 33010602011771号