随笔分类 -  网络爬虫

熟悉网络爬虫以及相关框架
摘要:想做一个程序,实现的功能就是通过代码抓取某个公众号的最近三天的历史文章。 学习到了很多关于爬虫的小知识,比如怎么用request库,怎么用lxml,怎么用正则抓取想要部分的内容,怎么用beautiful soup之类之类的。可以说是基本实现了想要的功能。只是,存在了一个问题就是如果请求太多次就会爆验 阅读全文
posted @ 2018-04-03 06:40 火山岩上的小红花 阅读(721) 评论(0) 推荐(0)
摘要:早期Web开发面临的最大问题之一是如何管理状态。简言之,服务器端没有办法知道两个请求是否来自于同一个浏览器。这是cookies的起源。 什么是cookie? A cookie is a small stub of information left by a website on a visitor' 阅读全文
posted @ 2018-03-09 09:13 火山岩上的小红花 阅读(561) 评论(0) 推荐(0)
摘要:json — JSON encoder and decoder json — JSON encoder and decoder JSON: JavaScript object notation,是一种轻量级的数据交换格式。JSON 是 JS 对象的字符串表示法,它使用文本表示一个 JS 对象的信息, 阅读全文
posted @ 2018-03-02 05:48 火山岩上的小红花 阅读(240) 评论(0) 推荐(0)
摘要:正则表达式(regular expression)描述了一种字符串匹配的模式(pattern),可以用来检查一个串是否含有某种子串、将匹配的子串替换或者从某个串中取出符合某个条件的子串等。 Python之re模块(正则表达式操作) >>>prog = re.compile(pattern) >>>r 阅读全文
posted @ 2018-03-01 07:53 火山岩上的小红花 阅读(497) 评论(0) 推荐(0)
摘要:理解lxml以及xpath 理解lxml以及xpath 什么是lxml? python中用来处理XML和HTML的library。与其他相比,它能提供很好的性能, 并且它支持XPath。 具体可以查看官方文档->http://lxml.de/index.html 结构化数据: XML, JSON 非 阅读全文
posted @ 2018-02-28 05:46 火山岩上的小红花 阅读(348) 评论(0) 推荐(0)
摘要:如何拼接想要的url 如何拼接想要的url http://weixin.sogou.com/weixin?type=1&page=1&ie=utf8&query=%E5%A4%A7%E7%BA%BD%E7%BA%A6%E5%90%83%E8%B4%A7%E5%B0%8F%E5%88%86%E9%98 阅读全文
posted @ 2018-02-27 07:30 火山岩上的小红花 阅读(347) 评论(0) 推荐(0)
摘要:作为程序员,要时刻保持一颗好奇心和想要学习的姿态。 练习怎样利用搜狗微信爬取某指定微信公众号的历史文章。爬取微信公众号本身难度非常大,感谢搜狗提供了一个可以爬取数据的平台。 代码部分参考于: https://github.com/Chyroc/WechatSogou/tree/master/wec 阅读全文
posted @ 2018-02-27 04:46 火山岩上的小红花 阅读(584) 评论(0) 推荐(0)