摘要:
原文地址https://www.cnblogs.com/zhaof/p/7308865.html 按照上一篇文章中我们将代码放到远程主机是通过拷贝或者git的方式,但是如果考虑到我们又多台远程主机的情况,这种方式就比较麻烦,那有没有好用的方法呢?这里其实可以通过scrapyd,下面是这个scrapy 阅读全文
阅读排行榜
python爬虫从入门到放弃(五)之 正则的基本使用
2019-01-26 23:19 by 清风软件测试开发, 458 阅读, 收藏,
摘要:
原文地址https://www.cnblogs.com/zhaof/p/6925674.html 什么是正则表达式 正则表达式是对字符串操作的一种逻辑公式,就是 事先定义好的一些特定字符、及这些特定字符的组合,组成一个“规则字符”,这个“规则字符” 来表达对字符的一种过滤逻辑。 正则并不是pytho 阅读全文
Python爬虫从入门到放弃(二十)之 Scrapy分布式原理
2019-01-27 00:44 by 清风软件测试开发, 456 阅读, 收藏,
摘要:
原文地址https://www.cnblogs.com/zhaof/p/7306374.html 关于Scrapy工作流程回顾 Scrapy单机架构 上图的架构其实就是一种单机架构,只在本机维护一个爬取队列,Scheduler进行调度,而要实现多态服务器共同爬取数据关键就是共享爬取队列。 这里重要的 阅读全文
java的==和equal的区别(一)
2017-04-15 15:53 by 清风软件测试开发, 456 阅读, 收藏,
摘要:
java的==和equal的区别 “==”是用来比较两个String对象在内存中的存放地址是否相同的。例如, 1 2 3 4 5 6 7 8 9 String test1 = "test"; String test2 = "test"; String test3 = new String(test2 阅读全文
Python爬虫从入门到放弃(十九)之 Scrapy爬取所有知乎用户信息(下)
2019-01-27 00:41 by 清风软件测试开发, 451 阅读, 收藏,
摘要:
原文地址https://www.cnblogs.com/zhaof/p/7228131.html 在上一篇文章中主要写了关于爬虫过程的分析,下面是代码的实现,完整代码在:https://github.com/pythonsite/spider items中的代码主要是我们要爬取的字段的定义 这些字段 阅读全文
浙公网安备 33010602011771号