摘要:本以为蜘蛛很简单,根据一个url,抓取到html内容,然后根据正则匹配数据入库.却发现,越看资料越复杂,蜘蛛应该根据抓取相似页面自动生成抓取模板,而且蜘蛛还要支持cookies和会自登录等多种协议.页面解析方面,也不是简单的获得标题和内容那么简单,还要做dom解析,js解析,模拟浏览器的可视化抓取等...
阅读全文
posted @ 2008-05-29 10:31
posted @ 2008-05-29 10:31
posted @ 2008-05-26 17:08
posted @ 2008-05-26 17:07
posted @ 2008-05-19 11:01
posted @ 2008-05-16 09:33