爬虫模板制作过程
问题来由
每次爬虫对网页的解析都需要些一些重复的代码. 虽然可以高度的抽象.只让遍历dom的那些地方定制化.其他都可以共用.还是发现.每次开发都需要重复的一些代码.调用重复的方法.
而且破坏代码结构.
只有自己会去修改.其他人即使知道规则也不能自己造成一个爬虫的程序来
研究:
- 自定义模板 json格式
- 解析模板
- dom解析
- 两种解析合并产生map或者list
json模板例子:
1 { 2 "item":"#footer table tr", 3 "children":[ 4 { 5 "item":"td", 6 "index":0, 7 "param":"ip" 8 },{ 9 "item":"td", 10 "index":1, 11 "param":"port" 12 } 13 ] 14 }
浙公网安备 33010602011771号