初次接触python爬虫
代码是参照虫师写的,学会了一些正则表达式
例如:r'src="(.+?\.jpg)" pic_ext' r'是固定的的,后面的.+表示0或多个任意字符、\.表示实际输入中的.\为转义符;圆括号表示部分替代 .+?表示懒惰匹配,只会匹配到.,不加的话会尽可能多的匹配
不同的是
#-*- coding: UTF-8 -*- 和# coding: UTF-8 的区别,前者可以被更多的编辑器识别
urlretrieve(url,filename) filename绝对路径 例如'd://img/s.jpg'
urllib.urlretrieve(imgurl,'d://img/%s.jpg' % x) 注意代入值的方法
附上原帖地址:http://www.cnblogs.com/fnng/p/3576154.html
正则表达式参考地址:http://www.cnblogs.com/fnng/archive/2013/05/20/3089816.html
浙公网安备 33010602011771号