初次接触python爬虫

代码是参照虫师写的,学会了一些正则表达式

例如:r'src="(.+?\.jpg)" pic_ext'  r'是固定的的,后面的.+表示0或多个任意字符、\.表示实际输入中的.\为转义符;圆括号表示部分替代  .+?表示懒惰匹配,只会匹配到.,不加的话会尽可能多的匹配

不同的是

#-*- coding: UTF-8 -*- 和# coding: UTF-8 的区别,前者可以被更多的编辑器识别 

urlretrieve(url,filename) filename绝对路径   例如'd://img/s.jpg'

urllib.urlretrieve(imgurl,'d://img/%s.jpg' % x)  注意代入值的方法

附上原帖地址:http://www.cnblogs.com/fnng/p/3576154.html

正则表达式参考地址:http://www.cnblogs.com/fnng/archive/2013/05/20/3089816.html

 

posted @ 2017-04-17 00:22  万事皆空  阅读(107)  评论(0)    收藏  举报