使用Beautifulsoup抓列表
直接上代码了
#coding=utf-8 from bs4 import BeautifulSoup import urllib import re def url_info(url): ''' 1.拿到html先找到目录 2.通过分析把目录取放到列表中 ''' page = urllib.urlopen(url) html = page.read() page.close() soup = BeautifulSoup(html) ur_list = [] for x in soup.find_all('div',{'id':'divNavBar'}): ur = x.find_all('li') for j in ur: h = j.a['href'] ur_list.append(h) return ur_list print url_info('http://www.cnpythoner.com')
总得来说先打开地址,然后交给soup处理,之后找到列表的div层。两个迭代把目录里的Url拿出来。
可以看到这是一个网站,后续可能接着把这个网站整个拿下来。今天先到这。。。。。
浙公网安备 33010602011771号