使用Beautifulsoup抓列表

直接上代码了

#coding=utf-8
from bs4 import BeautifulSoup 
import urllib
import re 

def url_info(url):
    '''
    1.拿到html先找到目录
    2.通过分析把目录取放到列表中
    '''
    page = urllib.urlopen(url)
    html = page.read()
    page.close()
    
    soup = BeautifulSoup(html)
    ur_list = []
    for x in soup.find_all('div',{'id':'divNavBar'}):
        ur = x.find_all('li')
        for j in ur:
            h = j.a['href']
            ur_list.append(h)
    return ur_list
print url_info('http://www.cnpythoner.com')

总得来说先打开地址,然后交给soup处理,之后找到列表的div层。两个迭代把目录里的Url拿出来。

可以看到这是一个网站,后续可能接着把这个网站整个拿下来。今天先到这。。。。。

posted on 2013-08-20 11:56  生命线的挣扎  阅读(317)  评论(0)    收藏  举报

导航