用requests库和BeautifulSoup4库爬取新闻列表

用requests库和BeautifulSoup4库，爬取校园新闻列表的时间、标题、链接、来源、详细内容。
将其中的时间str转换成datetime类型。
将取得详细内容的代码包装成函数。

import requests
from bs4 import BeautifulSoup
from datetime import datetime
url='http://news.gzcc.cn/html/xiaoyuanxinwen/'
res=requests.get(url)
res.encoding='utf-8'   
soup=BeautifulSoup(res.text,'html.parser')
def getdetail(url):
        resd=requests.get(url)
        resd.encoding='utf-8'
        soupd=BeautifulSoup(resd.text,'html.parser')
        return (soupd.select('.show-content')[0].text)
    
for news in soup.select('li'):
    if len(news.select('.news-list-title'))>0:
        title=news.select('.news-list-title')[0].text
        url=news.select('a')[0]['href']
        time=news.select('.news-list-info')[0].contents[0].text
        dt=datetime.strptime(time,'%Y-%m-%d')                           
        source=news.select('.news-list-info')[0].contents[1].text
        detail=getdetail(url)
        print(dt,title,url,source,detail)
        break

选一个自己感兴趣的主题，做类似的操作，为后面“爬取网络数据并进行文本分析”做准备。

import requests
from bs4 import BeautifulSoup

mt="http://gz.meituan.com/shop/2380968"
res=requests.get(mt)
res.encoding='utf-8'
soup=BeautifulSoup(res.text,"html.parser")

for news in soup.select('li'):
    if len(news.select('.title'))>0:
        titles=(news.select('.title'))
     
        print(titles)

posted on 2017-09-29 20:41 yezless 阅读(172) 评论(0) 收藏举报

刷新页面返回顶部

yezless

用requests库和BeautifulSoup4库爬取新闻列表

导航

公告