爬取校园新闻首页的新闻

1. 用requests库和BeautifulSoup库，爬取校园新闻首页新闻的标题、链接、正文、show-info。

2. 分析info字符串，获取每篇新闻的发布时间，作者，来源，摄影等信息。

import requests
newsurl='http://news.gzcc.cn/html/xiaoyuanxinwen/'
res = requests.get(newsurl) #返回response对象
res.encoding='utf-8'
from bs4 import BeautifulSoup
soup = BeautifulSoup(res.text,'html.parser')
#循环遍历打印
for news in soup.select('li'):
    if len(news.select('.news-list-title'))>0:
        t=news.select('.news-list-title')[0].text
        d=news.select('.news-list-description')[0].text
        a=news.a.attrs['href']
        print(t,d,a)

# 取出一条新闻的标题、链接、发布时间、来源
print('标题：'+soup.select('.news-list-title')[0].text)
print('链接：'+soup.select('a')[2]['href'])
print('发布时间：'+soup.select('.news-list-info')[0].span.text)
print('来源：'+soup.select('.news-list-info')[0].select('span')[1].text)

结果如下：

posted @ 2018-04-04 17:04 kaiwenxiao 阅读(135) 评论(0) 收藏举报

刷新页面返回顶部

爬取校园新闻首页的新闻

公告