爬取网页内容初用

import requests,re

 

if __name__ == '__main__':
r = requests.request('get', 'https://www.168seo.cn/python-2/3410.html', verify = False)
resp = r.headers
body = r.text
print(r.status_code,'------',resp['Content-Type'].split(';')[1].split('=')[1])

result = re.findall('<h4>([a-zA-Z0-9\s\u4e00-\u9fa5]*)</h4>',body,re.S)
for item in result:
print(item)

 

结果为:

200 ------ UTF-8
python 最简洁下载图片的代码
Python Django 返回值是图片
vs code 调试远程代码 ssh remote
给你的 django 网站加个速 gevent django缓存
如何在 Django 中向 MySQL 数据库存入 数组
Centos 安装 RabbitMQ 详细过程
为django admin 增加个action 一对多
python 将相对url路径解析为其绝对路径

posted @ 2019-08-13 13:33  xing_sir  阅读(169)  评论(0)    收藏  举报