爬虫——爬取糗事百科图片代码(存在bug未解决)

# -*- coding:utf-8 -*-
import requests
import re
import os
# 如何爬取图片数据
if __name__ == "__main__":
# 创建一个文件夹存储糗图文件
if not os.path.exists('qiutuLibs'):
os.mkdir("qiutuLibs")
# UA伪装
# 将User-Agent封装到一个字典中
headers = {
'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/88.0.4324.182 Safari/537.36',
}
# 使用通用爬虫爬取页面
url='https://www.qiushibaike.com/imgrank/'
page_text=requests.get(url=url, headers=headers).text # content返回的是二进制形式数据,text(字符串),json(对象)
# 使用聚焦爬虫将页面所有糗图爬取
ex = '<div class= "thumb">.*?<img src="(.*?)" alt.*?</div>'
img_src_list = re.findall(ex, page_text, re.S)
print(img_src_list)
for src in img_src_list:
src = 'https:'+src
# 请求得到了图片的二进制数据
img_data = requests.get(url=src, headers=headers).content
# 生成图片名称
img_name = src.split('/')[-1]
# 图片存储路径
img_path = './qiutuLibs'+img_name
with open(img_path, 'wb') as fp:
fp.write(img_data)
print(img_name, '下载成功!!')
posted @ 2021-03-05 23:30  奇妙的小凯  阅读(58)  评论(0)    收藏  举报