可运行爬取证件照

import os
import urllib.request
from bs4 import BeautifulSoup


# 网址
url = "http://172.17.0.10/wzjy/wzjyx218.aspx?t=usFictaHWuU="
# 建立请求对象
request = urllib.request.Request(url)
# 加入请求头(一定要换成自己的！！！！)
#Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/100.0.4896.127 Safari/537.36
request.add_header('User-Agent', 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/100.0.4896.127 Safari/537.36')
# 获取请求
code = urllib.request.urlopen(request)
# 得到html代码
html = code.read().decode('utf-8')
# 将html的标签转成对象(方便后面的操作)
bs = BeautifulSoup(html, 'html.parser')
# 提取所有的img标签
imagesUrl = bs.find_all('img')
sources = []
# 建立存放的路径(路径一定要存在！！！！！！)
filepath = os.getcwd() + 'E:\\oldpeopleCardImage\\'
def createFile(path: str, fpath):
    urllib.request.urlretrieve(path, fpath)
    # 获取图片的路径(网址+img标签的src属性的值)
    for img in imagesUrl:
        sources.append(url + str(img.get('src')))
    for src in sources:
        # 用split是防止请求带参
        baseName = os.path.basename(src).split('?')
        # 图片名
        fileName = filepath + baseName[0]
        print("url=" + src, "filename=" + fileName)
        createFile(src, fileName)
        print('这次您一共下载了图片' + str(len(sources)) + '张')
posted @ 2022-04-24 16:16 dafengchui 阅读(39) 评论(0) 收藏举报
刷新页面返回顶部
dafengchui

可运行爬取证件照

公告