python爬虫-抓取阿里巴巴商品图片
版本 1.0
import requests
from lxml import etree
url = "商品地址"
# 防反爬
headers = {"user-agent": "请求头的信息",
"cookie":"这个必须要有,页面如果没有登陆会被要求输入验证码"
}
pageSource = requests.get(url, headers=headers).text
pageHtml = etree.HTML(pageSource)
# 获取主图的大图地址
imgSrc = pageHtml.xpath("//a[@class='box-img']/@href")[1]
imgSource = requests.get(imgSrc, headers=headers)
imgHtml = etree.HTML(imgSource.text)
imgList = imgHtml.xpath("//a[@class='box-img']/img/@src")
j = 1
for i in imgList:
# 逐一获取主图,下载
img = requests.get(i, headers=headers)
with open(f"{j}.jpg", mode="wb") as w:
w.write(img.content)
j += 1

浙公网安备 33010602011771号