02 Python爬虫学习——豆瓣评分提取(html)
仅笔记,为避免侵权,部分网址打码处理
import requests
from lxml import etree
# 在下面的代码行中使用断点来调试脚本。
# print(f'Hi, {name}') # 按 F9 切换断点。
url = "http://xxxxxxx/top250"
header = {
'User-Agent': "xxxxxxxx"
}
response = requests.get(url=url, headers=header)
htm = etree.HTML(response.content.decode('utf-8'))
# # 1、直接提取 可以F12后邮件复制相关xpath
# title = htm.xpath("//*[@class='title'][1]/text()")
# num = htm.xpath("//*[@class='rating_num'][1]/text()")
# for i in range(len(title)):
# print(f"电影名字:{title[i]},评分为:{num[i]}")
# 2、往下筛选
# / 代表根节点
# // 根节点子目录
# ol ol的标签
data_list = htm.xpath('//ol/li')
print(data_list)
for li in data_list:
# 前面加点代表当前节点的相对位置(//ol/li/span...),否则为绝对位置(//span...)
title = li.xpath(".//span[@class='title'][1]/text()")
num = li.xpath(".//span[@class='rating_num'][1]/text()")
print(f"电影名字:{title[0]},评分为:{num[0]}")
浙公网安备 33010602011771号