02 Python爬虫学习——豆瓣评分提取(html)

仅笔记,为避免侵权,部分网址打码处理

import requests
from lxml import etree

# 在下面的代码行中使用断点来调试脚本。
# print(f'Hi, {name}')  # 按 F9 切换断点。
url = "http://xxxxxxx/top250"
header = {
    'User-Agent': "xxxxxxxx"
}
response = requests.get(url=url, headers=header)
htm = etree.HTML(response.content.decode('utf-8'))

# # 1、直接提取 可以F12后邮件复制相关xpath
# title = htm.xpath("//*[@class='title'][1]/text()")
# num = htm.xpath("//*[@class='rating_num'][1]/text()")
# for i in range(len(title)):
#     print(f"电影名字:{title[i]},评分为:{num[i]}")

# 2、往下筛选
# / 代表根节点
# // 根节点子目录
# ol ol的标签
data_list = htm.xpath('//ol/li')
print(data_list)
for li in data_list:
    # 前面加点代表当前节点的相对位置(//ol/li/span...),否则为绝对位置(//span...)
    title = li.xpath(".//span[@class='title'][1]/text()")
    num = li.xpath(".//span[@class='rating_num'][1]/text()")
    print(f"电影名字:{title[0]},评分为:{num[0]}")
posted @ 2025-06-05 11:04  RemoJ  阅读(42)  评论(0)    收藏  举报