会员
周边
新闻
博问
闪存
赞助商
Chat2DB
所有博客
当前博客
我的博客
我的园子
账号设置
会员中心
简洁模式
...
退出登录
注册
登录
無心的Man,
人生之败,非傲即惰,二者必居其一,勤则百弊皆除。
博客园
首页
新随笔
联系
订阅
管理
2026年9月23日
9.re获取猫眼电影top300
摘要: """ 需求:爬取猫眼电影top300 数据来源:https://piaofang.maoyan.com/rankings/year """ import csv import re import requests """ 正则re匹配思路:不管页面标签层级,只看"特征锚定"。 """ def ge
阅读全文
posted @ 2026-09-23 17:31 無心的Man
阅读(4)
评论(0)
推荐(0)
2026年9月4日
8.获取彼岸桌面壁纸
摘要: """ 需求:获取彼岸桌面高清图片 思路: 1、请求列表页,解析网页数据获取每张壁纸的详情页url,拼接url地址; 2、请求详情页,解析网页数据获取每张壁纸的图片url地址以及标题; 3、请求图片真实url地址,如:https://img.netbian.com/file/2026/0902/09
阅读全文
posted @ 2026-09-04 16:53 無心的Man
阅读(32)
评论(0)
推荐(0)
2026年8月24日
7.获取豆瓣读书top250
摘要: """ 获取豆瓣读书top250 1.发送请求,获取html页码数据 2.解析数据,把html转化为解析对象 3.定位数据,根据html页面标签提取数据 4.保存数据 """ import requests import csv import parsel # 创建文件对象 f = open("豆瓣
阅读全文
posted @ 2026-08-24 17:08 無心的Man
阅读(14)
评论(0)
推荐(0)
2026年8月21日
6.parsel+css定位数据并获取豆瓣电影top250-测试
摘要: import requests import parsel import csv # 创建文件对象 f = open("0821_top250.csv", "a", encoding="utf‑8‑sig", newline="") csv_writer = csv.DictWriter(f, [
阅读全文
posted @ 2026-08-21 17:37 無心的Man
阅读(5)
评论(0)
推荐(0)
5.parsel库获取豆瓣top250榜单
摘要: """ 需求:获取豆瓣电影TOP250榜单 ①发起访问:浏览器发起访问目标网页 ②解析数据:提取网页中的目标信息 ③数据存储:将数据保存为本地CSV文件 ④数据筛选:筛选出需求的数据 """ import requests import parsel import csv # 创建文件对象 f =
阅读全文
posted @ 2026-08-21 17:09 無心的Man
阅读(22)
评论(0)
推荐(0)
2025年12月27日
4.爬取电影数据并保存至csv文件
摘要: url = 'https://ssr1.scrape.center/' from parsel import Selector import requests import csv import certifi def get_page(): # 翻页1-10页 for i in range(1,1
阅读全文
posted @ 2025-12-27 15:19 無心的Man
阅读(45)
评论(0)
推荐(0)
2025年10月10日
3.获取微博热搜榜
摘要: 获取微博热搜榜top50 # 获取微博热搜榜 import requests from lxml import etree url = "https://s.weibo.com/top/summary?cate=realtimehot&sudaref=s.weibo.com&display=0&re
阅读全文
posted @ 2025-10-10 15:42 無心的Man
阅读(127)
评论(0)
推荐(0)
2025年9月27日
2.Xpath 提取数据
摘要: XPath,全称是 XML Path Language,即 XML 路径语言,它是一门在 XML 文档中查找信息的语言。它最初是用来搜寻 XML 文档的,但是它同样适用于 HTML 文档的搜索。 表 达 式 描 述 nodename 选取此节点的所有子节点 / 从当前节点选取直接子节点 // 从当前
阅读全文
posted @ 2025-09-27 15:50 無心的Man
阅读(43)
评论(0)
推荐(0)
2025年8月8日
1.AI编程之爬取静态Web页面
摘要: 1.定义与特点 2.爬虫原理 3.HTML文档结构 4.常见HTML标签 5.网页解析技术 6.requests库的使用 7.BeautifulSoup库的使用 8.尊重网站robots.txt协议 9.遵守法律法规和隐私保护 10.处理动态页面 11.案例:利用request抓取猫眼电影票房榜 i
阅读全文
posted @ 2025-08-08 14:47 無心的Man
阅读(64)
评论(0)
推荐(0)
2024年7月7日
HDFS分布式集群搭建
摘要: 1、集群简介 Hadoop 集群具体来说包含两个集群:HDFS 集群和YARN 集群,两者逻辑上分离,但物理上常在一起。 另外,对于 Hadoop 的集群来讲,可以分为两大类角色:master 和 slave。 (1)HDFS 集群:负责海量数据的存储,集群中的角色主要有:NameNode(一个,m
阅读全文
posted @ 2024-07-07 21:29 無心的Man
阅读(258)
评论(0)
推荐(0)
下一页
公告