公众号文章评论,也能批量导出了!
平时刷到爆文,评论区总是格外热闹。
那里藏着最真实的声音——有人抱怨遇到的问题,有人分享自己的解决方案,有人提出质疑,有人补充细节。如果你想研究用户需求、整理痛点、分析讨论趋势,评论区就是现成的素材库。

问题是,评论区虽然信息量大,但很难系统化地整理。折叠回复要一条条手动展开,几百条评论翻下来,光复制粘贴就得花半天。想做深度分析或者批量对比,手工操作根本不现实。
之前我用 RPA 自动化做了某音、某书的评论采集方案,能自动滚动页面、展开折叠、提取数据,最后输出xlsx文件。这次把微叉公众号也加进来了。

但要实现同样的采集效果,微叉这边的实现逻辑和前两者存在明显差异。小红书和抖音都有网页版,可以直接在浏览器里跑自动化流程,页面结构相对规范。微叉公众号没有独立的网页端,只能在 PC 客户端里操作。
**手机微叉虽然同样可以浏览评论,但移动端缺少可直接读取的界面控件信息,自动化部署门槛高,还更容易触发账号风控,因此不做考虑。
桌面软件就比较复杂了。不同应用的底层技术不同,有的用Win32,有的用Java或.Net,元素识别的逻辑各不相同。加上微叉评论区的结构本身就复杂——多层嵌套、各种折叠、作者标识、点赞数据混在一起,常规的点击、坐标定位经常会漏掉关键信息。
所以在这个RPA应用的核心环节我用了pywinauto这个自动化库来解决——不依赖RPA工具常规的元素捕获定位,而是直接操作窗口句柄、遍历控件树,因此能顺利拿到常规"元素捕获"抓不到的文本层。
运行起来后,应用主要完成两件核心工作:
1、先自动定位微叉文章窗口,滚动到评论区,持续点击展开所有折叠回复
别看只是滚动和点击,微叉评论区折叠形态十分复杂,包含 “X 条回复” 子回复、“更多回复”、子回复内部二次折叠,还有作者回复特殊标识。

折叠按钮不会一次性全部加载,还会出现被遮挡、不在可视区域导致点击落空的情况,脚本会只点击可视范围内可操作按钮,未显示的部分先滚动页面,循环往复直到页面底部。

2、展开完,再采集评论信息(含昵称、IP地址、评论日期、评论内容、点赞数等9个字段),导出xlsx表格和层级化Markdown两份文件。
PC 微叉不能直接抓取评论元素,依靠遍历控件树识别每条评论,依靠横向缩进区分评论层级关系——哪条是主评论,哪条是回复,它们之间的从属关系是什么。

同时我还做了一系列数据清洗:标准化相对时间格式、剔除 IP 前缀 “来自”、过滤底部无关互动条,保证输出文件的数据质量。

开发过程中还发现:文章顶部显示的留言总数,和实际能加载出来的数量经常对不上。
顺手问了问微叉开放社区的AI,说是因为:总数统计的是所有留言——精选的、普通的、被折叠的、被限流的都算。但评论区实际显示什么,受平台展示策略、审核状态、折叠规则影响。所以最终能采集到的,是滚动触发加载出来的那部分。少一些是正常的。

说了这么多,这个RPA应用怎么用呢?
- 先妆好影刀RPA的Windows客户端
- “0825”,发你应用地址
- 微叉PC版保持登录/在任务栏显示
- 在微叉里搜一搜或者聊天窗口打开想采集评论的文章
- 直接运行应用就可以了
注意,跑的时候别动鼠标键盘,让微叉窗口保持在前台就好。TX的风控大家都知道,建议拿小号测试,控制好采集频率。
应用跑完后,桌面会生成一个以文章标题命名的文件夹,里面有Excel和Markdown两份格式的采集结果。

说到底,评论区本身就是一份现成的用户调研素材——竞品评论区藏着读者的高频痛点,自己文章的评论区能看到真实反馈,这些信息喂给AI做分析,或者存进知识库慢慢积累,都比刷10篇报告有用。
这套流程能做的,就是把这些散落在折叠回复里的真实声音,变成一份可以长期沉淀的素材资产。
以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~
谢谢你看我的文章,我们下次再见。

-END-
- 爱练字的ISTJ型互联网人/信息整合怪/工具人/影刀高级认证工程师。
- 专注分享:RPA&AI自动化场景提效方案、效率软件安利、实用技能。"所有的生产要素都可以被构建,只有认知是壁垒",欢迎関注 [@掌心向暖RPA自动化]
推荐阅读:
- [拒绝品牌碰瓷!如何通过影刀RPA为品牌IP搭建一套高效的内容合规治理工作流?]
- [那些拥有上千浏览器书签/收藏夹的电脑用户,是怎么管理书签的?]
- [RPA开发中最费脑子的环节,我让AI替我干了 | 以影刀社区Excel拆分挑战为例]
- [RPA还没学明白,OpenClaw就来了?普通人未来还能干点啥]
- [飞书文档附件文件下载RPA方案2.0来了!不仅是PDF,Word、PPT、Excel、视频都能批量导出了,还都是源文件]

浙公网安备 33010602011771号