BrowserAct,给AI Agent配一个真实浏览器,从安装到实战
大家好,我是狂师。
事情是这样的,最近群里在聊一个老话题,Agent 什么都行,一到「去网站上帮我看看」就歇菜。
页面是动态渲染的,curl 拿到一坨壳。数据要登录才能看,无头浏览器里 session 又不延续。好不容易进去了,Cloudflare 一个挑战页甩脸上。
Static page还好,现在稍微像样点的网站,反爬、验证码、登录态,三道墙至少撞上一道。
Agent 缺的其实就一样东西,一个能感知真实在跑的浏览器。
BrowserAct 补的就是这块,今天这篇聊一聊,它是什么、能干什么、怎么装、怎么用。
BrowserAct 是什么
一句话概括,它是一款给 AI Agent 用的浏览器自动化 CLI,带全套反封锁能力。
开源仓库在 GitHub,browser-act/skills,MIT 协议、Python 写的。
今年 2 月才开源,半年时间 Star 冲到 5.6K,目前还在持续更新。它有两种用法,云端和本地,官网上那张对比图说得很清楚。

云端模式,去官网输入框里写一句你要什么数据,比如「抓 京东官网 无线耳机销量前 20,要价格、评分、库存和链接」,它自己建爬虫、自己验证、自己跑,产出结构化表格,还能定时重复执行。
本地模式,装两个 Agent Skill 进你的 Claude Code、Cursor 或者 Codex,Agent 就能直接指挥一个真浏览器干活,读你登录后的页面、填表单、点按钮、截图、抓请求。
两个 Skill 分工明确。
browser-act 是执行层,负责当下这个网页任务跑通。
browser-act-skill-forge 是沉淀层,把这次摸索的过程记下来,生成可复用的 SKILL.md 和脚本,下次同类任务直接调,不用从头探路。

能干什么,厉害在哪
翻完仓库 README,它的能力可以归成四块。
第一,三层反封锁。
环境层用隐身指纹、TLS 轮换、代理切换,让大多数拦截根本不触发。
执行层有 solve-captcha 自动过验证码,stealth-extract 一条命令拉取受保护页面。实在过不去还有人这一层,remote-assist 生成一个链接,你手机上点开接管,点完 Agent 接着跑。
第二,三种浏览器模式。
chrome 模式直接复用本地 Chrome 的登录态,cookies、扩展全带上。stealth privacy 模式每次全新指纹零残留,适合批量抓取。stealth fixed identity 模式指纹和 IP 都固定,适合登录账号长期多开,不被判定成机器人。

第三,为 Agent 而设计,不是为人写的脚本。
页面输出是索引化文本,比塞整页 HTML 省好几倍 token。交互靠索引,state 列出可点元素,click 3 点第三个,input 2 "ai" 往第二个框打字,不用解析 DOM。
第四,安全确认门控。
建浏览器、删浏览器、导入本地登录态、改代理,这些敏感动作一律先停下来等你确认,而且上次的授权不会顺延到下次。Agent 可以帮你操作网页,但动不动的决定权在人。
怎么安装
在 Claude Code、Cursor、OpenClaw 这类 Agent 环境里,最省事的方式是直接让 Agent 装。
跟它说,请帮我安装 BrowserAct Skill: https://github.com/browser-act/skills/tree/main/browser-act, 并检查运行环境,安装完成后执行 browser-act get-skills core --skill-version 2.0.2。
Agent 实际跑的命令是这三条。
npx skills add browser-act/skills --skill browser-act
npx skills add browser-act/skills --skill browser-act-skill-forge
browser-act get-skills core --skill-version 2.0.2
装完可以先来个零配置冒烟,一条命令抓取受保护页面。
browser-act stealth-extract https://x.com
完整自动化是这么一套动作,open 打开页面,state 看元素,click 按索引点,input 按索引填。
browser-act --session my-task browser open <id> https://x.com
browser-act --session my-task state
browser-act --session my-task click 3
browser-act --session my-task input 2 "ai"
get-skills 这步别省,Agent 每次会话开头跑一次,环境状态、浏览器列表、可用命令一次拿全,后面才知道哪些动作能直接做、哪些要停下来问你。
实战一,让 Agent 读你登录后的 GitHub Issue
这是我觉得最实用的一个场景,拿开源仓库的日常维护走一遍。
维护开源仓库的人都知道,Issue 列表扫一眼看不出什么,哪个有 PR 在等 Review,哪个其实修完了可以关,哪几个是同一个配置问题可以合并处理,这些都得点进详情页看讨论。
以前只能自己一个个点。现在把提示词丢给装好 BrowserAct 的 Claude Code。
使用 browser-act 进入我已登录的 GitHub 仓库,读取最近 10 个 open issue,
按 bug / feature / question 分类,输出标题、关键上下文、
可能涉及的模块、建议优先级、是否需要我进一步确认
它会先列出你本地的 Chrome Profile,说明接下来的动作,创建一个 chrome 类型浏览器,导入你的 GitHub 登录态。你确认之后它才继续,导入 cookies 和 localStorage,打开仓库的 Issues 页,逐个进详情页读上下文,最后给你一份分类报告,几条 Feature、几条 Bug、几条 Question,各自建议的优先级。
关键就在那个「你确认之后」。它进的是你登录态能看到的页面,但导入登录态这个动作本身,必须你点头。
读取整理归类交给 Agent,关 Issue 合 PR 这类状态变更留给人,边界清楚。
实战二,云端一句话建一个可复用爬虫
第二个例子换到云端上执行,适合不想装任何东西的人。
打开官网,在输入框里写一句话,拿官网当前的演示来说: 抓 京东 无线耳机销量前 20,字段要价格、评分、库存和来源链接。

它会在云端的真浏览器里自己探索页面、自己建爬虫、自己验证,首次构建的演示耗时 2 分 44 秒、消耗 3 个 credit,产出结构化表格。爬虫建好之后就是复用资产,之后每次重跑,20 条数据 18 秒收完。

有意思的是页面的自愈设计。网站改版了,爬虫路径失效,它会自己找新路径、验证通过后继续跑,不用你重新配选择器。做过爬虫的人都知道,选择器维护是最大的暗坑,这个设计等于把暗坑填了。
跑通的 Bot 还能挂定时任务,每天定时抓一遍,结果走 CSV、JSON、Zapier、n8n 都行。官网有个模板市场,YouTube 评论、Amazon 榜单、Reddit 帖子、Google Maps 商户,现成模板直接用。
我的一点看法
说点我自己的看法。
第一,它踩的位置很准。Agent 的短板从来不是写代码,是「跟真实世界打交道」。真实世界的网页有登录、有验证码、有反爬,这一层补上了,Agent 的活动范围直接扩大一圈。
第二,登录态复用是杀手锏。之前让 Agent 查我的 Issue、读我的订单,想都不敢想,现在它是「我」在操作,权限边界又卡在人确认这一步,这个设计比功能本身更值得夸。
第三,提醒一句,能力越大越要看清边界。能过验证码、能带登录态的自动化,用在哪条线上,合规责任在使用者自己,别拿去干网站明令禁止的事。
工具是好工具,回来我打算拿它把知识星球每日巡场那套流程再自动化一层,跑通了再来汇报。

浙公网安备 33010602011771号