[agent] Web Agent
导读
从时间线上看,Web Agent 大致经历了:
-
- 2022 的 ReAct / WebShop 奠基,
- 2023 的 Mind2Web / WebArena 走向真实网页,
- 2024 的 SeeAct / VisualWebArena 建立多模态评测与系统雏形,随后在下半年分化出两条关键技术线——规划搜索线(Repeated Sampling → Tree Search → WebDreamer)与 grounding 线(SeeAct → UGround),
- 到 2025 则进一步进入 InSTA 所代表的互联网规模自动数据生成与训练阶段。
Multimodal Autonomous AI Agents
首先 VisualWebArena 提供了一个真实网页环境,用来评测多模态 Agent 是否能完成现实中的网页任务;
接着 Tree Search for Language Model Agents 研究的是Agent 在执行任务时如何更聪明地规划和搜索路径,提升决策与推理能力;
最后 Towards Internet-Scale Training for Agents 则进一步思考如何在互联网规模上生成和利用大量任务轨迹来训练 Agent。
因此三者的逻辑是:先建立评测环境 → 再改进决策推理 → 最终实现大规模训练,终极目标是训练出能够在真实互联网环境中自主执行复杂任务的 AI Agent。
其实,重点讲述了 Web Agent。VisualWebArena的成功率确实在这个测试集上表现不佳。
为何人的成功率远远的高于AI?即使在图文加持作为综合输入。


Jeff: 解析PDF中的CAD与解析网站可能算是一个难度级别的事情?不需要再训练微调?

1. 长步骤推理与规划(Long horizon reasoning and planning)
-
模型在两个网页之间来回跳转,或者陷入循环
(例如在两个页面之间不断点击,无法继续推进任务) -
明明正确完成了任务步骤,却又把它撤销
(例如已经加入购物车,又把商品删除) -
Agent 往往过早停止探索或执行
(例如只看第一个搜索结果就结束任务,没有继续比较)
2. 视觉理解失败(Failures in visual processing)
-
点击了错误的按钮或项目
-
在复杂网页中无法正确识别特定元素
(例如找不到正确的商品、链接或按钮) -
空间推理能力不足
例如问题:“第一行商品的价格分别是多少?”
模型可能无法正确理解网页布局。
还缺什么?
我们还需要做很多工作来缩小差距:
-
长时间跨度的推理与规划能力
(Agent 能够在多步骤、长流程任务中持续进行推理和计划) -
允许 Agent 进行搜索(Search)、执行任务,并并行协调多个实例
同时能够在必要时 向用户请求澄清或确认 -
更强的视觉-语言-代码模型(vision-language-code models)
-
确定 Agent 应该使用的合适抽象层级
(例如:是直接理解 HTML、还是看 网页截图、还是通过 API 操作)
多模态模型(Multimodal models)
许多真实世界任务需要 视觉信息作为基础 才能解决,例如:
-
PowerPoint
-
Excel
-
Photoshop
因此,如果要构建强大的通用 Agent,我们需要 训练更强的视觉-语言模型。
Tree Search
Ref: 局部决策,产生全局后果
局部最优 ≠ 全局最优
这就是为什么需要 Tree Search
Tree Search 的思想是:不要只走一条路。
重复采样搜索(Search by Repeated Sampling)
基本思路其实非常简单:
不要只让模型执行一次任务。
而是让模型执行很多次,然后选最好的结果。
基于该策略,大概从之前的16.37%提高到了26%。
加大思考深度广度,可以变得更高:37%

未来的研究重点是:
用 Search + Value Learning + 大规模数据 来提升 Agent 的能力,同时解决 Search 速度和数据收集的问题。
提出一种方法,通过 LLM 自动生成和验证网页任务,从而在大规模互联网环境中收集 Agent 交互数据,用于训练更强的 Agent 模型。
Generated Tasks:
Llama has broad knowledge of sites, such as for timorousbeasties.com, an independent Scottish design studio (fairly obscure)
ancient-symbols.com
-
- Look up the meaning of the Om symbol in ancient cultures.
petsforhomes.com.au
-
- Find a list of available dogs for adoption in New South Wales.
timorousbeasties.com
-
- View the latest fabric designs by the Timorous Beasties studio.
shop.nikon-image.com
-
- Compare prices of the Nikon D850 and D500 cameras.
blueridgecountry.com
-
- Find a scenic hiking trail in the Blue Ridge Mountains.
awg-fittings.com
-
- Find the dimensions of a 1/2" NPT fitting.
一个案例 - Exploring The Data: InvasivePlantAtlas.org
Step 1
Ask
Website
Agent Reasoning(简化)
Agent 判断要查看物种列表,因此点击页面中的 “All Species”。
Agent Action
"action_key": "click",
"action_kwargs": {},
"target_element_id": 12
}
解释
-
click:执行点击操作 -
target_element_id = 12:页面中 “All Species” 按钮对应的元素
流程
现在 Agent 发现:
- 任务需要找到 sources 信息
- 但当前页面只有:species list
- 没有:Sources
因此 Agent 推理:
- 先返回首页
- 再点击 Sources
Agent reasoning(课件文字):
I will first click "Home".
动作:
"action_key": "click",
"target_element_id": 1
}
也就是:点击 Home
Jeff: 以上展示了,其实会存在很多次误判,但Agent依然不断探索的过程,类似GPT AGENT MODE。这两个截图展示了 Web Agent 的连续决策过程。Agent 在进入物种列表页面后发现目标链接 “Sources” 不在当前页面,因此决定先点击 “Home” 返回首页,再继续导航到目标页面。这体现了 Agent 在网页环境中的多步规划能力。
SeeAct
先把问题变成:
- 看页面截图(Mind2Web读html的下一步进化)
- 理解页面
- 决定下一步动作
- 执行操作 (具体怎么执行,需要精确到像素点,也就是UGround的任务)
它更像一个完整工作流。
UGround
进一步把里面一个特别难的问题单独拎出来:
“模型说要点顶部搜索框”,那顶部搜索框到底在屏幕哪里?
最重要的能力不是“想得多深”,而是:
把一句抽象的话,准确对应到屏幕上的某个元素。
比如模型想做这一步:
“在顶部搜索框输入 4k monitor”
但这句话只是“想法”,还不能执行。
还必须进一步变成:
搜索框在屏幕左上方,坐标大概是 (x, y),就在这里点,然后输入。
这就叫 grounding。
WebDreamer
一个“会先在脑子里演练几步”的 agent.
在真正点击之前,先在内部想象几条可能路径,再选更好的那条。
== 总结 ==
SeeAct:会说“该做什么”
UGround:会把“该做什么”准确点到屏幕上
WebDreamer:会提前想几步再决定怎么做
Shopping logs:确实是训练这类 planner 的金矿,但不能直接生吃

浙公网安备 33010602011771号