[agent] Web Agent

导读

从时间线上看,Web Agent 大致经历了:

    • 2022 的 ReAct / WebShop 奠基,
    • 2023 的 Mind2Web / WebArena 走向真实网页
    • 2024 的 SeeAct / VisualWebArena 建立多模态评测与系统雏形,随后在下半年分化出两条关键技术线——规划搜索线(Repeated Sampling → Tree Search → WebDreamer)与 grounding 线(SeeAct → UGround),
    • 到 2025 则进一步进入 InSTA 所代表的互联网规模自动数据生成与训练阶段。 

 

 

Multimodal Autonomous AI Agents


首先 VisualWebArena 提供了一个真实网页环境,用来评测多模态 Agent 是否能完成现实中的网页任务

接着 Tree Search for Language Model Agents 研究的是Agent 在执行任务时如何更聪明地规划和搜索路径,提升决策与推理能力;

最后 Towards Internet-Scale Training for Agents 则进一步思考如何在互联网规模上生成和利用大量任务轨迹来训练 Agent

因此三者的逻辑是:先建立评测环境 → 再改进决策推理 → 最终实现大规模训练,终极目标是训练出能够在真实互联网环境中自主执行复杂任务的 AI Agent

 

其实,重点讲述了 Web Agent。VisualWebArena的成功率确实在这个测试集上表现不佳。

为何人的成功率远远的高于AI?即使在图文加持作为综合输入。

image

image

 

Jeff: 解析PDF中的CAD与解析网站可能算是一个难度级别的事情?不需要再训练微调?

 

image

 

1. 长步骤推理与规划(Long horizon reasoning and planning)

  • 模型在两个网页之间来回跳转,或者陷入循环
    (例如在两个页面之间不断点击,无法继续推进任务)

  • 明明正确完成了任务步骤,却又把它撤销
    (例如已经加入购物车,又把商品删除)

  • Agent 往往过早停止探索或执行
    (例如只看第一个搜索结果就结束任务,没有继续比较)

 

2. 视觉理解失败(Failures in visual processing)

    • 点击了错误的按钮或项目

    • 在复杂网页中无法正确识别特定元素
      (例如找不到正确的商品、链接或按钮)

    • 空间推理能力不足
      例如问题:

      “第一行商品的价格分别是多少?”

      模型可能无法正确理解网页布局。

 

还缺什么?

我们还需要做很多工作来缩小差距:

  • 长时间跨度的推理与规划能力
    (Agent 能够在多步骤、长流程任务中持续进行推理和计划)

  • 允许 Agent 进行搜索(Search)、执行任务,并并行协调多个实例
    同时能够在必要时 向用户请求澄清或确认

  • 更强的视觉-语言-代码模型(vision-language-code models)

  • 确定 Agent 应该使用的合适抽象层级
    (例如:是直接理解 HTML、还是看 网页截图、还是通过 API 操作)

 

多模态模型(Multimodal models)

许多真实世界任务需要 视觉信息作为基础 才能解决,例如:

  • PowerPoint

  • Excel

  • Photoshop

因此,如果要构建强大的通用 Agent,我们需要 训练更强的视觉-语言模型

 

 

Tree Search

Ref: 局部决策,产生全局后果 

局部最优 ≠ 全局最优

这就是为什么需要 Tree Search

Tree Search 的思想是:不要只走一条路。

 

重复采样搜索(Search by Repeated Sampling)

基本思路其实非常简单:

不要只让模型执行一次任务。
而是让模型执行很多次,然后选最好的结果。

基于该策略,大概从之前的16.37%提高到了26%

加大思考深度广度,可以变得更高:37%

image

 

 

未来的研究重点是:
Search + Value Learning + 大规模数据 来提升 Agent 的能力,同时解决 Search 速度和数据收集的问题。

 

 

 提出一种方法,通过 LLM 自动生成和验证网页任务,从而在大规模互联网环境中收集 Agent 交互数据,用于训练更强的 Agent 模型。

Generated Tasks: 

Llama has broad knowledge of sites, such as for timorousbeasties.com, an independent Scottish design studio (fairly obscure)

ancient-symbols.com

    • Look up the meaning of the Om symbol in ancient cultures.

petsforhomes.com.au

    • Find a list of available dogs for adoption in New South Wales.

timorousbeasties.com

    • View the latest fabric designs by the Timorous Beasties studio.

shop.nikon-image.com

    • Compare prices of the Nikon D850 and D500 cameras.

blueridgecountry.com

    • Find a scenic hiking trail in the Blue Ridge Mountains.

awg-fittings.com

    • Find the dimensions of a 1/2" NPT fitting.

 

 

一个案例 - Exploring The Data: InvasivePlantAtlas.org

Step 1

Ask

Find invasive plant species native to North America.
 

Website

https://www.invasiveplantatlas.org
 
回复:

Agent Reasoning(简化)

Agent 判断要查看物种列表,因此点击页面中的 “All Species”

Agent Action

{
"action_key": "click",
"action_kwargs": {},
"target_element_id": 12
}
 

解释

  • click:执行点击操作

  • target_element_id = 12:页面中 “All Species” 按钮对应的元素

流程

网页 → Agent推理 → 生成JSON动作 → 浏览器执行
 
 
Step 2
但不一定是对的操作,下面展示了一次思维“回退”。

现在 Agent 发现:

  • 任务需要找到 sources 信息
  • 但当前页面只有:species list
  • 没有:Sources
 

因此 Agent 推理:

  • 先返回首页
  • 再点击 Sources
 

Agent reasoning(课件文字):

Since the link "Sources" is not on the current page,
I will first click "Home".
 

动作:

{
"action_key": "click",
"target_element_id": 1
}

也就是:点击 Home

 

Jeff: 以上展示了,其实会存在很多次误判,但Agent依然不断探索的过程,类似GPT AGENT MODE。
 
这两个截图展示了 Web Agent 的连续决策过程。Agent 在进入物种列表页面后发现目标链接 “Sources” 不在当前页面,因此决定先点击 “Home” 返回首页,再继续导航到目标页面。这体现了 Agent 在网页环境中的多步规划能力。

 

 

 

 

Planning 的本质是在给定目标后,选择一串能够达到目标状态的动作序列。对 language agent 来说,规划问题比传统 AI 更难,因为目标往往以自然语言表达、动作空间更加开放,而且成功与否通常难以自动判断。

SeeAct

先把问题变成:

  1. 看页面截图(Mind2Web读html的下一步进化)
  2. 理解页面
  3. 决定下一步动作
  4. 执行操作 (具体怎么执行,需要精确到像素点,也就是UGround的任务)

它更像一个完整工作流

 

UGround

进一步把里面一个特别难的问题单独拎出来:

“模型说要点顶部搜索框”,那顶部搜索框到底在屏幕哪里?

最重要的能力不是“想得多深”,而是:

把一句抽象的话,准确对应到屏幕上的某个元素。

比如模型想做这一步:

“在顶部搜索框输入 4k monitor”

但这句话只是“想法”,还不能执行。
还必须进一步变成:

搜索框在屏幕左上方,坐标大概是 (x, y),就在这里点,然后输入。

这就叫 grounding

 

 WebDreamer

一个“会先在脑子里演练几步”的 agent.

在真正点击之前,先在内部想象几条可能路径,再选更好的那条。

 

 

== 总结 ==

SeeAct:会说“该做什么”

UGround:会把“该做什么”准确点到屏幕上

WebDreamer:会提前想几步再决定怎么做

Shopping logs:确实是训练这类 planner 的金矿,但不能直接生吃

 

 
 
 

 

posted @ 2026-03-16 08:44  郝壹贰叁  阅读(86)  评论(0)    收藏  举报