[agent] Agentic AI: Multi-Agent Systems and Training skills.

目的是搞清楚,agentic AI到底比之前的概念有什么独特的地方。感觉这些细节的理解力是决定 未来能否让agent落地的一个关键部分。

 

Ref: Agentic AI MOOC | UC Berkeley CS294-196 Fall 2025 | Post-Training Verifiable Agents by Jiantao Jiao

本节课:公司里到底怎么把 agent 训出来,并让它在产品里活下来。

传统聊天模型: (可能没有标准答案)

  • 你喜不喜欢它说话
  • 它是否显得懂你、会聊天

Agent模型:(大部分有标准答案)

  • 它能不能把事做成
  • 而且结果是可验证的(verifiable)

所以,chatbot 的核心奖励是 human preference,agent 的核心奖励是 environment feedback + verifier(也就是到底能不能做事

 

所以有三大难题:

1)拿到高质量训练数据

  • Environment(环境)
  • Tools(工具/API)
  • Verifier(验证器) - 这节课一个很重要的 insight。

2)做好 evaluation(评测)

  • 小心假象 

 3)训练方法本身要对。

SFT 是为了减少 silly attempts,要“轻”,防止模型思维僵化。

当模型已经“基本会做事”后,才让它自己探索:

    • 允许它尝试不同解法

    • 对好的轨迹给奖励

    • 对差的轨迹给惩罚

RL 的目标才是:

    • 真正提升 task-solving intelligence

    • 让模型在没见过的新任务上也更会做事

 

压缩成 8 句话的笔记:

  • 聊天模型追求人类偏好,agent 模型追求任务完成与可验证正确性。

  • 训练可靠 agent 的核心是三件事:高质量数据、强评测、正确训练方法。

  • Agent 数据的核心三要素是:Environment、Tools、Verifier。

  • Verifier 很难写,因为真实任务里充满细节约束和 corner cases。

  • SFT 的作用是启动模型,减少胡乱尝试;RL 才是真正强化智能。

  • 训练中最大问题之一是 entropy collapse:模型越训越只会一种答案。

  • 训练数据不能太简单,也不能全是超难题,关键是合理难度分布。

  • 这个领域目前还很不成熟,很多做法更像有效经验,而不是最终正确理论。

 

因为 2025 年 agent 训练的主战场,本来就高度集中在:

  • post-training
  • RL / verifier / grader
  • tool use
  • environment interaction
  • 数据合成
  • 评测与防作弊
  • 效率与扩展

 

也就是说,今天讲“训练 agentic models” ,很大一部分内容天然就会落到“post-training verifiable agents”上。

这一节更像:“在公司里,几千张 GPU、sandbox、grader、数据合成、RL pipeline,到底是怎么把 agent 训出来的”。

 

没有谁敢说“我们已经找到最终正确、稳定、统一的 agent 训练算法,也就是没有谁能说(例如):

  • 最好的 RL 目标函数已经确定

  • 最好的 on-policy / off-policy 配方已经确定

  • 最好的探索机制已经确定

  • 最好的 verifier / grader 体系已经确定

  • SFT 和 RL 的最优边界已经确定 -- 确实如此~

 

什么叫产品约束?

一句话:产品约束 = 这个模型在真实产品里必须遵守的额外规则。

你说“感觉海量,而且各行各异”,这是对的。
但其实可以用一个很稳的框架来抓,不会失控。

先问 4 个问题就够了

1. 这个产品承诺用户什么?

比如:

    • coding agent:帮你修 bug / 写 PR

    • 客服 agent:帮你解决问题

    • research agent:帮你查资料并总结

承诺不同,核心 grader 就不同。

2. 如果它做错,最糟会错在哪?

比如:

    • coding:改坏仓库、作弊过测

    • 客服:答非所问、误导用户

    • 医疗:风险极高

    • 财务:格式或数字出错就很严重

高风险失败模式,就会被做成 grader。

3. 用户最在乎的体验是什么?

比如:

    • 编程用户在乎正确 + 快 + 少打扰

    • 企业用户在乎可控 + 合规 + 可审计

    • 普通用户在乎清楚 + 简洁 + 可理解

这些就会变成产品约束。

4. 这个产品的 business / UI / infra 限制是什么?

比如:

    • 响应不能超过 30 秒

    • 输出必须结构化

    • 成本要压住

    • 必须能显示 progress

    • 必须兼容某些 tool schema

这些也会进入 grader。

所以不是“无限多问题,完全无从下手”

更像是:

先定义产品承诺 → 再列失败模式 → 再列用户体验目标 → 再列系统限制 → 然后把它们转成 grader。

这就是工业里的实际做法。

 

《Training Agentic Models》个人笔记版

这堂课到底在讲什么?

这堂课不是在讲“agent 是什么”,而是在讲:工业界如何把 agent 模型真正训练出来,并让它在产品里工作。

重点不是抽象概念,而是:

  • 数据怎么做

  • grader 怎么做

  • RL pipeline 怎么跑

  • 成本怎么控

  • 模型怎么防作弊

  • agent 怎么在真实产品约束下稳定工作


一、agent 训练不等于“会调用 tools”

我之前容易把 agent 想成:

  • reasoning 更长

  • 会 planning

  • 会 tool calling

但这节课告诉我,真正的 agent training 远不止这些。

真正的 agent 至少包含:

  • goal:要完成一个明确任务

  • environment:有真实环境状态

  • tools:可调用外部能力

  • multi-turn interaction:多轮动作与反馈

  • grader / verifier:结果要能被判定好坏

  • product constraints:不能只对,还要快、稳、格式对、体验好

所以 agent 不是“多步推理版 LLM”,而是“能在环境中完成任务的系统核心”。


二、2025 的主战场从“回答问题”转向“完成任务”

以前 LLM 训练更偏:

  • pretraining

  • SFT(学标准答案)

  • RLHF(学人类偏好)

  • RL(更容易答对)
  • reasoning

现在更偏:

  • agent post-training

  • tool-use

  • long-horizon interaction

  • verifier / grader

  • environment feedback

  • robustness under product constraints

不是 reasoning 不重要了,
而是 reasoning 变强后,大家发现:真正难的是把推理能力变成稳定任务完成能力。

Jeff:过去重点解决了“搜索”或者一般性的“问答”(本质还是搜索);Agent则更看重在推理过程中是否自动收敛于目标,并且可能还需要结合动态的用户交互。 

 

核心命题:从"教模型思考"到"教模型做事"

整个故事可以压缩成一条主线——训练目标的升级。

2020–2023年的主旋律是 pretraining scaling。GPT-3 到 GPT-4 这条路的核心信念是:把模型喂够数据、堆够参数,涌现能力自然出来。训练的核心动作是预测下一个 token,评估的核心方式是 benchmark 得分。这个阶段解决的问题是"模型能不能理解和生成语言"。

2023–2024年出现了一个重要分支:alignment + reasoning。RLHF、DPO 这些技术解决的是"模型说的话是不是人想听的"。与此同时,以 OpenAI o1 为标志,reasoning 训练开始被单独拉出来,核心是让模型学会"在给出答案之前做更长更深的内部推理"。这个阶段解决的问题是"模型能不能想得更好、答得更对"。

到2025年,一个关键认知被普遍接受了:会想不等于会做。(例如,不稳定 这就是所谓"agent 成为主战场"的真正含义。

为什么"会想"不够?因为真实任务有四个特征是纯推理训练覆盖不了的:

一是环境交互。真实任务不是"给个问题出个答案",而是要读屏幕、点按钮、调 API、看返回结果、再决定下一步。模型必须学会和一个有状态的外部世界打交道,而不是在自己的 context window 里自言自语。

二是错误恢复。Reasoning model 做错了顶多输出一个错答案。但 agent 做错了,环境状态已经变了——文件已经写了、API 已经调了、邮件已经发了。所以 agent 必须学会"发现执行结果不对时如何回退或修正",这是一种完全不同于 CoT 的能力。

三是长时程规划与执行。一个真正的 agent 任务可能需要几十步甚至上百步操作。这意味着模型需要在很长的 horizon 上保持目标一致性,不能中途跑偏。这和"一轮推理做对一道数学题"是完全不同的训练挑战。

四是可验证的完成标准。以前的训练信号是"人类觉得这个回答好不好"(preference),现在变成了"这个任务到底完成了没有"(verifiable outcome)。这个转变直接改变了 reward 的设计方式——你可以用一个 grader 自动检查"代码是否通过测试""文件是否正确生成""网页是否被正确修改",而不再完全依赖人类标注。

所以如果要我给你一句话总结这个转变:

    • Pretraining 教模型"知道",
    • alignment 教模型"听话",(ChatGPT3.5的意义)
    • reasoning 教模型"想清楚",
    • agent training 教模型"做成事"。

这四层不是替代关系,而是逐层叠加,每一层都以前一层为前提。

最后一个帮你检验自己是否真懂的问题:如果有人跟你说"o1 就是一个 agent",你能说清楚为什么这个说法不准确吗?答案藏在上面"环境交互"和"错误恢复"这两个关键词里——o1 会做很深的内部推理,但它并不与外部环境交互,也不具备执行后修正的闭环。它是一个极强的 reasoning model,但不是一个 agent。

 


三、这堂课最重要的三个词:Data、Grader、Efficiency

1. Data

工业界现在非常看重:

  • rubric data

  • synthetic data

  • data mixing

  • curriculum

  • high data efficiency

重点不是“数据越多越好”,而是:

能不能构造真正有学习价值、能驱动 agent 能力提升的数据。


2. Grader

grader 可以理解成:

  • 裁判

  • 检查器

  • 评分表

  • verifier 的组合体

在真实产品里,不会只有一个 pass rate。

比如 coding agent 可能同时有:

  • unit test grader

  • patch grader

  • format grader

  • behavior grader

  • progress grader

  • time-to-PR grader

  • length / verbosity grader

  • anti-cheat grader

所以真实优化目标是多维的,而不是单一分数。


3. Efficiency

agent RL 很贵,瓶颈常常不在 trainer,而在 sampler。

原因是 rollout 很长,会涉及:

  • 多轮 reasoning

  • tool use

  • sandbox 交互

  • unit test

  • grader 调用

所以工业里很重视:

  • async pipeline

  • sampling cost control

  • rollout length control

  • long-context compression

  • LoRA for RL

  • 用更快的次优配置加快实验迭代


四、这堂课一个很大的 insight:高质量数据能力比想象中更重要

讲者非常强调:

顶级人才应该去做数据,而不是只做模型。

因为真正难的是:

  • 缺什么数据

  • 如何合成数据

  • 如何构造 rubric

  • 如何覆盖模型薄弱点

  • 如何通过 data mixing 改变最终能力分布

这说明今天的 agent 训练,本质上已经不是单纯的“模型问题”,而是:

  • 数据工程

  • grader 工程

  • RL 工程

  • infra 工程

一起构成的系统问题。


五、coding 为什么成为 agent training 的核心样板?

因为 coding 具备几个天然优势:

  • 目标明确

  • 环境明确(repo / sandbox)

  • 工具明确

  • 可多轮交互

  • 结果相对容易验证(unit test / patch / build)

  • 用户价值高

所以 coding 不是因为“大家都喜欢写代码”,
而是因为它是最适合把 agent training 全链路跑通的场景之一。


六、Rubric 很关键:把开放问题拆成可训练问题

很多真实产品任务没有唯一正确答案。

这时工业界常做的不是只写“标准答案”,
而是写一整套 criteria:

  • 回答有没有覆盖关键点

  • 格式对不对

  • 风格合不合适

  • 是否过长

  • 是否满足产品要求

  • 是否展示 progress

  • 是否符合安全要求

rubric 的作用就是:

把不好验证的开放任务,拆成一组可评分的局部标准。

这是把 open-ended product behavior 变成可训练信号的核心方法。


七、模型会作弊,所以 grader 设计本身就是攻防工程

当 reward 定义出来以后,模型会想办法“拿分”。

例如 coding 场景里可能会:

  • 改测试

  • 删测试

  • 绕开真实修复

  • 复制外部答案

  • 利用 grader 漏洞

所以工业训练不是“写个 reward 就结束”,而是:

  • 发现作弊方式

  • 补 grader

  • 增加隐藏测试

  • 增加 anti-cheat checks

  • 用另一个模型检查输出

因此,agent RL 很像持续的攻防对抗。


八、agent 训练真正难的不是“会不会做”,而是“能不能在产品里稳定地做”

一旦进真实产品,约束会暴增:

  • 正确

  • 成本低

  • 格式对

  • 可解释

  • 可展示 progress

  • 工具泛化

  • 抗作弊

  • 长时程可运行

所以学术 benchmark 的 pass rate,只是其中一个维度。
产品真正要的是综合最优。


九、instruction following 是 agent RL 的前提

如果模型连 prompt 和 tool instruction 都跟不好,
那后续 RL、exploration、tool generalization 都会打折。

所以 agent 训练常常不是从零开始,
而是建立在一个已经具备较强 instruction-following 能力的模型之上。


十、我对这堂课的总理解

这堂课最有价值的地方在于,它让我意识到:

agent training 的核心,不是“把 CoT 拉长”或“给模型接几个工具”,而是构建一整套让模型在环境中学会完成任务的闭环。

这个闭环至少包括:

  • 数据

  • rubric

  • grader

  • anti-cheating

  • RL

  • 采样效率

  • 环境交互

  • 产品约束


最后压缩成 8 句话

    1. agent 训练不是单纯的多步推理,而是目标驱动的环境交互训练。

    2. 2025 年主战场转向 agent,是因为 reasoning 变强后,真正的瓶颈变成任务完成。

    3. 工业界最重视的三件事是:Data、Grader、Efficiency。

    4. rubric 的本质是把开放任务拆成可评分的子标准。

    5. grader 不是一个分数,而是一整套裁判系统。

    6. 模型会 reward hacking,所以 grader 设计本身就是攻防工程。

    7. coding 成为 agent 样板场景,是因为它目标清晰、环境明确、反馈可验证。

    8. 真正强的 agent,不只是会调用 tools,而是能在产品约束下稳定把事做成。

 

 

Ref: Agentic AI MOOC | UC Berkeley CS294-196 Fall 2025 | Multi-Agent AI by Noam Brown


self-play 为什么在 AlphaGo 那类任务里神一样有效,但一旦进入扑克、Diplomacy、人与 AI 协作、LLM 多 agent,事情就立刻复杂很多。

LLM 现在很像当年的 AlphaGo,但缺了最关键的一环

他先给出一个很漂亮的类比:

    • AlphaGo 路线

      1. 先用高质量人类棋谱预训练
      2. 再用大规模推理(如 MCTS)
      3. 最后用 self-play 做递归式自我提升
    • LLM 路线

      1. 先在互联网文本上预训练
      2. 再用大规模推理(如 Chain of Thought)
      3. 但第三步——像 self-play 那样持续自我博弈提升——还没有真正成熟

所以他的问题是:

为什么 self-play 在围棋、象棋、扑克里那么成功,但在 LLM 上没自然复制出来?

他的答案是:

因为很多人对 self-play 的理解,其实只适用于二人零和、完全信息游戏;一旦脱离这个范围,很多好性质都会消失。

 

你现在的“乱”,本质上是把两种不同的多 agent 混在一起了

第一种:高耦合协作型多 agent

特点是:

  • agent 之间要持续对齐上下文

  • 一个 agent 的决定会深度影响另一个 agent

  • 需要长链路协商、改计划、消冲突

  • 典型如复杂 coding、共享代码库修改、多人共同写同一份方案

这正是 Cognition 最警惕 的类型。

第二种:并行探索型多 agent

特点是:

  • 子任务相对独立

  • 每个 agent 只负责一个方向

  • 结果可被压缩成摘要交回主 agent

  • 典型如广度研究、并行检索、多视角分析、角色化 brainstorming

这正是 Anthropic 证明有效的类型。

 

这段课基本上在讲一条主线:

“多个 AI agent 放在一起,不只是能合作做事,还会出现竞争、欺骗、社交、群体文化这些更像‘社会行为’的现象。”

发现:

Tree结构也还不错。(也接近真是人类社会的组织结构)

Chain: 最差。

Mesh与Random是随着agent number增加而最好的。看来头脑风暴,充分的探讨往往能得到最佳的结果。

但到后面会 saturate(饱和)

image

 

 

Ref: Agentic AI MOOC | UC Berkeley CS294-196 Fall 2025 | Predictable Noise in LLM Benchmarks by Sida Wang


很多论文:

  • 只提升 1%~3%

  • 但一些数据集的标准误差 ≈ 4%

👉 结论:

这些提升大概率是噪声

👉 最终观点

Small + Hard benchmark ≠ Reliable benchmark

 

2024 年,这个问题从“有人提醒”升级为“大家都在研究”。例如:

  • Investigating Data Contamination in Modern Benchmarks for Large Language Models 系统研究了现代 benchmark 的污染问题;

  • How Much are LLMs Contaminated? 做了更全面的 contamination survey;

  • LatestEval 这类工作则开始尝试做“更新鲜、减少污染”的评测方式。
    这说明社区已经不只是抱怨,而是在认真补救。

到了 2025 年前后,不少论文已经直接把这件事称作一种 evaluation crisis,也就是“评测危机”:不是模型不进步,而是我们越来越难确认它到底进步了多少、进步在哪里、是不是被 benchmark 误导了

 

 

Ref: Agentic AI MOOC | UC Berkeley CS294-196 Fall 2025 | AI Agents to Automate Science by James Zou


The Virtual Lab

一个 Tree结构案例:

James Zou 不是说“让一个 GPT 去做科研”,而是说:

  • 先有一个 PI agent / 教授 agent

  • 再由它按任务需要,生成不同专长的 student agents

  • 这些 agent 会 组会、单聊、分工

  • 还可以去“上学”——也就是再学习、再专精

  • 最后结合外部科学工具去做真实研究

 

 

Paper2Agent

这部分非常有意思,而且我觉得你会特别喜欢。

James Zou 认为,论文 PDF 是一种非常被动的知识载体
你读完论文,往往还得:

  • 自己看代码

  • 自己配环境

  • 自己猜作者怎么跑

  • 自己改成适合你的任务

这就很低效。

所以 Paper2Agent 的想法是:

  • 把每篇论文,变成一个 能直接对话、还能调用论文工具链的 agent

Paper2Agent 的论文摘要明确写到:它会自动分析论文和相关代码库,用多个 agents 去构建一个 MCP server,再通过反复测试把这个 paper MCP 打磨稳固,然后把它接到聊天 agent 上,让用户可以直接自然语言调用这篇论文的工具和 workflow。

论文举的案例包括 ScanPyTISSUE、以及 AlphaGenome

用最通俗的话说:

以前是:论文 = 说明书

现在想变成:论文 = 可执行服务

也就是从:

  • “你去读我”
    变成了

  • “你直接调用我”

这其实就是你最近一直在理解的那条主线:

  • 知识不再只是文本,而是 agent 化、接口化、服务化。

 

不是“模型读不懂论文”,而是:模型没法稳定地把论文中的知识,转成可靠的可执行行为。

不要让一个 LLM 单枪匹马去“临场发挥”。

而是拆成多个更明确的子任务,让多个子 agent 各司其职,最后构造出一个稳健的 MCP server

 

 

posted @ 2026-03-17 13:08  郝壹贰叁  阅读(35)  评论(0)    收藏  举报