[agent] Agentic AI: Multi-Agent Systems and Training skills.
目的是搞清楚,agentic AI到底比之前的概念有什么独特的地方。感觉这些细节的理解力是决定 未来能否让agent落地的一个关键部分。
Ref: Agentic AI MOOC | UC Berkeley CS294-196 Fall 2025 | Post-Training Verifiable Agents by Jiantao Jiao
本节课:公司里到底怎么把 agent 训出来,并让它在产品里活下来。
传统聊天模型: (可能没有标准答案)
- 你喜不喜欢它说话
- 它是否显得懂你、会聊天
Agent模型:(大部分有标准答案)
- 它能不能把事做成
- 而且结果是可验证的(verifiable)
所以,chatbot 的核心奖励是 human preference,agent 的核心奖励是 environment feedback + verifier(也就是到底能不能做事)
所以有三大难题:
1)拿到高质量训练数据
- Environment(环境)
- Tools(工具/API)
- Verifier(验证器) - 这节课一个很重要的 insight。
2)做好 evaluation(评测)
- 小心假象
3)训练方法本身要对。
SFT 是为了减少 silly attempts,要“轻”,防止模型思维僵化。
当模型已经“基本会做事”后,才让它自己探索:
-
-
允许它尝试不同解法
-
对好的轨迹给奖励
-
对差的轨迹给惩罚
-
RL 的目标才是:
-
-
真正提升 task-solving intelligence
-
让模型在没见过的新任务上也更会做事
-
压缩成 8 句话的笔记:
-
聊天模型追求人类偏好,agent 模型追求任务完成与可验证正确性。
-
训练可靠 agent 的核心是三件事:高质量数据、强评测、正确训练方法。
-
Agent 数据的核心三要素是:Environment、Tools、Verifier。
-
Verifier 很难写,因为真实任务里充满细节约束和 corner cases。
-
SFT 的作用是启动模型,减少胡乱尝试;RL 才是真正强化智能。
-
训练中最大问题之一是 entropy collapse:模型越训越只会一种答案。
-
训练数据不能太简单,也不能全是超难题,关键是合理难度分布。
-
这个领域目前还很不成熟,很多做法更像有效经验,而不是最终正确理论。
因为 2025 年 agent 训练的主战场,本来就高度集中在:
- post-training
- RL / verifier / grader
- tool use
- environment interaction
- 数据合成
- 评测与防作弊
- 效率与扩展
也就是说,今天讲“训练 agentic models” ,很大一部分内容天然就会落到“post-training verifiable agents”上。
这一节更像:“在公司里,几千张 GPU、sandbox、grader、数据合成、RL pipeline,到底是怎么把 agent 训出来的”。
没有谁敢说“我们已经找到最终正确、稳定、统一的 agent 训练算法,也就是没有谁能说(例如):
-
最好的 RL 目标函数已经确定
-
最好的 on-policy / off-policy 配方已经确定
-
最好的探索机制已经确定
-
最好的 verifier / grader 体系已经确定
-
SFT 和 RL 的最优边界已经确定 -- 确实如此~
什么叫产品约束?
一句话:产品约束 = 这个模型在真实产品里必须遵守的额外规则。
你说“感觉海量,而且各行各异”,这是对的。
但其实可以用一个很稳的框架来抓,不会失控。
先问 4 个问题就够了
1. 这个产品承诺用户什么?
比如:
-
-
coding agent:帮你修 bug / 写 PR
-
客服 agent:帮你解决问题
-
research agent:帮你查资料并总结
-
承诺不同,核心 grader 就不同。
2. 如果它做错,最糟会错在哪?
比如:
-
-
coding:改坏仓库、作弊过测
-
客服:答非所问、误导用户
-
医疗:风险极高
-
财务:格式或数字出错就很严重
-
高风险失败模式,就会被做成 grader。
3. 用户最在乎的体验是什么?
比如:
-
-
编程用户在乎正确 + 快 + 少打扰
-
企业用户在乎可控 + 合规 + 可审计
-
普通用户在乎清楚 + 简洁 + 可理解
-
这些就会变成产品约束。
4. 这个产品的 business / UI / infra 限制是什么?
比如:
-
-
响应不能超过 30 秒
-
输出必须结构化
-
成本要压住
-
必须能显示 progress
-
必须兼容某些 tool schema
-
这些也会进入 grader。
所以不是“无限多问题,完全无从下手”
更像是:
先定义产品承诺 → 再列失败模式 → 再列用户体验目标 → 再列系统限制 → 然后把它们转成 grader。
这就是工业里的实际做法。
《Training Agentic Models》个人笔记版
这堂课到底在讲什么?
这堂课不是在讲“agent 是什么”,而是在讲:工业界如何把 agent 模型真正训练出来,并让它在产品里工作。
重点不是抽象概念,而是:
-
数据怎么做
-
grader 怎么做
-
RL pipeline 怎么跑
-
成本怎么控
-
模型怎么防作弊
-
agent 怎么在真实产品约束下稳定工作
一、agent 训练不等于“会调用 tools”
我之前容易把 agent 想成:
-
reasoning 更长
-
会 planning
-
会 tool calling
但这节课告诉我,真正的 agent training 远不止这些。
真正的 agent 至少包含:
-
goal:要完成一个明确任务
-
environment:有真实环境状态
-
tools:可调用外部能力
-
multi-turn interaction:多轮动作与反馈
-
grader / verifier:结果要能被判定好坏
-
product constraints:不能只对,还要快、稳、格式对、体验好
所以 agent 不是“多步推理版 LLM”,而是“能在环境中完成任务的系统核心”。
二、2025 的主战场从“回答问题”转向“完成任务”
以前 LLM 训练更偏:
-
pretraining
-
SFT(学标准答案)
-
RLHF(学人类偏好)
- RL(更容易答对)
-
reasoning
现在更偏:
-
agent post-training
-
tool-use
-
long-horizon interaction
-
verifier / grader
-
environment feedback
-
robustness under product constraints
不是 reasoning 不重要了,
而是 reasoning 变强后,大家发现:真正难的是把推理能力变成稳定任务完成能力。
Jeff:过去重点解决了“搜索”或者一般性的“问答”(本质还是搜索);Agent则更看重在推理过程中是否自动收敛于目标,并且可能还需要结合动态的用户交互。
核心命题:从"教模型思考"到"教模型做事"
整个故事可以压缩成一条主线——训练目标的升级。
2020–2023年的主旋律是 pretraining scaling。GPT-3 到 GPT-4 这条路的核心信念是:把模型喂够数据、堆够参数,涌现能力自然出来。训练的核心动作是预测下一个 token,评估的核心方式是 benchmark 得分。这个阶段解决的问题是"模型能不能理解和生成语言"。
2023–2024年出现了一个重要分支:alignment + reasoning。RLHF、DPO 这些技术解决的是"模型说的话是不是人想听的"。与此同时,以 OpenAI o1 为标志,reasoning 训练开始被单独拉出来,核心是让模型学会"在给出答案之前做更长更深的内部推理"。这个阶段解决的问题是"模型能不能想得更好、答得更对"。
到2025年,一个关键认知被普遍接受了:会想不等于会做。(例如,不稳定) 这就是所谓"agent 成为主战场"的真正含义。
为什么"会想"不够?因为真实任务有四个特征是纯推理训练覆盖不了的:
一是环境交互。真实任务不是"给个问题出个答案",而是要读屏幕、点按钮、调 API、看返回结果、再决定下一步。模型必须学会和一个有状态的外部世界打交道,而不是在自己的 context window 里自言自语。
二是错误恢复。Reasoning model 做错了顶多输出一个错答案。但 agent 做错了,环境状态已经变了——文件已经写了、API 已经调了、邮件已经发了。所以 agent 必须学会"发现执行结果不对时如何回退或修正",这是一种完全不同于 CoT 的能力。
三是长时程规划与执行。一个真正的 agent 任务可能需要几十步甚至上百步操作。这意味着模型需要在很长的 horizon 上保持目标一致性,不能中途跑偏。这和"一轮推理做对一道数学题"是完全不同的训练挑战。
四是可验证的完成标准。以前的训练信号是"人类觉得这个回答好不好"(preference),现在变成了"这个任务到底完成了没有"(verifiable outcome)。这个转变直接改变了 reward 的设计方式——你可以用一个 grader 自动检查"代码是否通过测试""文件是否正确生成""网页是否被正确修改",而不再完全依赖人类标注。
所以如果要我给你一句话总结这个转变:
-
- Pretraining 教模型"知道",
- alignment 教模型"听话",(ChatGPT3.5的意义)
- reasoning 教模型"想清楚",
- agent training 教模型"做成事"。
这四层不是替代关系,而是逐层叠加,每一层都以前一层为前提。
最后一个帮你检验自己是否真懂的问题:如果有人跟你说"o1 就是一个 agent",你能说清楚为什么这个说法不准确吗?答案藏在上面"环境交互"和"错误恢复"这两个关键词里——o1 会做很深的内部推理,但它并不与外部环境交互,也不具备执行后修正的闭环。它是一个极强的 reasoning model,但不是一个 agent。
三、这堂课最重要的三个词:Data、Grader、Efficiency
1. Data
工业界现在非常看重:
-
rubric data
-
synthetic data
-
data mixing
-
curriculum
-
high data efficiency
重点不是“数据越多越好”,而是:
能不能构造真正有学习价值、能驱动 agent 能力提升的数据。
2. Grader
grader 可以理解成:
-
裁判
-
检查器
-
评分表
-
verifier 的组合体
在真实产品里,不会只有一个 pass rate。
比如 coding agent 可能同时有:
-
unit test grader
-
patch grader
-
format grader
-
behavior grader
-
progress grader
-
time-to-PR grader
-
length / verbosity grader
-
anti-cheat grader
所以真实优化目标是多维的,而不是单一分数。
3. Efficiency
agent RL 很贵,瓶颈常常不在 trainer,而在 sampler。
原因是 rollout 很长,会涉及:
-
多轮 reasoning
-
tool use
-
sandbox 交互
-
unit test
-
grader 调用
所以工业里很重视:
-
async pipeline
-
sampling cost control
-
rollout length control
-
long-context compression
-
LoRA for RL
-
用更快的次优配置加快实验迭代
四、这堂课一个很大的 insight:高质量数据能力比想象中更重要
讲者非常强调:
顶级人才应该去做数据,而不是只做模型。
因为真正难的是:
-
缺什么数据
-
如何合成数据
-
如何构造 rubric
-
如何覆盖模型薄弱点
-
如何通过 data mixing 改变最终能力分布
这说明今天的 agent 训练,本质上已经不是单纯的“模型问题”,而是:
-
数据工程
-
grader 工程
-
RL 工程
-
infra 工程
一起构成的系统问题。
五、coding 为什么成为 agent training 的核心样板?
因为 coding 具备几个天然优势:
-
目标明确
-
环境明确(repo / sandbox)
-
工具明确
-
可多轮交互
-
结果相对容易验证(unit test / patch / build)
-
用户价值高
所以 coding 不是因为“大家都喜欢写代码”,
而是因为它是最适合把 agent training 全链路跑通的场景之一。
六、Rubric 很关键:把开放问题拆成可训练问题
很多真实产品任务没有唯一正确答案。
这时工业界常做的不是只写“标准答案”,
而是写一整套 criteria:
-
回答有没有覆盖关键点
-
格式对不对
-
风格合不合适
-
是否过长
-
是否满足产品要求
-
是否展示 progress
-
是否符合安全要求
rubric 的作用就是:
把不好验证的开放任务,拆成一组可评分的局部标准。
这是把 open-ended product behavior 变成可训练信号的核心方法。
七、模型会作弊,所以 grader 设计本身就是攻防工程
当 reward 定义出来以后,模型会想办法“拿分”。
例如 coding 场景里可能会:
-
改测试
-
删测试
-
绕开真实修复
-
复制外部答案
-
利用 grader 漏洞
所以工业训练不是“写个 reward 就结束”,而是:
-
发现作弊方式
-
补 grader
-
增加隐藏测试
-
增加 anti-cheat checks
-
用另一个模型检查输出
因此,agent RL 很像持续的攻防对抗。
八、agent 训练真正难的不是“会不会做”,而是“能不能在产品里稳定地做”
一旦进真实产品,约束会暴增:
-
正确
-
快
-
成本低
-
格式对
-
可解释
-
可展示 progress
-
工具泛化
-
抗作弊
-
长时程可运行
所以学术 benchmark 的 pass rate,只是其中一个维度。
产品真正要的是综合最优。
九、instruction following 是 agent RL 的前提
如果模型连 prompt 和 tool instruction 都跟不好,
那后续 RL、exploration、tool generalization 都会打折。
所以 agent 训练常常不是从零开始,
而是建立在一个已经具备较强 instruction-following 能力的模型之上。
十、我对这堂课的总理解
这堂课最有价值的地方在于,它让我意识到:
agent training 的核心,不是“把 CoT 拉长”或“给模型接几个工具”,而是构建一整套让模型在环境中学会完成任务的闭环。
这个闭环至少包括:
-
数据
-
rubric
-
grader
-
anti-cheating
-
RL
-
采样效率
-
环境交互
-
产品约束
最后压缩成 8 句话
-
agent 训练不是单纯的多步推理,而是目标驱动的环境交互训练。
-
2025 年主战场转向 agent,是因为 reasoning 变强后,真正的瓶颈变成任务完成。
-
工业界最重视的三件事是:Data、Grader、Efficiency。
-
rubric 的本质是把开放任务拆成可评分的子标准。
-
grader 不是一个分数,而是一整套裁判系统。
-
模型会 reward hacking,所以 grader 设计本身就是攻防工程。
-
coding 成为 agent 样板场景,是因为它目标清晰、环境明确、反馈可验证。
-
真正强的 agent,不只是会调用 tools,而是能在产品约束下稳定把事做成。
Ref: Agentic AI MOOC | UC Berkeley CS294-196 Fall 2025 | Multi-Agent AI by Noam Brown
self-play 为什么在 AlphaGo 那类任务里神一样有效,但一旦进入扑克、Diplomacy、人与 AI 协作、LLM 多 agent,事情就立刻复杂很多。
LLM 现在很像当年的 AlphaGo,但缺了最关键的一环
他先给出一个很漂亮的类比:
-
-
AlphaGo 路线
- 先用高质量人类棋谱预训练
- 再用大规模推理(如 MCTS)
- 最后用 self-play 做递归式自我提升
-
LLM 路线
- 先在互联网文本上预训练
- 再用大规模推理(如 Chain of Thought)
- 但第三步——像 self-play 那样持续自我博弈提升——还没有真正成熟
-
所以他的问题是:
为什么 self-play 在围棋、象棋、扑克里那么成功,但在 LLM 上没自然复制出来?
他的答案是:
因为很多人对 self-play 的理解,其实只适用于二人零和、完全信息游戏;一旦脱离这个范围,很多好性质都会消失。
你现在的“乱”,本质上是把两种不同的多 agent 混在一起了
第一种:高耦合协作型多 agent
特点是:
-
agent 之间要持续对齐上下文
-
一个 agent 的决定会深度影响另一个 agent
-
需要长链路协商、改计划、消冲突
-
典型如复杂 coding、共享代码库修改、多人共同写同一份方案
这正是 Cognition 最警惕 的类型。
第二种:并行探索型多 agent
特点是:
-
子任务相对独立
-
每个 agent 只负责一个方向
-
结果可被压缩成摘要交回主 agent
-
典型如广度研究、并行检索、多视角分析、角色化 brainstorming
这正是 Anthropic 证明有效的类型。
这段课基本上在讲一条主线:
“多个 AI agent 放在一起,不只是能合作做事,还会出现竞争、欺骗、社交、群体文化这些更像‘社会行为’的现象。”
发现:
Tree结构也还不错。(也接近真是人类社会的组织结构)
Chain: 最差。
Mesh与Random是随着agent number增加而最好的。看来头脑风暴,充分的探讨往往能得到最佳的结果。
但到后面会 saturate(饱和)。

Ref: Agentic AI MOOC | UC Berkeley CS294-196 Fall 2025 | Predictable Noise in LLM Benchmarks by Sida Wang
很多论文:
-
只提升 1%~3%
- 但一些数据集的标准误差 ≈ 4%
👉 结论:
这些提升大概率是噪声
👉 最终观点
Small + Hard benchmark ≠ Reliable benchmark
2024 年,这个问题从“有人提醒”升级为“大家都在研究”。例如:
-
Investigating Data Contamination in Modern Benchmarks for Large Language Models 系统研究了现代 benchmark 的污染问题;
-
How Much are LLMs Contaminated? 做了更全面的 contamination survey;
-
LatestEval 这类工作则开始尝试做“更新鲜、减少污染”的评测方式。
这说明社区已经不只是抱怨,而是在认真补救。
到了 2025 年前后,不少论文已经直接把这件事称作一种 evaluation crisis,也就是“评测危机”:不是模型不进步,而是我们越来越难确认它到底进步了多少、进步在哪里、是不是被 benchmark 误导了。
Ref: Agentic AI MOOC | UC Berkeley CS294-196 Fall 2025 | AI Agents to Automate Science by James Zou
The Virtual Lab
一个 Tree结构案例:
James Zou 不是说“让一个 GPT 去做科研”,而是说:
-
先有一个 PI agent / 教授 agent
-
再由它按任务需要,生成不同专长的 student agents
-
这些 agent 会 组会、单聊、分工
-
还可以去“上学”——也就是再学习、再专精
-
最后结合外部科学工具去做真实研究
Paper2Agent
这部分非常有意思,而且我觉得你会特别喜欢。
James Zou 认为,论文 PDF 是一种非常被动的知识载体。
你读完论文,往往还得:
-
自己看代码
-
自己配环境
-
自己猜作者怎么跑
-
自己改成适合你的任务
这就很低效。
所以 Paper2Agent 的想法是:
- 把每篇论文,变成一个 能直接对话、还能调用论文工具链的 agent。
Paper2Agent 的论文摘要明确写到:它会自动分析论文和相关代码库,用多个 agents 去构建一个 MCP server,再通过反复测试把这个 paper MCP 打磨稳固,然后把它接到聊天 agent 上,让用户可以直接自然语言调用这篇论文的工具和 workflow。
论文举的案例包括 ScanPy、TISSUE、以及 AlphaGenome。
用最通俗的话说:
以前是:论文 = 说明书
现在想变成:论文 = 可执行服务
也就是从:
-
“你去读我”
变成了 -
“你直接调用我”
这其实就是你最近一直在理解的那条主线:
- 知识不再只是文本,而是 agent 化、接口化、服务化。
不是“模型读不懂论文”,而是:模型没法稳定地把论文中的知识,转成可靠的可执行行为。
不要让一个 LLM 单枪匹马去“临场发挥”。
而是拆成多个更明确的子任务,让多个子 agent 各司其职,最后构造出一个稳健的 MCP server。

浙公网安备 33010602011771号