Inefficiencies of Meta Agents for Agent Design
论文阅读:Inefficiencies of Meta Agents for Agent Design——自动设计 Agent 的 Meta-Agent 到底有效吗?
论文标题:Inefficiencies of Meta Agents for Agent Design
作者:Batu El, Mert Yuksekgonul, James Zou
单位:Stanford University
发表位置:Findings of the Association for Computational Linguistics: EMNLP 2025
arXiv 编号:2510.06711
arXiv 链接:https://arxiv.org/abs/2510.06711
ACL Anthology:https://aclanthology.org/2025.findings-emnlp.1135/
主题:Meta-Agent、自动 Agent 设计、Agent Search、Agent Diversity、Cost Efficiency
核心问题:Meta-Agent 自动搜索 Agent 架构时,真的能够从过去的设计中持续学习吗?搜索出来的 Agent 是否具有互补性?为此付出的设计成本又是否值得?
1. 引言:让 Agent 自动设计 Agent
过去的 Agent 系统通常由研究者手工设计。
例如,研究者决定:
- 是否使用 Chain-of-Thought;
- 是否让多个 LLM 相互辩论;
- 是否生成多个答案再投票;
- 是否让模型反思并修改答案;
- 如何组合多个 LLM 调用;
- 一个问题应该经过怎样的 workflow。
随着 Agent 系统越来越复杂,一个自然的问题是:
能不能再使用一个 LLM Agent,自动帮我们设计 Agent?
这样的系统通常被称为 Meta-Agent。
Meta-Agent 不直接负责解决最终任务,而是负责搜索和设计一个新的 Agent 架构。例如,它可能生成一段 Python 代码,这段代码规定:
- 调用几个 LLM;
- 每个 LLM 使用什么 Prompt;
- 不同模型之间如何传递结果;
- 是否需要讨论、投票或者反思;
- 最终如何产生答案。
近年来已经出现了一系列自动 Agent 设计工作,例如 ADAS、AutoFlow、AFlow、AgentSquare、ScoreFlow 等。
本文主要关注其中一类非常常见的范式:
Sample → Evaluate → Iterate
也就是:
- Meta-Agent 生成一个 Agent;
- 在训练任务上测试这个 Agent;
- 得到性能反馈;
- 把历史 Agent 和它们的结果提供给 Meta-Agent;
- 继续设计新的 Agent。
直觉上,这似乎形成了一种“Agent 自我进化”的过程。
但作者提出了三个非常基础的问题:
- Meta-Agent 真的从过去搜索出的 Agent 中学到了东西吗?
- 搜索得到的多个 Agent 是否具有不同能力,从而能够互补?
- 搜索 Agent 本身非常昂贵,那么这种方法经济上划算吗?
整篇论文基本围绕这三个问题展开。
2. Meta-Agent 的基本框架
论文首先抽象出一个通用的自动 Agent 设计流程。
作者将一个 Agent f_i 定义为:
一个输入问题,并通过若干次语言模型调用计算最终答案的计算机程序。
因此,这里的“Agent 架构”实际上可以直接表示为代码。
Meta-Agent 的目标就是生成新的 Agent 代码。
整个系统维护一个 Archive:
A = {(f_i, s_i)}
其中:
f_i:第i个 Agent;s_i:这个 Agent 在训练数据上的评估结果。
每一轮搜索大致执行:
Archive → 选择上下文 → Meta-Agent 生成 Agent → Debug → Evaluate → 加入 Archive

【Figure 1。该图展示 Meta-Agent 的整体 sample–evaluate–iterate 框架,以及本文研究的 Learning、Diversity、Economic Viability 三个问题。】
论文给出的过程可以概括为:
| 阶段 | 操作 |
|---|---|
| 初始化 | 使用若干人工已有 Agent 初始化 Agent Library |
| Context Curation | 从 Archive 中选择一部分已有 Agent |
| Sample | Meta-Agent 根据这些 Agent 生成新的 Agent 代码 |
| Revision / Debug | 根据执行反馈修正格式和代码错误 |
| Evaluate | 在训练集 D_train 上执行新 Agent |
| Update | 将 Agent 及其评估结果加入 Archive |
| Iterate | 重复上述过程 |
这里有一个非常重要的组件:
Context Curation,也就是应该把哪些历史 Agent 提供给 Meta-Agent。
本文后面的大部分实验,实际上就是在研究这个问题。
3. 初始 Agent Library
Meta-Agent 并不是从完全空白的状态开始搜索。
作者按照 ADAS 的实验设置,首先准备了 7 种已有 Agent 方法作为初始 Agent Library F:
| Agent | 基本思想 |
|---|---|
| Chain-of-Thought | 先生成推理过程,再产生最终答案 |
| Majority Voting | 多次生成答案,然后选择多数答案 |
| Refinement from Feedback | 根据模型自己的反馈迭代修改答案 |
| LLM-Debate | 多个 LLM 实例相互讨论和辩论 |
| Quality-Diversity | 生成具有差异性的多个回答并进行组合 |
| Routing | 根据问题类型将任务路由到不同专家角色 |
| Stepping-back | 先思考相关的一般原则,再解决具体问题 |
Meta-Agent 后续搜索的新 Agent,就是在这个基础上不断生成的。
因此论文比较的实际上是:
已有人工 Agent Library
与
Meta-Agent 自动搜索得到的新 Agent
之间的性能、行为和成本差异。
4. Context Curation:到底应该给 Meta-Agent 看哪些历史 Agent?
这是本文第一个核心问题。
Meta-Agent 在第 t 轮生成新 Agent 时,可以看到之前已经发现的一些 Agent。
问题在于:
应该把哪些历史 Agent 放入 Context?
论文设计了三种策略。
4.1 Cumulative:把所有历史 Agent 都放进去
第一种策略称为:
Cumulative Context Curation
也就是随着搜索不断进行,把之前搜索到的 Agent 全部加入上下文。
可以理解成:
初始 Agent + Agent_1 + Agent_2 + ... + Agent_t
全部提供给下一轮 Meta-Agent。
这是 ADAS 等工作使用的思路。
它背后的直觉非常自然:
Meta-Agent 看过的历史设计越多,就越容易从过去的成功和失败经验中学习。
如果这种假设成立,那么随着搜索不断进行,Agent 应该越来越好。
4.2 Parallel:完全忽略历史搜索结果
第二种方法非常简单:
Parallel Context Curation
Meta-Agent 每一次生成新 Agent 时,都只看到最开始的 7 个 Initial Agents。
也就是说:
Agent_1
和
Agent_30
实际上处于几乎相同的生成条件。
之前 Meta-Agent 自己搜索出来的:
Agent_1, Agent_2, ..., Agent_29
全部不会提供给第 30 次生成。
所以不同 Agent 基本相当于彼此独立地进行并行采样。
这实际上构成了一个非常直接的 baseline:
如果 Meta-Agent 真能利用历史 Agent 学习,那么 Cumulative 至少应该明显优于 Parallel。
否则,把过去所有搜索结果塞进 Context 就没有带来真正的 Meta-Learning。
4.3 Evolutionary:只保留最优秀的历史 Agent
第三种方法是:
Evolutionary Context Curation
作者采用了类似进化搜索的思路。
每一轮都从当前 Archive 中选出:
训练集表现最高的 Top-7 Agent
把这些 Agent 当作下一代 Agent 的“parents”。
于是:
Archive → Top-7 Agents → Meta-Agent → New Agent
下一轮重新根据性能筛选 Top-7。
与 Cumulative 相比,这种方式不是把所有过去的设计全部塞进 Context,而是只保留质量较高的候选。
因此三种策略的区别可以概括为:
| 方法 | Meta-Agent 看到什么 | 搜索逻辑 |
|---|---|---|
| Cumulative | 所有历史 Agent | 不断累积全部历史 |
| Parallel | 只有最初的 7 个 Agent | 每次独立搜索 |
| Evolutionary | 当前性能最高的 7 个 Agent | 选择优秀 Parent 再生成 |
5. 实验设置
论文使用四个数据集:
| Dataset | 任务类型 |
|---|---|
| MGSM | 多语言数学推理 |
| DROP | 阅读理解与离散推理 |
| MMLU | 多领域知识与问题求解 |
| GPQA | 研究生水平科学问答 |
对于 MGSM、MMLU 和 DROP:
D_train = 128D_test = 200
对于 GPQA:
D_train = 32D_test = 160
由于 GPQA 训练样本较少,为降低训练过程中评估的方差,每个训练样本重复评估 5 次,因此一共进行:
32 × 5 = 160
次训练评估。
DROP 使用 F1 Score。
其他三个数据集使用 Accuracy。
5.1 使用的模型
作者延续 ADAS 的设置。
普通 Agent 内部调用的模型:
GPT-3.5
也就是说,无论 Chain-of-Thought、Debate,还是 Meta-Agent 新生成的 Agent,它们真正解决 benchmark 问题时主要调用 GPT-3.5。
而负责设计 Agent 的 Meta-Agent使用能力更强的:
GPT-4o
因此可以把系统理解为:
GPT-4o Meta-Agent → 生成 Agent Program → Agent Program 调用 GPT-3.5 → 解决任务
5.2 搜索次数
每次 Meta-Agent Search 都进行:
T = 30
轮。
论文所有主要结果均取:
3 次独立运行的平均值。
因此,每种 Context Curation 策略在一个任务上总共会产生:
30 × 3 = 90
个自动设计的 Agent。
6. 问题一:Meta-Agent 真的能够从历史 Agent 中学习吗?
论文首先比较 Cumulative、Parallel 和 Evolutionary。
如果 Cumulative 的假设成立,那么把之前搜索到的 Agent 全部加入 Context,应该比完全忽略这些 Agent 的 Parallel 更有效。
但实验结果恰恰相反。
论文 Table 1 中最佳训练 Agent 的平均性能为:
| Context | Best Agent 平均训练性能 |
|---|---|
| Cumulative | 55.0 |
| Parallel | 60.0 |
| Evolutionary | 60.3 |
也就是说:
直接忽略之前所有搜索结果的 Parallel,反而明显优于不断累积历史设计的 Cumulative。
这说明至少在本文研究的 ADAS 风格 Meta-Agent 中:
单纯把越来越多的历史 Agent 塞进 Context,并没有形成有效的跨轮学习。
甚至可能产生负面效果。
6.1 Evolutionary 可以改善这一问题
与单纯累积不同,Evolutionary 只把表现最好的 7 个历史 Agent 提供给 Meta-Agent。
在训练结果上,Evolutionary 整体表现最好。
例如 MGSM 上,最佳 Agent 的训练性能分别为:
| 方法 | MGSM |
|---|---|
| Cumulative | 41.4 |
| Parallel | 56.2 |
| Evolutionary | 56.5 |
作者指出,相对于 Cumulative,Evolutionary 在 MGSM 上能够获得最高约 +10% 的提升。
这说明问题并不是:
“历史 Agent 完全没有价值。”
而更可能是:
未经筛选地把全部历史 Agent 放进 Context,并不是一种有效的利用历史经验的方式。
选择高质量历史设计作为 Parent,能够得到更有效的 Meta-Learning。
6.2 Held-out Test 上的结果
论文还选择:
在
D_train上表现最好的 Agent
然后在未参与搜索的 D_test 上测试。
结果如下:
| Dataset | Initial | Cumulative | Parallel | Evolutionary |
|---|---|---|---|---|
| DROP | 64.8 | 71.9 | 72.6 | 73.2 |
| MGSM | 38.4 | 41.2 | 51.8 | 53.5 |
| MMLU | 62.8 | 66.2 | 67.8 | 65.8 |
| GPQA | 30.0 | 29.7 | 31.3 | 28.5 |
| Average | 49.0 | 52.2 | 55.9 | 55.2 |
这里需要注意一个细节。
虽然 Evolutionary 在训练搜索结果和许多 Top-K 指标上表现较好,但在最终 held-out test 的四个任务平均值上:
Parallel = 55.9
略高于:
Evolutionary = 55.2
因此论文的实验并不能简单理解为:
Evolutionary 在所有情况下都优于 Parallel。
更准确地说:
- Cumulative 明显没有体现出“历史越多越好”;
- Parallel 已经能够获得很强的结果;
- 筛选高质量历史设计的 Evolutionary 可以进一步改善搜索过程中的性能;
- 但这种收益并非在所有测试集上都一致。
7. 问题二:搜索出来的 Agent 真的具有多样性吗?
Meta-Agent 搜索过程中会产生很多 Agent。
但通常最终部署的时候,只会选择其中一个最好的 Agent。
作者提出:
既然已经花大量成本设计了几十个 Agent,为什么不把这些 Agent 一起利用起来?
如果不同 Agent 擅长不同类型的问题,例如:
- Agent A 擅长数学;
- Agent B 擅长事实问答;
- Agent C 擅长复杂推理;
那么在测试时,可以根据问题动态选择合适的 Agent。
这要求不同 Agent 具有:
Behavioral Diversity,即行为多样性。
8. 如何衡量 Agent 的行为是否相似?
作者没有根据 Agent 的代码结构计算相似度。
因为两个代码结构完全不同的 Agent,仍然可能回答对完全相同的一批问题。
论文关心的是:
这些 Agent 在真实问题上的行为是否不同。
对于 Agent f_i,作者记录它在所有训练问题上的表现:
s_i = eval(f_i, D_train)
可以把它想象成一个向量。
例如:
| Question | Q1 | Q2 | Q3 | Q4 | Q5 |
|---|---|---|---|---|---|
| Agent A | 1 | 1 | 0 | 0 | 1 |
| Agent B | 1 | 1 | 0 | 0 | 1 |
| Agent C | 0 | 0 | 1 | 1 | 0 |
其中:
1:答对;0:答错。
显然:
Agent A 和 Agent B 的行为非常接近。
Agent C 则与它们完全不同。
作者把每个 Agent 的 Evaluation Vector 看成这个 Agent 的一种行为表示,然后计算 Agent 两两之间的 Cosine Similarity。
因此这里衡量的不是:
“两个 Agent 的 Prompt 是否相似?”
而是:
“两个 Agent 是否倾向于答对相同的问题、答错相同的问题?”
9. Evolutionary 会降低 Agent 多样性
实验发现一个非常重要的 trade-off。
Evolutionary 会不断选择最优秀的历史 Agent 作为 Parent。
这种做法确实有助于提高性能。
但同时也会使后续 Agent 越来越接近这些高性能 Parent。
因此:
Evolutionary 搜索出来的 Agent 行为相似度通常更高。
也就是多样性降低。
Parallel 则没有这个问题。
因为每个新 Agent 都独立从初始 Library 开始生成,不会不断向之前的优秀 Agent 聚集。
因此 Parallel 在维持较强性能的同时,一般能够生成更加多样的 Agent。
作者由此指出了一个经典的:
Exploration–Exploitation Trade-off
即:
- Evolutionary 更偏向 exploitation:围绕已经表现优秀的设计继续优化;
- Parallel 更偏向 exploration:不断尝试彼此相对独立的新设计。
9.1 一个看起来有些反直觉的结果:Cumulative 多样性反而很高
论文 Figure 2 中还有一个值得注意的现象:
Cumulative 的 Agent 整体 Cosine Similarity 反而最低。
也就是说,它生成的 Agent 在行为上甚至可能比 Parallel 更加多样。
但这里不能把:
多样性高
直接等同于:
搜索质量高。
前面的结果已经表明,Cumulative 的整体性能明显较弱。
因此它可能探索了很多不同的 Agent,但这些差异本身并不意味着这些 Agent 更优秀。
作者进一步关注的是:
能否在保持性能的同时获得足够的多样性。
在这一点上,Parallel 展现出了较好的特性。
10. Coverage:多个 Agent 联合起来究竟能覆盖多少问题?
为了进一步研究 Agent 之间是否存在互补性,作者定义了一个很直观的指标:
Coverage
即:
一个问题只要被所有搜索出的 Agent 中至少一个回答正确,就认为这个问题被覆盖。
实验使用每个设置在 3 次运行中产生的全部:
90 Agents
计算 Coverage。
结果为:
| Setting | DROP | MGSM | MMLU | GPQA | Average |
|---|---|---|---|---|---|
| Cumulative | 96.6 | 89.1 | 99.2 | 91.9 | 94.2 |
| Parallel | 96.0 | 95.3 | 97.7 | 94.4 | 95.9 |
| Evolutionary | 93.6 | 93.0 | 99.2 | 91.9 | 94.4 |
从平均结果来看:
Parallel 的 Coverage 最高,为 95.9。
这进一步说明 Parallel 更容易探索到具有不同能力模式的 Agent。
换句话说:
如果未来希望真正把搜索过程中产生的多个 Agent 联合起来使用,那么搜索策略不仅应该优化单个 Agent 的最高性能,也应该考虑 Agent Pool 本身的多样性与 Coverage。
11. 问题三:自动设计 Agent 真的划算吗?
前面的实验主要讨论性能。
但自动 Agent Search 有一个非常现实的问题:
它非常贵。
普通人工设计 Agent:
人工设计 Agent → 大规模运行
Meta-Agent 自动设计则需要:
大量 Agent Generation + 大量 Training Evaluation + 最终大规模运行
因此即使自动搜索出的 Agent准确率更高,也不一定意味着它经济上更划算。
作者把成本分成两个部分。
11.1 Fixed Design Cost
首先是固定设计成本 C0。
它包括:
- Meta-Agent 生成所有候选 Agent 的成本;
- Agent Revision 和 Debug 的成本;
- 在
D_train上评估候选 Agent 的成本。
这些成本是在真正部署之前就已经支付的。
无论之后:
- 运行 100 条测试数据;
- 还是运行 100 万条测试数据;
这部分 Agent Search 成本都已经发生。
因此称为:
Fixed Cost。
11.2 Per-example Inference Cost
第二部分是正式部署 Agent 时,每处理一条问题产生的推理成本:
C_j
如果部署 n 个问题,那么总成本为:
Total Cost = C0 + n * C_j
对于人工已有的 Initial Agent,可以认为没有 Meta-Agent Search 的固定成本,因此:
C0 = 0
而 Meta-Agent 自动搜索的 Agent:
C0 > 0
所以自动搜索 Agent 要想经济上更划算,就必须满足:
搜索出的 Agent 性能足够高,并且在大规模运行以后,其性能优势能够抵消前期设计成本。
12. Meta-Agent 搜索出的 Agent 本身也更贵
作者首先比较不同 Agent 每处理一个测试问题的平均推理成本。
整体趋势为:
Cumulative > Evolutionary > Parallel > Initial
也就是说:
Meta-Agent 自动设计出来的 Agent,不仅前期搜索需要额外成本,运行时通常也比人工初始 Library 中的 Agent 更贵。
其中:
- Cumulative 设计出来的 Agent 最昂贵;
- Evolutionary 次之;
- Parallel 相对便宜;
- Initial Agents 最便宜。
这很重要。
因为自动 Agent Design 如果只是找到一个:
“多调用几次模型,所以准确率提高一点”
的 Agent,那么其性能提升本身未必具有经济价值。
13. Break-even Point:需要运行多少问题才能回本?
作者接下来计算:
自动搜索 Agent 的“每个正确答案成本”什么时候能够低于已有 Initial Agent?
因为自动搜索存在较大的固定成本 C0,所以刚开始部署时必然非常吃亏。
只有随着测试问题数量 n 不断增加,固定搜索成本被逐渐摊薄以后,才有可能出现交点。
作者将这个交点称为:
Break-even Point。
实验发现:
对于 Parallel Context Curation:
- DROP;
- MMLU;
大约需要部署:
15,000 个问题
之后,Meta-Agent 设计出来的 Agent 才能够在“每个正确答案的成本”上超过 Initial Agent。
换句话说:
如果只需要解决几百或者几千个问题,那么前期自动 Agent Search 的成本根本无法收回。
13.1 只有两个数据集出现了有意义的 Break-even
更关键的是:
论文实验中只有:
- DROP;
- MMLU;
的 Parallel 设置最终能够达到 Break-even。
对于其他 Dataset 或 Context Curation 方法:
性能提升不足以抵消 Agent Search 和更高推理成本。
按照论文的成本模型,即使部署规模继续扩大,也无法获得经济优势。
因此作者的结论并不是:
“Meta-Agent Search 很贵,但只要数据足够多最终总能回本。”
而是:
只有当自动搜索得到的 Agent 同时具有足够明显的性能优势和合理的推理成本时,固定设计成本才可能被摊销。
在本文实验中,这种情况只出现在少数设置下。
14. 三个实验实际上形成了一个统一的 Trade-off
论文虽然分别讨论 Learning、Diversity 和 Economic Viability,但三个实验之间是相互联系的。
可以总结为:
| 搜索策略 | 性能 | 多样性 | 成本 |
|---|---|---|---|
| Cumulative | 较弱 | 较高 | 最高 |
| Parallel | 较强 | 较高 | Meta-Agent 方法中最低 |
| Evolutionary | 搜索性能较强 | 较低 | 较高 |
Evolutionary 的核心优势是:
不断围绕已经表现优秀的 Agent 继续搜索。
因此它更擅长 exploitation。
但副作用是:
Agent Pool 越来越相似。
与此同时,更复杂的 Agent 往往意味着更多 LLM 调用,因此运行成本也可能提高。
Parallel 则完全不利用搜索历史,但反而表现出了:
- 很强的性能;
- 较好的行为多样性;
- 较高的 Coverage;
- 较低的推理成本。
这也是本文指出 Cumulative 式 Meta-Agent 存在问题的主要实验依据。
15. 这篇论文真正质疑的是什么?
需要注意,本文并不是在证明:
“Meta-Agent 自动设计 Agent 是无效的。”
事实上,Meta-Agent 搜索出的最佳 Agent,在多个任务上确实超过了初始人工 Agent。
论文质疑的是几个更加具体的假设。
15.1 “把所有历史结果放入 Context”并不等于学习
很多 Meta-Agent 方法的逻辑是:
过去 Agent → 放进 Context → 生成新 Agent
由于 Context 中包含历史设计,很容易把这种过程描述成:
Meta-Agent 在不断从历史经验中学习。
但本文实验表明:
如果去掉这些历史 Agent,采用 Parallel 独立采样,性能反而更高。
因此:
Context accumulation 本身不能作为 Meta-Learning 有效发生的证据。
15.2 最佳 Agent 性能不是唯一值得优化的目标
自动 Agent Search 通常关注:
最终能搜索到多高分的 Agent?
但如果搜索过程中产生了几十甚至上百个 Agent,那么整个 Agent Pool 的价值也值得考虑。
例如:
- 不同 Agent 是否擅长不同问题?
- 能否做 Routing?
- 能否 Ensemble?
- 能否根据任务动态选择 Agent?
这要求搜索算法维持足够的 Diversity。
Evolutionary 搜索虽然提高了 exploitation,但也会使 Agent 越来越相似。
15.3 Benchmark 分数提高不代表系统更划算
一个 Agent 通过:
- 更多模型调用;
- 更多 self-refinement;
- 更多 debate;
- 更复杂的 workflow;
获得更高准确率并不困难。
但这些操作都会增加推理成本。
再加上 Meta-Agent Search 本身需要大量 Agent Generation 和 Evaluation,因此真正部署时需要比较的是:
Performance 与 Cost 的联合关系。
而不能只比较 Accuracy 或 F1。
16. 论文的局限性
作者在论文中明确讨论了多个局限性。
16.1 只研究了一类 Meta-Agent
本文研究对象主要是:
Sample–Evaluate–Iterate
范式的 Meta-Agent。
因此这些结论不能直接推广到所有自动 Agent 设计方法。
其他:
- 训练式 Meta-Agent;
- 模块化搜索;
- 动态 Agent 架构生成;
- 其他搜索算法;
可能具有不同性质。
16.2 评价指标主要是 Accuracy 和 F1
本文实验主要关注:
- Accuracy;
- F1。
但在其他应用中,可能还有:
- Reliability;
- Consistency;
- Latency;
- Safety;
- 其他 Utility;
等更加重要的指标。
因此本文的结论不一定能够直接推广到这些场景。
16.3 成本分析更适合存在可靠 Verifier 的任务
论文分析的是:
获得一个正确答案需要支付多少成本。
这种分析依赖于我们能够相对可靠地判断:
一个答案是否正确。
对于:
- MMLU;
- GPQA;
- MGSM;
- DROP;
这样的 benchmark,这比较容易实现。
但对于开放式 Agent 任务,如果没有可靠的 Verifier,可能需要使用其他经济评价方式。
16.4 Cosine Similarity 并不是完美的 Diversity 指标
本文通过:
Agent 在不同问题上的得分向量
计算 Cosine Similarity。
这种指标更倾向于认为:
能够解决相同问题的 Agent 是相似的。
但它同时存在一个偏差:
高性能 Agent由于能够共同解决大量问题,本身就更容易获得较高相似度。
因此:
高性能可能天然导致更高 Cosine Similarity。
为了检查结论是否只由这一指标产生,作者还使用二值 Score Vector 的 Hamming Distance 进行了额外实验,并观察到了相似趋势。
16.5 Meta-Agent Evaluation 存在大量随机性
作者特别指出,Meta-Agent Search 本身存在多层随机性:
- LLM Output 的随机性;
- Agent 内部多步推理的误差传播;
- Meta-Agent Sampling 的随机性;
- Agent Evaluation 的随机性;
- 不同搜索轨迹逐渐分叉形成的 trajectory-level divergence。
例如,第 3 轮恰好生成了不同 Agent:
Agent_3
就可能导致第 4 轮看到不同 Context。
之后:
Agent_4 → Agent_5 → ...
整个搜索轨迹都会逐渐产生巨大差异。
因此 Meta-Agent 的评估本质上需要:
多条独立搜索轨迹。
但由于完整搜索成本非常高,本文最终只进行了:
3 Runs
的平均。
17. Safety Considerations
作者还指出,自动生成并执行复杂 Agent 系统本身可能存在安全问题。
因为 Meta-Agent Search 的过程包括:
自动生成复杂系统 → 自动执行 → 根据结果继续修改
随着 Agent 代码和系统结构越来越复杂,这些系统可能在真正执行之前难以充分:
- Audit;
- Inspect;
- Control。
因此自动 Agent Design 不仅存在性能与成本问题,也存在系统执行层面的安全风险。
18. 总结
本文研究的不是如何提出一个更复杂的 Agent Search Framework,而是对现有 Meta-Agent 自动 Agent 设计范式进行系统分析。
论文围绕三个问题展开。
第一,Meta-Agent 是否真的能够从历史 Agent 中学习?
结果表明:
简单地把所有历史 Agent 不断加入 Context 并没有产生有效的 Meta-Learning。
Cumulative 甚至不如完全忽略历史搜索结果的 Parallel。
相比之下,只选择高质量历史 Agent 作为 Parent 的 Evolutionary 策略能够改善搜索效果。
第二,搜索得到的 Agent 是否具有互补性?
作者通过每个 Agent 在训练问题上的表现构造 Behavioral Representation,并计算 Agent 间的相似度。
结果发现:
Evolutionary 虽然能够提高性能,但也会让生成的 Agent 更加相似。
Parallel 则能够在维持较强性能的同时保持更高的多样性,并取得最高的平均 Coverage。
因此自动 Agent Search 中存在明显的:
Exploration–Exploitation Trade-off。
第三,自动设计 Agent 在经济上是否值得?
Meta-Agent Search 存在两层成本:
Design Cost + Inference Cost
而自动搜索出来的 Agent 本身通常也比初始人工 Agent 更昂贵。
在论文的实验中,只有 Parallel 策略在:
- DROP;
- MMLU;
上能够在约:
15,000 个测试问题
之后达到 Break-even。
其他设置的性能提升不足以补偿设计和推理成本。
因此,这篇论文最终指出:
自动 Agent 设计不能只关注“能否搜索到一个更高分的 Agent”。
还需要同时考虑:
- 搜索过程是否真正利用了历史经验;
- Agent Pool 是否具有行为多样性;
- 性能提升是否能够抵消设计成本和推理成本。
对于 sample–evaluate–iterate 类 Meta-Agent 来说,简单累积历史 Agent 并不等同于有效学习,而更有效的 Agent Search 需要同时处理 Learning、Diversity 与 Cost 三方面的权衡。
参考
-
Batu El, Mert Yuksekgonul, James Zou. Inefficiencies of Meta Agents for Agent Design. Findings of EMNLP 2025.
https://aclanthology.org/2025.findings-emnlp.1135/ -
arXiv:2510.06711
https://arxiv.org/abs/2510.06711 -
Shengran Hu et al. Automated Design of Agentic Systems. 2024.
https://arxiv.org/abs/2408.08435

浙公网安备 33010602011771号