Inefficiencies of Meta Agents for Agent Design

论文阅读:Inefficiencies of Meta Agents for Agent Design——自动设计 Agent 的 Meta-Agent 到底有效吗?

论文标题:Inefficiencies of Meta Agents for Agent Design
作者:Batu El, Mert Yuksekgonul, James Zou
单位:Stanford University
发表位置:Findings of the Association for Computational Linguistics: EMNLP 2025
arXiv 编号:2510.06711
arXiv 链接:https://arxiv.org/abs/2510.06711
ACL Anthology:https://aclanthology.org/2025.findings-emnlp.1135/
主题:Meta-Agent、自动 Agent 设计、Agent Search、Agent Diversity、Cost Efficiency
核心问题:Meta-Agent 自动搜索 Agent 架构时,真的能够从过去的设计中持续学习吗?搜索出来的 Agent 是否具有互补性?为此付出的设计成本又是否值得?


1. 引言:让 Agent 自动设计 Agent

过去的 Agent 系统通常由研究者手工设计。

例如,研究者决定:

  • 是否使用 Chain-of-Thought;
  • 是否让多个 LLM 相互辩论;
  • 是否生成多个答案再投票;
  • 是否让模型反思并修改答案;
  • 如何组合多个 LLM 调用;
  • 一个问题应该经过怎样的 workflow。

随着 Agent 系统越来越复杂,一个自然的问题是:

能不能再使用一个 LLM Agent,自动帮我们设计 Agent?

这样的系统通常被称为 Meta-Agent

Meta-Agent 不直接负责解决最终任务,而是负责搜索和设计一个新的 Agent 架构。例如,它可能生成一段 Python 代码,这段代码规定:

  1. 调用几个 LLM;
  2. 每个 LLM 使用什么 Prompt;
  3. 不同模型之间如何传递结果;
  4. 是否需要讨论、投票或者反思;
  5. 最终如何产生答案。

近年来已经出现了一系列自动 Agent 设计工作,例如 ADAS、AutoFlow、AFlow、AgentSquare、ScoreFlow 等。

本文主要关注其中一类非常常见的范式:

Sample → Evaluate → Iterate

也就是:

  1. Meta-Agent 生成一个 Agent;
  2. 在训练任务上测试这个 Agent;
  3. 得到性能反馈;
  4. 把历史 Agent 和它们的结果提供给 Meta-Agent;
  5. 继续设计新的 Agent。

直觉上,这似乎形成了一种“Agent 自我进化”的过程。

但作者提出了三个非常基础的问题:

  1. Meta-Agent 真的从过去搜索出的 Agent 中学到了东西吗?
  2. 搜索得到的多个 Agent 是否具有不同能力,从而能够互补?
  3. 搜索 Agent 本身非常昂贵,那么这种方法经济上划算吗?

整篇论文基本围绕这三个问题展开。


2. Meta-Agent 的基本框架

论文首先抽象出一个通用的自动 Agent 设计流程。

作者将一个 Agent f_i 定义为:

一个输入问题,并通过若干次语言模型调用计算最终答案的计算机程序。

因此,这里的“Agent 架构”实际上可以直接表示为代码

Meta-Agent 的目标就是生成新的 Agent 代码。

整个系统维护一个 Archive:

A = {(f_i, s_i)}

其中:

  • f_i:第 i 个 Agent;
  • s_i:这个 Agent 在训练数据上的评估结果。

每一轮搜索大致执行:

Archive → 选择上下文 → Meta-Agent 生成 Agent → Debug → Evaluate → 加入 Archive

image

【Figure 1。该图展示 Meta-Agent 的整体 sample–evaluate–iterate 框架,以及本文研究的 Learning、Diversity、Economic Viability 三个问题。】

论文给出的过程可以概括为:

阶段 操作
初始化 使用若干人工已有 Agent 初始化 Agent Library
Context Curation 从 Archive 中选择一部分已有 Agent
Sample Meta-Agent 根据这些 Agent 生成新的 Agent 代码
Revision / Debug 根据执行反馈修正格式和代码错误
Evaluate 在训练集 D_train 上执行新 Agent
Update 将 Agent 及其评估结果加入 Archive
Iterate 重复上述过程

这里有一个非常重要的组件:

Context Curation,也就是应该把哪些历史 Agent 提供给 Meta-Agent。

本文后面的大部分实验,实际上就是在研究这个问题。


3. 初始 Agent Library

Meta-Agent 并不是从完全空白的状态开始搜索。

作者按照 ADAS 的实验设置,首先准备了 7 种已有 Agent 方法作为初始 Agent Library F

Agent 基本思想
Chain-of-Thought 先生成推理过程,再产生最终答案
Majority Voting 多次生成答案,然后选择多数答案
Refinement from Feedback 根据模型自己的反馈迭代修改答案
LLM-Debate 多个 LLM 实例相互讨论和辩论
Quality-Diversity 生成具有差异性的多个回答并进行组合
Routing 根据问题类型将任务路由到不同专家角色
Stepping-back 先思考相关的一般原则,再解决具体问题

Meta-Agent 后续搜索的新 Agent,就是在这个基础上不断生成的。

因此论文比较的实际上是:

已有人工 Agent Library

Meta-Agent 自动搜索得到的新 Agent

之间的性能、行为和成本差异。


4. Context Curation:到底应该给 Meta-Agent 看哪些历史 Agent?

这是本文第一个核心问题。

Meta-Agent 在第 t 轮生成新 Agent 时,可以看到之前已经发现的一些 Agent。

问题在于:

应该把哪些历史 Agent 放入 Context?

论文设计了三种策略。


4.1 Cumulative:把所有历史 Agent 都放进去

第一种策略称为:

Cumulative Context Curation

也就是随着搜索不断进行,把之前搜索到的 Agent 全部加入上下文。

可以理解成:

初始 Agent + Agent_1 + Agent_2 + ... + Agent_t

全部提供给下一轮 Meta-Agent。

这是 ADAS 等工作使用的思路。

它背后的直觉非常自然:

Meta-Agent 看过的历史设计越多,就越容易从过去的成功和失败经验中学习。

如果这种假设成立,那么随着搜索不断进行,Agent 应该越来越好。


4.2 Parallel:完全忽略历史搜索结果

第二种方法非常简单:

Parallel Context Curation

Meta-Agent 每一次生成新 Agent 时,都只看到最开始的 7 个 Initial Agents。

也就是说:

Agent_1

Agent_30

实际上处于几乎相同的生成条件。

之前 Meta-Agent 自己搜索出来的:

Agent_1, Agent_2, ..., Agent_29

全部不会提供给第 30 次生成。

所以不同 Agent 基本相当于彼此独立地进行并行采样

这实际上构成了一个非常直接的 baseline:

如果 Meta-Agent 真能利用历史 Agent 学习,那么 Cumulative 至少应该明显优于 Parallel。

否则,把过去所有搜索结果塞进 Context 就没有带来真正的 Meta-Learning。


4.3 Evolutionary:只保留最优秀的历史 Agent

第三种方法是:

Evolutionary Context Curation

作者采用了类似进化搜索的思路。

每一轮都从当前 Archive 中选出:

训练集表现最高的 Top-7 Agent

把这些 Agent 当作下一代 Agent 的“parents”。

于是:

Archive → Top-7 Agents → Meta-Agent → New Agent

下一轮重新根据性能筛选 Top-7。

与 Cumulative 相比,这种方式不是把所有过去的设计全部塞进 Context,而是只保留质量较高的候选。

因此三种策略的区别可以概括为:

方法 Meta-Agent 看到什么 搜索逻辑
Cumulative 所有历史 Agent 不断累积全部历史
Parallel 只有最初的 7 个 Agent 每次独立搜索
Evolutionary 当前性能最高的 7 个 Agent 选择优秀 Parent 再生成

5. 实验设置

论文使用四个数据集:

Dataset 任务类型
MGSM 多语言数学推理
DROP 阅读理解与离散推理
MMLU 多领域知识与问题求解
GPQA 研究生水平科学问答

对于 MGSM、MMLU 和 DROP:

  • D_train = 128
  • D_test = 200

对于 GPQA:

  • D_train = 32
  • D_test = 160

由于 GPQA 训练样本较少,为降低训练过程中评估的方差,每个训练样本重复评估 5 次,因此一共进行:

32 × 5 = 160

次训练评估。

DROP 使用 F1 Score。

其他三个数据集使用 Accuracy。


5.1 使用的模型

作者延续 ADAS 的设置。

普通 Agent 内部调用的模型:

GPT-3.5

也就是说,无论 Chain-of-Thought、Debate,还是 Meta-Agent 新生成的 Agent,它们真正解决 benchmark 问题时主要调用 GPT-3.5。

而负责设计 Agent 的 Meta-Agent使用能力更强的:

GPT-4o

因此可以把系统理解为:

GPT-4o Meta-Agent → 生成 Agent Program → Agent Program 调用 GPT-3.5 → 解决任务


5.2 搜索次数

每次 Meta-Agent Search 都进行:

T = 30

轮。

论文所有主要结果均取:

3 次独立运行的平均值。

因此,每种 Context Curation 策略在一个任务上总共会产生:

30 × 3 = 90

个自动设计的 Agent。


6. 问题一:Meta-Agent 真的能够从历史 Agent 中学习吗?

论文首先比较 Cumulative、Parallel 和 Evolutionary。

如果 Cumulative 的假设成立,那么把之前搜索到的 Agent 全部加入 Context,应该比完全忽略这些 Agent 的 Parallel 更有效。

但实验结果恰恰相反。

论文 Table 1 中最佳训练 Agent 的平均性能为:

Context Best Agent 平均训练性能
Cumulative 55.0
Parallel 60.0
Evolutionary 60.3

也就是说:

直接忽略之前所有搜索结果的 Parallel,反而明显优于不断累积历史设计的 Cumulative。

这说明至少在本文研究的 ADAS 风格 Meta-Agent 中:

单纯把越来越多的历史 Agent 塞进 Context,并没有形成有效的跨轮学习。

甚至可能产生负面效果。


6.1 Evolutionary 可以改善这一问题

与单纯累积不同,Evolutionary 只把表现最好的 7 个历史 Agent 提供给 Meta-Agent。

在训练结果上,Evolutionary 整体表现最好。

例如 MGSM 上,最佳 Agent 的训练性能分别为:

方法 MGSM
Cumulative 41.4
Parallel 56.2
Evolutionary 56.5

作者指出,相对于 Cumulative,Evolutionary 在 MGSM 上能够获得最高约 +10% 的提升。

这说明问题并不是:

“历史 Agent 完全没有价值。”

而更可能是:

未经筛选地把全部历史 Agent 放进 Context,并不是一种有效的利用历史经验的方式。

选择高质量历史设计作为 Parent,能够得到更有效的 Meta-Learning。


6.2 Held-out Test 上的结果

论文还选择:

D_train 上表现最好的 Agent

然后在未参与搜索的 D_test 上测试。

结果如下:

Dataset Initial Cumulative Parallel Evolutionary
DROP 64.8 71.9 72.6 73.2
MGSM 38.4 41.2 51.8 53.5
MMLU 62.8 66.2 67.8 65.8
GPQA 30.0 29.7 31.3 28.5
Average 49.0 52.2 55.9 55.2

这里需要注意一个细节。

虽然 Evolutionary 在训练搜索结果和许多 Top-K 指标上表现较好,但在最终 held-out test 的四个任务平均值上:

Parallel = 55.9

略高于:

Evolutionary = 55.2

因此论文的实验并不能简单理解为:

Evolutionary 在所有情况下都优于 Parallel。

更准确地说:

  • Cumulative 明显没有体现出“历史越多越好”;
  • Parallel 已经能够获得很强的结果;
  • 筛选高质量历史设计的 Evolutionary 可以进一步改善搜索过程中的性能;
  • 但这种收益并非在所有测试集上都一致。

7. 问题二:搜索出来的 Agent 真的具有多样性吗?

Meta-Agent 搜索过程中会产生很多 Agent。

但通常最终部署的时候,只会选择其中一个最好的 Agent。

作者提出:

既然已经花大量成本设计了几十个 Agent,为什么不把这些 Agent 一起利用起来?

如果不同 Agent 擅长不同类型的问题,例如:

  • Agent A 擅长数学;
  • Agent B 擅长事实问答;
  • Agent C 擅长复杂推理;

那么在测试时,可以根据问题动态选择合适的 Agent。

这要求不同 Agent 具有:

Behavioral Diversity,即行为多样性。


8. 如何衡量 Agent 的行为是否相似?

作者没有根据 Agent 的代码结构计算相似度。

因为两个代码结构完全不同的 Agent,仍然可能回答对完全相同的一批问题。

论文关心的是:

这些 Agent 在真实问题上的行为是否不同。

对于 Agent f_i,作者记录它在所有训练问题上的表现:

s_i = eval(f_i, D_train)

可以把它想象成一个向量。

例如:

Question Q1 Q2 Q3 Q4 Q5
Agent A 1 1 0 0 1
Agent B 1 1 0 0 1
Agent C 0 0 1 1 0

其中:

  • 1:答对;
  • 0:答错。

显然:

Agent A 和 Agent B 的行为非常接近。

Agent C 则与它们完全不同。

作者把每个 Agent 的 Evaluation Vector 看成这个 Agent 的一种行为表示,然后计算 Agent 两两之间的 Cosine Similarity

因此这里衡量的不是:

“两个 Agent 的 Prompt 是否相似?”

而是:

“两个 Agent 是否倾向于答对相同的问题、答错相同的问题?”


9. Evolutionary 会降低 Agent 多样性

实验发现一个非常重要的 trade-off。

Evolutionary 会不断选择最优秀的历史 Agent 作为 Parent。

这种做法确实有助于提高性能。

但同时也会使后续 Agent 越来越接近这些高性能 Parent。

因此:

Evolutionary 搜索出来的 Agent 行为相似度通常更高。

也就是多样性降低。

Parallel 则没有这个问题。

因为每个新 Agent 都独立从初始 Library 开始生成,不会不断向之前的优秀 Agent 聚集。

因此 Parallel 在维持较强性能的同时,一般能够生成更加多样的 Agent。

作者由此指出了一个经典的:

Exploration–Exploitation Trade-off

即:

  • Evolutionary 更偏向 exploitation:围绕已经表现优秀的设计继续优化;
  • Parallel 更偏向 exploration:不断尝试彼此相对独立的新设计。

9.1 一个看起来有些反直觉的结果:Cumulative 多样性反而很高

论文 Figure 2 中还有一个值得注意的现象:

Cumulative 的 Agent 整体 Cosine Similarity 反而最低。

也就是说,它生成的 Agent 在行为上甚至可能比 Parallel 更加多样。

但这里不能把:

多样性高

直接等同于:

搜索质量高。

前面的结果已经表明,Cumulative 的整体性能明显较弱。

因此它可能探索了很多不同的 Agent,但这些差异本身并不意味着这些 Agent 更优秀。

作者进一步关注的是:

能否在保持性能的同时获得足够的多样性。

在这一点上,Parallel 展现出了较好的特性。


10. Coverage:多个 Agent 联合起来究竟能覆盖多少问题?

为了进一步研究 Agent 之间是否存在互补性,作者定义了一个很直观的指标:

Coverage

即:

一个问题只要被所有搜索出的 Agent 中至少一个回答正确,就认为这个问题被覆盖。

实验使用每个设置在 3 次运行中产生的全部:

90 Agents

计算 Coverage。

结果为:

Setting DROP MGSM MMLU GPQA Average
Cumulative 96.6 89.1 99.2 91.9 94.2
Parallel 96.0 95.3 97.7 94.4 95.9
Evolutionary 93.6 93.0 99.2 91.9 94.4

从平均结果来看:

Parallel 的 Coverage 最高,为 95.9。

这进一步说明 Parallel 更容易探索到具有不同能力模式的 Agent。

换句话说:

如果未来希望真正把搜索过程中产生的多个 Agent 联合起来使用,那么搜索策略不仅应该优化单个 Agent 的最高性能,也应该考虑 Agent Pool 本身的多样性与 Coverage。


11. 问题三:自动设计 Agent 真的划算吗?

前面的实验主要讨论性能。

但自动 Agent Search 有一个非常现实的问题:

它非常贵。

普通人工设计 Agent:

人工设计 Agent → 大规模运行

Meta-Agent 自动设计则需要:

大量 Agent Generation + 大量 Training Evaluation + 最终大规模运行

因此即使自动搜索出的 Agent准确率更高,也不一定意味着它经济上更划算。

作者把成本分成两个部分。


11.1 Fixed Design Cost

首先是固定设计成本 C0

它包括:

  1. Meta-Agent 生成所有候选 Agent 的成本;
  2. Agent Revision 和 Debug 的成本;
  3. D_train 上评估候选 Agent 的成本。

这些成本是在真正部署之前就已经支付的。

无论之后:

  • 运行 100 条测试数据;
  • 还是运行 100 万条测试数据;

这部分 Agent Search 成本都已经发生。

因此称为:

Fixed Cost。


11.2 Per-example Inference Cost

第二部分是正式部署 Agent 时,每处理一条问题产生的推理成本:

C_j

如果部署 n 个问题,那么总成本为:

Total Cost = C0 + n * C_j

对于人工已有的 Initial Agent,可以认为没有 Meta-Agent Search 的固定成本,因此:

C0 = 0

而 Meta-Agent 自动搜索的 Agent:

C0 > 0

所以自动搜索 Agent 要想经济上更划算,就必须满足:

搜索出的 Agent 性能足够高,并且在大规模运行以后,其性能优势能够抵消前期设计成本。


12. Meta-Agent 搜索出的 Agent 本身也更贵

作者首先比较不同 Agent 每处理一个测试问题的平均推理成本。

整体趋势为:

Cumulative > Evolutionary > Parallel > Initial

也就是说:

Meta-Agent 自动设计出来的 Agent,不仅前期搜索需要额外成本,运行时通常也比人工初始 Library 中的 Agent 更贵。

其中:

  • Cumulative 设计出来的 Agent 最昂贵;
  • Evolutionary 次之;
  • Parallel 相对便宜;
  • Initial Agents 最便宜。

这很重要。

因为自动 Agent Design 如果只是找到一个:

“多调用几次模型,所以准确率提高一点”

的 Agent,那么其性能提升本身未必具有经济价值。


13. Break-even Point:需要运行多少问题才能回本?

作者接下来计算:

自动搜索 Agent 的“每个正确答案成本”什么时候能够低于已有 Initial Agent?

因为自动搜索存在较大的固定成本 C0,所以刚开始部署时必然非常吃亏。

只有随着测试问题数量 n 不断增加,固定搜索成本被逐渐摊薄以后,才有可能出现交点。

作者将这个交点称为:

Break-even Point。

实验发现:

对于 Parallel Context Curation

  • DROP;
  • MMLU;

大约需要部署:

15,000 个问题

之后,Meta-Agent 设计出来的 Agent 才能够在“每个正确答案的成本”上超过 Initial Agent。

换句话说:

如果只需要解决几百或者几千个问题,那么前期自动 Agent Search 的成本根本无法收回。


13.1 只有两个数据集出现了有意义的 Break-even

更关键的是:

论文实验中只有:

  • DROP;
  • MMLU;

的 Parallel 设置最终能够达到 Break-even。

对于其他 Dataset 或 Context Curation 方法:

性能提升不足以抵消 Agent Search 和更高推理成本。

按照论文的成本模型,即使部署规模继续扩大,也无法获得经济优势。

因此作者的结论并不是:

“Meta-Agent Search 很贵,但只要数据足够多最终总能回本。”

而是:

只有当自动搜索得到的 Agent 同时具有足够明显的性能优势和合理的推理成本时,固定设计成本才可能被摊销。

在本文实验中,这种情况只出现在少数设置下。


14. 三个实验实际上形成了一个统一的 Trade-off

论文虽然分别讨论 Learning、Diversity 和 Economic Viability,但三个实验之间是相互联系的。

可以总结为:

搜索策略 性能 多样性 成本
Cumulative 较弱 较高 最高
Parallel 较强 较高 Meta-Agent 方法中最低
Evolutionary 搜索性能较强 较低 较高

Evolutionary 的核心优势是:

不断围绕已经表现优秀的 Agent 继续搜索。

因此它更擅长 exploitation。

但副作用是:

Agent Pool 越来越相似。

与此同时,更复杂的 Agent 往往意味着更多 LLM 调用,因此运行成本也可能提高。

Parallel 则完全不利用搜索历史,但反而表现出了:

  • 很强的性能;
  • 较好的行为多样性;
  • 较高的 Coverage;
  • 较低的推理成本。

这也是本文指出 Cumulative 式 Meta-Agent 存在问题的主要实验依据。


15. 这篇论文真正质疑的是什么?

需要注意,本文并不是在证明:

“Meta-Agent 自动设计 Agent 是无效的。”

事实上,Meta-Agent 搜索出的最佳 Agent,在多个任务上确实超过了初始人工 Agent。

论文质疑的是几个更加具体的假设。


15.1 “把所有历史结果放入 Context”并不等于学习

很多 Meta-Agent 方法的逻辑是:

过去 Agent → 放进 Context → 生成新 Agent

由于 Context 中包含历史设计,很容易把这种过程描述成:

Meta-Agent 在不断从历史经验中学习。

但本文实验表明:

如果去掉这些历史 Agent,采用 Parallel 独立采样,性能反而更高。

因此:

Context accumulation 本身不能作为 Meta-Learning 有效发生的证据。


15.2 最佳 Agent 性能不是唯一值得优化的目标

自动 Agent Search 通常关注:

最终能搜索到多高分的 Agent?

但如果搜索过程中产生了几十甚至上百个 Agent,那么整个 Agent Pool 的价值也值得考虑。

例如:

  • 不同 Agent 是否擅长不同问题?
  • 能否做 Routing?
  • 能否 Ensemble?
  • 能否根据任务动态选择 Agent?

这要求搜索算法维持足够的 Diversity。

Evolutionary 搜索虽然提高了 exploitation,但也会使 Agent 越来越相似。


15.3 Benchmark 分数提高不代表系统更划算

一个 Agent 通过:

  • 更多模型调用;
  • 更多 self-refinement;
  • 更多 debate;
  • 更复杂的 workflow;

获得更高准确率并不困难。

但这些操作都会增加推理成本。

再加上 Meta-Agent Search 本身需要大量 Agent Generation 和 Evaluation,因此真正部署时需要比较的是:

Performance 与 Cost 的联合关系。

而不能只比较 Accuracy 或 F1。


16. 论文的局限性

作者在论文中明确讨论了多个局限性。


16.1 只研究了一类 Meta-Agent

本文研究对象主要是:

Sample–Evaluate–Iterate

范式的 Meta-Agent。

因此这些结论不能直接推广到所有自动 Agent 设计方法。

其他:

  • 训练式 Meta-Agent;
  • 模块化搜索;
  • 动态 Agent 架构生成;
  • 其他搜索算法;

可能具有不同性质。


16.2 评价指标主要是 Accuracy 和 F1

本文实验主要关注:

  • Accuracy;
  • F1。

但在其他应用中,可能还有:

  • Reliability;
  • Consistency;
  • Latency;
  • Safety;
  • 其他 Utility;

等更加重要的指标。

因此本文的结论不一定能够直接推广到这些场景。


16.3 成本分析更适合存在可靠 Verifier 的任务

论文分析的是:

获得一个正确答案需要支付多少成本。

这种分析依赖于我们能够相对可靠地判断:

一个答案是否正确。

对于:

  • MMLU;
  • GPQA;
  • MGSM;
  • DROP;

这样的 benchmark,这比较容易实现。

但对于开放式 Agent 任务,如果没有可靠的 Verifier,可能需要使用其他经济评价方式。


16.4 Cosine Similarity 并不是完美的 Diversity 指标

本文通过:

Agent 在不同问题上的得分向量

计算 Cosine Similarity。

这种指标更倾向于认为:

能够解决相同问题的 Agent 是相似的。

但它同时存在一个偏差:

高性能 Agent由于能够共同解决大量问题,本身就更容易获得较高相似度。

因此:

高性能可能天然导致更高 Cosine Similarity。

为了检查结论是否只由这一指标产生,作者还使用二值 Score Vector 的 Hamming Distance 进行了额外实验,并观察到了相似趋势。


16.5 Meta-Agent Evaluation 存在大量随机性

作者特别指出,Meta-Agent Search 本身存在多层随机性:

  1. LLM Output 的随机性;
  2. Agent 内部多步推理的误差传播;
  3. Meta-Agent Sampling 的随机性;
  4. Agent Evaluation 的随机性;
  5. 不同搜索轨迹逐渐分叉形成的 trajectory-level divergence。

例如,第 3 轮恰好生成了不同 Agent:

Agent_3

就可能导致第 4 轮看到不同 Context。

之后:

Agent_4 → Agent_5 → ...

整个搜索轨迹都会逐渐产生巨大差异。

因此 Meta-Agent 的评估本质上需要:

多条独立搜索轨迹。

但由于完整搜索成本非常高,本文最终只进行了:

3 Runs

的平均。


17. Safety Considerations

作者还指出,自动生成并执行复杂 Agent 系统本身可能存在安全问题。

因为 Meta-Agent Search 的过程包括:

自动生成复杂系统 → 自动执行 → 根据结果继续修改

随着 Agent 代码和系统结构越来越复杂,这些系统可能在真正执行之前难以充分:

  • Audit;
  • Inspect;
  • Control。

因此自动 Agent Design 不仅存在性能与成本问题,也存在系统执行层面的安全风险。


18. 总结

本文研究的不是如何提出一个更复杂的 Agent Search Framework,而是对现有 Meta-Agent 自动 Agent 设计范式进行系统分析。

论文围绕三个问题展开。

第一,Meta-Agent 是否真的能够从历史 Agent 中学习?

结果表明:

简单地把所有历史 Agent 不断加入 Context 并没有产生有效的 Meta-Learning。

Cumulative 甚至不如完全忽略历史搜索结果的 Parallel。

相比之下,只选择高质量历史 Agent 作为 Parent 的 Evolutionary 策略能够改善搜索效果。


第二,搜索得到的 Agent 是否具有互补性?

作者通过每个 Agent 在训练问题上的表现构造 Behavioral Representation,并计算 Agent 间的相似度。

结果发现:

Evolutionary 虽然能够提高性能,但也会让生成的 Agent 更加相似。

Parallel 则能够在维持较强性能的同时保持更高的多样性,并取得最高的平均 Coverage。

因此自动 Agent Search 中存在明显的:

Exploration–Exploitation Trade-off。


第三,自动设计 Agent 在经济上是否值得?

Meta-Agent Search 存在两层成本:

Design Cost + Inference Cost

而自动搜索出来的 Agent 本身通常也比初始人工 Agent 更昂贵。

在论文的实验中,只有 Parallel 策略在:

  • DROP;
  • MMLU;

上能够在约:

15,000 个测试问题

之后达到 Break-even。

其他设置的性能提升不足以补偿设计和推理成本。


因此,这篇论文最终指出:

自动 Agent 设计不能只关注“能否搜索到一个更高分的 Agent”。

还需要同时考虑:

  • 搜索过程是否真正利用了历史经验;
  • Agent Pool 是否具有行为多样性;
  • 性能提升是否能够抵消设计成本和推理成本。

对于 sample–evaluate–iterate 类 Meta-Agent 来说,简单累积历史 Agent 并不等同于有效学习,而更有效的 Agent Search 需要同时处理 Learning、Diversity 与 Cost 三方面的权衡。


参考

  1. Batu El, Mert Yuksekgonul, James Zou. Inefficiencies of Meta Agents for Agent Design. Findings of EMNLP 2025.
    https://aclanthology.org/2025.findings-emnlp.1135/

  2. arXiv:2510.06711
    https://arxiv.org/abs/2510.06711

  3. Shengran Hu et al. Automated Design of Agentic Systems. 2024.
    https://arxiv.org/abs/2408.08435

posted @ 2026-09-22 16:19  YourF4u1t  阅读(3)  评论(0)    收藏  举报