多智能体系统论文速读
这份笔记按发表时间梳理七篇 LLM 多智能体协作(LLM-based Multi-Agent)的代表工作 CAMEL、AutoGen、AgentVerse、DyLAN、MacNet、AgentNet、MACE。它们大致勾勒出一条主线:从固定双智能体的自动对话,到通用的会话编程基础设施,再到动态组队、团队自优化,然后走向图结构下的规模化协作,最后走向去中心化自组织与可学习的动态编排。顺着读能看清这个方向如何一步步把"多个 agent 怎么高效协作"这个问题结构化
CAMEL: Communicative Agents for "Mind" Exploration of Large Language Model Society [NeurIPS 2023]
问题:基于对话的 LLM 在完成复杂任务时高度依赖人类不断介入引导,既费时又难以规模化。作者想探索让通信智能体自主协作的可扩展技术,同时观察它们协作时的"认知"过程
方法核心:提出 role-playing(角色扮演) 框架,配合 Inception Prompting(起始提示)。流程是:
-
先由一个 task specifier 把用户给的模糊任务细化成具体可执行的任务描述
-
再让两个互补角色自动对话,AI User 扮演下达指令的一方,AI Assistant 扮演执行并给出解法的一方,二者在各自的 system prompt 约束下循环互相 prompt,直到任务终止
-
Inception Prompt 只在开局做一次,由 task specifier prompt、assistant system prompt、user system prompt 三部分组成,用来锁定任务与角色,避免角色翻转、指令重复、无限循环等失稳
特点:最早把"角色扮演 + 自动对话"这一范式固化下来的工作之一,还顺带产出了大规模对话数据集用于研究 agent 社会行为。局限也很明显,结构固定为两个 agent、一问一答,没有动态组队和团队调整的能力,更多是范式奠基而非工程框架
AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation [arXiv 2023.08]
问题:此前的多 agent 应用大多各自为战,缺一个通用、灵活、可编程的基础设施来支撑不同复杂度、不同 LLM 能力的应用开发
方法核心:抽象出两个基本概念:
-
Conversable Agent(可对话智能体):把 LLM、人类输入、外部工具统一封装进同一种可对话、可定制的 agent,一个 agent 可以任意组合这三种能力
-
Conversation Programming(会话编程):用自然语言加代码来编排 agent 之间的交互模式,即定义谁跟谁说、何时说、说什么,从而灵活拼出两 agent 对话、群聊(GroupChat)、层级委派等多种拓扑,人类也可随时在环
特点:偏工程与基础设施导向,开源生态影响力很大,成为后续许多多智能体系统的底座。它把多 agent 系统看作一个"可编程的会话系统",灵活性极高,但代价是交互逻辑仍需开发者手工设计,框架本身不负责自动决定团队怎么组、结构怎么定
AgentVerse: Facilitating Multi-Agent Collaboration and Exploring Emergent Behaviors [ICLR 2024]
问题:单个 agent 能力有限,如何像人类专家团队一样,根据任务动态组建合适的专家组去协作解题,并顺便研究协作中自发出现的社会行为
方法核心:模仿人类团队解决问题的过程,设计了一个多轮迭代的四阶段闭环:
-
Expert Recruitment(专家招募):根据当前任务动态决定需要哪些角色、组建怎样的专家团队
-
Collaborative Decision-Making(协同决策):招募到的专家共同讨论、制定方案
-
Action Execution(动作执行):由 agent 实际执行决策产生的动作
-
Evaluation(评估反馈):评估执行结果,若不达标则回到招募阶段重新调整团队与方案,进入下一轮
特点:核心亮点是动态组队加闭环反馈,每一轮都能按需重组专家而非固定班底。此外系统性地观察到多种涌现社会行为,比如志愿协助(volunteer)、遵从(conformity)以及可能有害的破坏性行为,并讨论了它们的收益与风险
A Dynamic LLM-Powered Agent Network for Task-Oriented Agent Collaboration [COLM 2024]
问题:已有多 agent 方法普遍用固定数量的 agent 和静态通信结构,既没有针对具体任务挑选真正有用的 agent,也存在冗余算力和低效协作
方法核心:提出 Dynamic LLM-Agent Network(DyLAN),把 agent 组织成一个多轮、按层前馈的动态交互网络,围绕两条主线做优化:
-
推理时的动态选择与早停:交互过程中由一个 ranker 实时停用表现差的 agent,并配合 early-stopping 提前结束,兼顾性能与效率
-
Agent Importance Score(智能体重要性分数):一个无监督指标,通过类似反向传播的方式量化每个 agent 对最终答案的贡献,据此做团队优化,只保留高贡献 agent
整体是"先 Team Optimization、再 Task Solving"的两阶段范式,先用一次预演算出各 agent 的重要性分数选出最优团队,再用这个团队正式解题
特点:把"团队结构本身"变成可优化对象,用可量化的贡献度自动裁剪冗余 agent,在 MATH、HumanEval 等任务上相比单次执行有明显提升,同时因为早停和裁剪而更省成本
Scaling Large Language Model-based Multi-Agent Collaboration [ICLR 2025]
问题:神经网络有 scaling law,增加神经元往往带来性能提升,那么不断增加协作 agent 是否也有类似规律,又该如何组织成百上千个 agent 协作而不至于混乱
方法核心:提出 Multi-Agent Collaboration Network(MacNet),用有向无环图(DAG) 来组织 agent:
-
节点是 agent,边是协作关系,按拓扑序(topological ordering) 推进推理,信息单向流动、无环,解从这些对话中逐步凝练
-
agent 按角色分为 actor 和 critic 两类,前者产出内容、后者给出反馈,沿边不断传递并精炼中间产物(artifact)
-
支持 chain、tree、graph 三大类拓扑,并细分出 star、mesh、layered、random 等多种结构
特点:发现了协作 scaling law,整体性能随 agent 数量呈 logistic(S 型)增长,且这种协作涌现比传统神经网络的涌现出现得更早。框架可支撑上千个 agent 协作,且不规则拓扑往往优于规则拓扑,把多智能体的规模化问题第一次比较系统地摆上台面
AgentNet:Decentralized Evolutionary Coordination for LLM-based Multi-Agent Systems [NeurIPS 2025]
问题:已有 LLM 多智能体系统大多依赖中心化协调,规模一大就会遇到可扩展性瓶颈、适应性差以及"中心一挂全挂"的单点故障;同时隐私与专有知识的顾虑让跨组织协作难以展开,各方专长被困在各自的孤岛里
方法核心:提出一个完全去中心化、RAG 增强的框架,把 agent 组织成一个动态演化的有向无环图(DAG),彻底取消中心编排器:
-
双重能力节点:每个 agent 既能执行任务,又能做路由决策,根据自身专长和当前上下文自行决定任务往哪个 agent 流转,协调由局部自发完成而非中心统一下发
-
检索式记忆与专长分化:用 RAG 记忆系统积累任务经验,支持 agent 的持续技能精炼与专长分化,能力随经验自然生长,而不是被预先写死角色
-
拓扑实时自适应:agent 之间的连接不固定,图结构随任务需求在线调整,从而兼顾可扩展性与鲁棒性
特点:把协作从"中心调度"推向去中心化的自组织与自演化,天然消除单点故障、增强鲁棒性,并让集体智能自发涌现;去中心化也顺带带来隐私友好,跨组织协作无需暴露各自的专有数据。实验上其任务准确率高于单 agent 与中心化多 agent 基线
MACE:Multi-Agent Collaboration via Evolving Orchestration [NeurIPS 2025]
问题:大多数多智能体协作依赖静态的组织结构,当任务复杂度和 agent 数量一起上涨时难以自适应,带来大量协调开销和低效,结构一旦定死就没法随问题推进灵活调整
方法核心:提出 puppeteer(操纵者)范式,用一个可学习的中心编排器统一调度:
-
puppeteer 动态编排:一个中心编排器(puppeteer,操纵者)根据不断演化的任务状态实时指挥各 agent(puppets,被操纵的木偶),动态决定下一步激活、排序、优先哪些 agent,而不是照固定流水线走
-
用强化学习训练编排器:把编排器本身当作可学习对象,用 RL 训练它自适应地对 agent 排序与安排优先级,从而实现灵活、可演化的集体推理
特点:和以往"人工设计拓扑"或"启发式裁剪团队"不同,MACE 把编排策略本身变成学出来的。作者发现随训练推进,编排出的协作结构会自组织成更紧凑、带环(cyclic)的推理结构,在提升性能的同时显著降低计算成本,闭域和开域场景都成立。它和 MacNet 同出一脉(ChatDev / OpenBMB),但关注点从"如何组织大量 agent"转向"如何学出最优的动态编排"
脉络小结
把七篇串起来看,是一条协作结构不断自动化、规模不断放大的演进线:
-
CAMEL 确立范式,角色扮演加自动对话,但结构固定为两个 agent
-
AutoGen 把它工程化为通用可编程基础设施,会话即编程,灵活但仍靠人工编排
-
AgentVerse 引入动态组队与评估闭环,让团队能按任务重组,并观察到涌现行为
-
DyLAN 更进一步让团队结构本身可优化,用重要性分数自动增删 agent
-
MacNet 把 agent 数量推向规模化,用 DAG 加拓扑序组织,并总结出协作 scaling law
-
AgentNet 干脆去掉中心编排器,让 agent 在动态 DAG 上自路由、自演化,拓扑随任务实时自组织,并兼顾隐私与鲁棒性
-
MACE 反过来保留中心编排器,却用强化学习把它"学"出来,让编排随任务状态动态演化,还自发收敛出更紧凑的协作结构
一句话概括,协作的"结构"从人工固定走向人工可编程,再走向自动动态,然后走向大规模图结构,最终走向去中心化自组织(AgentNet)与可学习的动态编排(MACE),自动化程度和可承载的规模一路抬升,连"怎么组织"本身也越来越交给系统自己去学、去演化
CAMEL:https://arxiv.org/abs/2303.17760
AutoGen:https://arxiv.org/abs/2308.08155
AgentVerse:https://arxiv.org/abs/2308.10848
DyLAN:https://arxiv.org/abs/2310.02170
MacNet:https://arxiv.org/abs/2406.07155
AgentNet:https://arxiv.org/abs/2504.00587

浙公网安备 33010602011771号