多智能体系统论文速读

这份笔记按发表时间梳理七篇 LLM 多智能体协作(LLM-based Multi-Agent)的代表工作 CAMELAutoGenAgentVerseDyLANMacNetAgentNetMACE。它们大致勾勒出一条主线:从固定双智能体的自动对话,到通用的会话编程基础设施,再到动态组队、团队自优化,然后走向图结构下的规模化协作,最后走向去中心化自组织与可学习的动态编排。顺着读能看清这个方向如何一步步把"多个 agent 怎么高效协作"这个问题结构化

CAMEL: Communicative Agents for "Mind" Exploration of Large Language Model Society [NeurIPS 2023]

问题:基于对话的 LLM 在完成复杂任务时高度依赖人类不断介入引导,既费时又难以规模化。作者想探索让通信智能体自主协作的可扩展技术,同时观察它们协作时的"认知"过程

方法核心:提出 role-playing(角色扮演) 框架,配合 Inception Prompting(起始提示)。流程是:

  • 先由一个 task specifier 把用户给的模糊任务细化成具体可执行的任务描述

  • 再让两个互补角色自动对话,AI User 扮演下达指令的一方,AI Assistant 扮演执行并给出解法的一方,二者在各自的 system prompt 约束下循环互相 prompt,直到任务终止

  • Inception Prompt 只在开局做一次,由 task specifier prompt、assistant system prompt、user system prompt 三部分组成,用来锁定任务与角色,避免角色翻转、指令重复、无限循环等失稳

特点:最早把"角色扮演 + 自动对话"这一范式固化下来的工作之一,还顺带产出了大规模对话数据集用于研究 agent 社会行为。局限也很明显,结构固定为两个 agent、一问一答,没有动态组队和团队调整的能力,更多是范式奠基而非工程框架

AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation [arXiv 2023.08]

问题:此前的多 agent 应用大多各自为战,缺一个通用、灵活、可编程的基础设施来支撑不同复杂度、不同 LLM 能力的应用开发

方法核心:抽象出两个基本概念:

  • Conversable Agent(可对话智能体):把 LLM、人类输入、外部工具统一封装进同一种可对话、可定制的 agent,一个 agent 可以任意组合这三种能力

  • Conversation Programming(会话编程):用自然语言加代码来编排 agent 之间的交互模式,即定义谁跟谁说、何时说、说什么,从而灵活拼出两 agent 对话、群聊(GroupChat)、层级委派等多种拓扑,人类也可随时在环

特点:偏工程与基础设施导向,开源生态影响力很大,成为后续许多多智能体系统的底座。它把多 agent 系统看作一个"可编程的会话系统",灵活性极高,但代价是交互逻辑仍需开发者手工设计,框架本身不负责自动决定团队怎么组、结构怎么定

AgentVerse: Facilitating Multi-Agent Collaboration and Exploring Emergent Behaviors [ICLR 2024]

问题:单个 agent 能力有限,如何像人类专家团队一样,根据任务动态组建合适的专家组去协作解题,并顺便研究协作中自发出现的社会行为

方法核心:模仿人类团队解决问题的过程,设计了一个多轮迭代的四阶段闭环:

  • Expert Recruitment(专家招募):根据当前任务动态决定需要哪些角色、组建怎样的专家团队

  • Collaborative Decision-Making(协同决策):招募到的专家共同讨论、制定方案

  • Action Execution(动作执行):由 agent 实际执行决策产生的动作

  • Evaluation(评估反馈):评估执行结果,若不达标则回到招募阶段重新调整团队与方案,进入下一轮

特点:核心亮点是动态组队闭环反馈,每一轮都能按需重组专家而非固定班底。此外系统性地观察到多种涌现社会行为,比如志愿协助(volunteer)、遵从(conformity)以及可能有害的破坏性行为,并讨论了它们的收益与风险

A Dynamic LLM-Powered Agent Network for Task-Oriented Agent Collaboration [COLM 2024]

问题:已有多 agent 方法普遍用固定数量的 agent 和静态通信结构,既没有针对具体任务挑选真正有用的 agent,也存在冗余算力和低效协作

方法核心:提出 Dynamic LLM-Agent Network(DyLAN),把 agent 组织成一个多轮、按层前馈的动态交互网络,围绕两条主线做优化:

  • 推理时的动态选择与早停:交互过程中由一个 ranker 实时停用表现差的 agent,并配合 early-stopping 提前结束,兼顾性能与效率

  • Agent Importance Score(智能体重要性分数):一个无监督指标,通过类似反向传播的方式量化每个 agent 对最终答案的贡献,据此做团队优化,只保留高贡献 agent

整体是"先 Team Optimization、再 Task Solving"的两阶段范式,先用一次预演算出各 agent 的重要性分数选出最优团队,再用这个团队正式解题

特点:把"团队结构本身"变成可优化对象,用可量化的贡献度自动裁剪冗余 agent,在 MATH、HumanEval 等任务上相比单次执行有明显提升,同时因为早停和裁剪而更省成本

Scaling Large Language Model-based Multi-Agent Collaboration [ICLR 2025]

问题:神经网络有 scaling law,增加神经元往往带来性能提升,那么不断增加协作 agent 是否也有类似规律,又该如何组织成百上千个 agent 协作而不至于混乱

方法核心:提出 Multi-Agent Collaboration Network(MacNet),用有向无环图(DAG) 来组织 agent:

  • 节点是 agent,边是协作关系,按拓扑序(topological ordering) 推进推理,信息单向流动、无环,解从这些对话中逐步凝练

  • agent 按角色分为 actorcritic 两类,前者产出内容、后者给出反馈,沿边不断传递并精炼中间产物(artifact)

  • 支持 chain、tree、graph 三大类拓扑,并细分出 star、mesh、layered、random 等多种结构

特点:发现了协作 scaling law,整体性能随 agent 数量呈 logistic(S 型)增长,且这种协作涌现比传统神经网络的涌现出现得更早。框架可支撑上千个 agent 协作,且不规则拓扑往往优于规则拓扑,把多智能体的规模化问题第一次比较系统地摆上台面

AgentNet:Decentralized Evolutionary Coordination for LLM-based Multi-Agent Systems [NeurIPS 2025]

问题:已有 LLM 多智能体系统大多依赖中心化协调,规模一大就会遇到可扩展性瓶颈、适应性差以及"中心一挂全挂"的单点故障;同时隐私与专有知识的顾虑让跨组织协作难以展开,各方专长被困在各自的孤岛里

方法核心:提出一个完全去中心化、RAG 增强的框架,把 agent 组织成一个动态演化的有向无环图(DAG),彻底取消中心编排器:

  • 双重能力节点:每个 agent 既能执行任务,又能做路由决策,根据自身专长和当前上下文自行决定任务往哪个 agent 流转,协调由局部自发完成而非中心统一下发

  • 检索式记忆与专长分化:用 RAG 记忆系统积累任务经验,支持 agent 的持续技能精炼与专长分化,能力随经验自然生长,而不是被预先写死角色

  • 拓扑实时自适应:agent 之间的连接不固定,图结构随任务需求在线调整,从而兼顾可扩展性与鲁棒性

特点:把协作从"中心调度"推向去中心化的自组织与自演化,天然消除单点故障、增强鲁棒性,并让集体智能自发涌现;去中心化也顺带带来隐私友好,跨组织协作无需暴露各自的专有数据。实验上其任务准确率高于单 agent 与中心化多 agent 基线

MACE:Multi-Agent Collaboration via Evolving Orchestration [NeurIPS 2025]

问题:大多数多智能体协作依赖静态的组织结构,当任务复杂度和 agent 数量一起上涨时难以自适应,带来大量协调开销和低效,结构一旦定死就没法随问题推进灵活调整

方法核心:提出 puppeteer(操纵者)范式,用一个可学习的中心编排器统一调度:

  • puppeteer 动态编排:一个中心编排器(puppeteer,操纵者)根据不断演化的任务状态实时指挥各 agent(puppets,被操纵的木偶),动态决定下一步激活、排序、优先哪些 agent,而不是照固定流水线走

  • 用强化学习训练编排器:把编排器本身当作可学习对象,用 RL 训练它自适应地对 agent 排序与安排优先级,从而实现灵活、可演化的集体推理

特点:和以往"人工设计拓扑"或"启发式裁剪团队"不同,MACE 把编排策略本身变成学出来的。作者发现随训练推进,编排出的协作结构会自组织成更紧凑、带环(cyclic)的推理结构,在提升性能的同时显著降低计算成本,闭域和开域场景都成立。它和 MacNet 同出一脉(ChatDev / OpenBMB),但关注点从"如何组织大量 agent"转向"如何学出最优的动态编排"

脉络小结

把七篇串起来看,是一条协作结构不断自动化、规模不断放大的演进线:

  • CAMEL 确立范式,角色扮演加自动对话,但结构固定为两个 agent

  • AutoGen 把它工程化为通用可编程基础设施,会话即编程,灵活但仍靠人工编排

  • AgentVerse 引入动态组队与评估闭环,让团队能按任务重组,并观察到涌现行为

  • DyLAN 更进一步让团队结构本身可优化,用重要性分数自动增删 agent

  • MacNet 把 agent 数量推向规模化,用 DAG 加拓扑序组织,并总结出协作 scaling law

  • AgentNet 干脆去掉中心编排器,让 agent 在动态 DAG 上自路由、自演化,拓扑随任务实时自组织,并兼顾隐私与鲁棒性

  • MACE 反过来保留中心编排器,却用强化学习把它"学"出来,让编排随任务状态动态演化,还自发收敛出更紧凑的协作结构

一句话概括,协作的"结构"从人工固定走向人工可编程,再走向自动动态,然后走向大规模图结构,最终走向去中心化自组织(AgentNet)与可学习的动态编排(MACE),自动化程度和可承载的规模一路抬升,连"怎么组织"本身也越来越交给系统自己去学、去演化

CAMEL:https://arxiv.org/abs/2303.17760

AutoGen:https://arxiv.org/abs/2308.08155

AgentVerse:https://arxiv.org/abs/2308.10848

DyLAN:https://arxiv.org/abs/2310.02170

MacNet:https://arxiv.org/abs/2406.07155

AgentNet:https://arxiv.org/abs/2504.00587

MACE:https://arxiv.org/abs/2505.19591

posted @ 2026-09-24 18:45  绵满  阅读(31)  评论(0)    收藏  举报