"Scaling Teams or Scaling Time? Memory Enabled Lifelong Learning in LLM Multi-Agent Systems" 论文笔记
LLMA-Mem 目前挂在 Arxiv 26.04 上,探讨了 LLM 多智能体系统中 "横向扩展团队规模" 与 "纵向积累时间经验" 两种扩展维度之间的交互关系,提出通过记忆设计实现更高效的终身学习
背景
LLM 多智能体系统(Multi-Agent Systems, MAS)可以通过两个不同维度进行扩展:"增加智能体数量" 和 "通过积累经验随时间改进"。尽管先前的工作分别研究了这两个维度,但它们在现实成本约束下的交互作用尚不清楚

核心洞察:本文提出应将 LLM 多智能体系统视为一个由团队规模和终身学习能力共同定义的概念性扩展空间。在这个视角下,扩展不再是一个单轴问题,而是变成了一个系统性问题:团队组成与随时间学习之间的交互如何影响长期效果和效率
现有研究的局限
-
团队规模扩展:早期工作如 MacNet(Qian et al., 2024)发现协作扩展遵循 logistic 模式,收益递减。Kim et al.(2025)的大规模对照研究表明,在固定预算下扩展团队规模可能因协调开销、工具调用竞争和错误放大而产生净负收益。Xu et al.(2026)则指出,同质化智能体中单个智能体通过多轮执行并利用 KV-cache 复用,可以大幅缩小甚至消除大规模团队的优势
-
终身学习扩展:现有工作如 Agent Workflow Memory(Wang et al., 2024)、ReasoningBank(Ouyang et al., 2025)、SimpleMem(Liu et al., 2026)等主要关注单智能体场景,多智能体系统中的终身学习行为如何随团队规模变化仍不明确
两个研究问题
-
RQ1:记忆设计如何改善多智能体系统中的终身学习?
-
RQ2:终身学习能力如何与多智能体系统中的团队规模交互?
方法

LLMA-Mem 是一个统一记忆框架,由三个相互依赖的记忆模块组成,支持不同多智能体拓扑结构
三大记忆模块
-
情景记忆(Episodic Memory)
-
存储过去任务执行的丰富记录,包括任务上下文、智能体交互、结果和事后反思
-
形式化定义:\(e_i = \langle a_{\mathrm{id}}, t_i, \tau_i, C_i, \mathcal{A}_i, o_i, c_i, \mathcal{L}_i, \mathcal{P}_{i}^{\mathrm{rel}} \rangle\)
-
作用:作为后续抽象的原始经验基础,支持基于案例的推理
-
-
程序记忆(Procedural Memory)
-
存储从情景经验中抽象出的可重用策略和技能
-
与情景记忆的实例特定性不同,程序记忆捕获跨多个任务被证明有效的泛化知识
-
形式化定义:\(p_j = \langle a_{\mathrm{id}}, t_j^c, t_j^d, \eta_j, \kappa_j, s_j, f_j, \mathcal{E}_j^{\mathrm{src}} \rangle\)
-
可靠性估计:\(rho_j = \frac{s_j}{s_j + f_j}\)(越多的情景记忆抽象出的越少程序记忆,可靠性越高)
-
作用:通过压缩原始轨迹为紧凑的程序记忆,显著降低 Token 消耗
-
-
交互记忆(Transactive Memory)
-
捕获 "谁知道什么",即团队内谁擅长什么任务、谁可靠等信息
-
跟踪每个智能体的专业领域和可靠性,支持高效的任务分配和协调
-
可靠性更新:\(\xi_k^{(t+1)} = \frac{\mathrm{successes}_k}{\mathrm{total\_tasks}_k}\)
-
三种记忆拓扑配置
-
本地拓扑(Local Topology):每个智能体维护私有记忆库 \(\mathcal{M}_i = \langle \mathcal{E}_{i}, \mathcal{P}_{i}, \mathcal{T}_{i} \rangle\)。知识仅在显式通信中传递。消融实验显示此拓扑在终身学习场景中效果最佳
-
共享拓扑(Shared Topology):所有智能体访问集中式记忆库 \(\mathcal{M}_{\text{shared}}\)。所有经验贡献给公共池,利于集体复用但可能引入检索噪声
-
混合拓扑(Hybrid Topology):\(\mathcal{M}_{i}^{\text{hybrid}} = \langle \mathcal{E}_{i}^{\text{local}}, \mathcal{T}_{i}^{\text{local}}, \mathcal{P}_{\text{shared}}, \mathcal{T}_{\text{shared}} \rangle\)。情景记忆保持本地(保留角色特定经验),程序记忆和团队统计全局共享
记忆生命周期

-
检索(Retrieval):
-
检索分数:\(\mathrm{score}(m,q) = \mathrm{rel}(m,q) + \mathrm{imp}(m)\)
-
其中 \(\mathrm{rel}(m,q)\) 为语义相关性(余弦相似度),\(\mathrm{imp}(m)\) 为记忆重要性(程序记忆为成功率,情景记忆为任务得分)
-
分层策略:优先查询程序记忆,若无足够相关程序则回退到情景记忆
-
-
更新(Update):
-
新情景追加到情景记忆:\(\mathcal{E}^{(t+1)} = \mathcal{E}^{(t)} \cup \{e_{\mathrm{new}}\}\)
-
程序使用统计更新:\(s_j^{(t+1)} = s_j^{(t)} + \mathbb{1}_{\mathrm{success}}, \quad f_j^{(t+1)} = f_j^{(t)} + \mathbb{1}_{\mathrm{failure}}\)
-
交互记忆统计刷新
-
-
整合(Consolidation)(每 N 个情景执行一次):
-
按情景中学到的教训(lessons_learned)进行语义聚类
-
从成功的经验中提取通用策略
-
创建新的程序记忆,移除冗余程序(源情景是其他程序的子集)
-
算法1(简化):
输入:情景记忆 ε
输出:新程序 P_new
1. 按 lessons_learned 的语义相似度对情景聚类
2. 对每个大小 ≥ 2 的簇:
3. 取成功的经验 E_succ
4. 若 |E_succ| ≥ 2,从中提取通用策略,创建程序
5. 移除源情景是其他程序子集的冗余程序
实验
实验设置
-
基准(Benchmark):MultiAgentBench(Zhu et al., 2025),选择三个协作环境:编程(Coding)、研究(Research)、数据库(Database),各 100 个任务
-
模型:Claude-Sonnet-4.5、DeepSeek-V3.2、Qwen3-next-80B、Qwen3-32B-Instruct。Claude-Sonnet-4.5 作为统一评估模型。所有模型通过 Amazon Bedrock API 访问
-
基线:
-
W.o. Memory:无记忆模块
-
MARBLE(Zhu et al., 2025):MultiAgentBench 原生的多智能体协作框架,含短时、长时和共享记忆
-
A-Mem(Xu et al., 2025):代表性记忆框架,维护动态知识网络和演化记忆存储
-
-
评估指标:
-
TS(Task Score):最终任务输出正确性/质量
-
CS(Communication Score):智能体间沟通和规划质量
-
AS(t)(运行平均表现):\(\frac{1}{t}\sum_{i=1}^{t}S_i\)
-
AAS(Average of AS):\(\frac{1}{T}\sum_{i=1}^{T}AS(i)\),系统整个生命周期表现的标量汇总
-
CMA_t(累积表现增益):\(\sum_{i=1}^{t}(s_i^{\mathrm{method}} - s_i^{\mathrm{no\_mem}})\),相对于无记忆基线的累积增益
-
主要结果(表1)

-
LLMA-Mem 在 TS 上表现最佳或持平,如 Qwen3-next-80B 在研究环境提升 +10.67
-
CS 趋势更复杂:记忆帮助智能体更有效地行动,但协调仍对模型家族和环境特定的交互模式更敏感
-
从终身学习视角(AAS)看,LLMA-Mem 优势明显:
-
最大增益:DeepSeek-v3.2 在研究环境 +5.92,Qwen3-32B-Instruct 在数据库环境 +3.19
-
唯一例外是 Qwen3-Next-80B 在研究环境(TS 提升但 CS 下降)
-

成本分析(图1)
-
LLMA-Mem 比 MARBLE 和 A-Mem 平均 Token 用量更低,降幅从 19.4% 到 171.7%
-
节省主要来自更低的输入 Token 开销:程序记忆将原始轨迹压缩为紧凑形式,避免上下文膨胀
-
关键洞察:LLMA-Mem 的增益不是通过消耗更多 Token 获得的,而是在提升性能的同时降低 Token 消耗
团队规模影响(图1)
-
二维扩展空间:从时间维度看,所有团队规模下 LLMA-Mem 都随任务索引增加持续改进;从空间维度看,增加团队规模通常也带来性能提升
-
非单调性(Non-Monotonic):
-
Qwen3-32B-Instruct 中 3 智能体团队优于 5 智能体团队
-
Claude-Sonnet-4.5 中 5 智能体团队在第 5 个任务后超越 7 智能体团队
-
核心洞察:支持更强经验积累和复用的记忆设计,可以使更小的团队在长期表现上超越更大的团队
-
-
成本视角:增加团队规模一致导致更高的计算成本。Qwen3-32B-Instruct 受益于 LLMA-Mem 的终身学习能力,以 3 智能体团队在任务得分上取得了优势
消融实验(表3)
1. 记忆拓扑影响( N=5 固定):
-
本地拓扑在 TS、CS、AAS 三项指标上均最佳
-
归因:在编程环境中,不同智能体扮演不同功能角色(分解、实现、调试、验证)。本地记忆允许每个智能体积累与其角色紧密耦合的程序和经验,使后续检索更兼容、更可直接复用。共享拓扑中,一个角色产生的经验可能被另一个职责不同的智能体检索到,导致不兼容的记忆复用
2. 整合间隔 (N) 影响(本地拓扑下):
-
(N=5) 表现最佳,(N=2)、10、20 均更差
-
非单调效应:
-
太频繁(N=2):经验证据不足时转化为程序,导致不稳定或过于具体的程序记忆
-
太稀疏(N=10, 20):有用经验长期困在情景形式中,延迟重用
-
中等频率(N=5):提供足够的重复证据形成可靠程序,同时足够快速支持未来任务
-
总结
LLMA-Mem 是一个通过情景-程序-交互三元记忆架构实现 LLM 多智能体系统终身学习的框架,揭示了 "团队规模扩展" 与 "时间经验积累" 之间的非单调权衡关系
论文标题:Scaling Teams or Scaling Time? Memory Enabled Lifelong Learning in LLM Multi-Agent Systems
作者:Shanglin Wu, Yuyang Luo, Yueqing Liang, Kaiwen Shi, Yanfang Ye, Ali Payani, Kai Shu
机构:Emory University, Illinois Institute of Technology, University of Notre Dame, Cisco Research
代码:https://github.com/ShanglinWu/MAS_lifelong_learning
关键词:LLM Multi-Agent Systems, Lifelong Learning, Memory Architecture, Team Size Scaling, Procedural Memory

浙公网安备 33010602011771号