Lightweight LLM Agent Memory with Small Language Models

论文阅读:LightMem——使用小语言模型构建轻量级 LLM Agent Memory

论文标题:Lightweight LLM Agent Memory with Small Language Models
作者:Jiaquan Zhang, Chaoning Zhang, Shuxu Chen, Zhenzhen Huang, Pengcheng Zheng, Zhicheng Wang, Ping Guo, Fan Mo, Sung-Ho Bae, Jie Zou, Jiwei Wei, Yang Yang
发表位置:ACL 2026 Main Conference,Volume 1: Long Papers
论文页码:12914–12929
Anthology ID:2026.acl-long.588
DOI:10.18653/v1/2026.acl-long.588
原文链接:https://aclanthology.org/2026.acl-long.588/
PDF:https://aclanthology.org/2026.acl-long.588.pdf
主题:LLM Agent Memory、小语言模型、分层记忆、两阶段检索、在线—离线解耦
核心问题:如何在不频繁调用大模型的情况下,提高 Agent 长期记忆的检索质量,同时控制在线延迟和上下文长度?


1. 论文要解决什么问题?

LLM Agent 在长期对话和多轮任务中,必须记住早期交互中的用户偏好、事件、决策和背景知识。

直接把完整历史对话放进上下文虽然简单,但会受到上下文窗口、输入 Token 数量和推理成本的限制。因此,许多 Agent 系统会把历史信息写入外部 Memory,并在需要时检索相关内容。

论文将现有 Memory 系统概括为两类。

1.1 基于检索的外部记忆

这类方法通常将历史对话压缩为若干 Memory 条目,然后使用向量相似度检索 Top-K 相关条目。

代表方法包括 MemoryBank、ReadAgent,以及部分采用外部检索机制的系统。

其优点是:

  • 在线开销较低;
  • 容易扩展到较大的记忆库;
  • 不需要在每次检索时调用大模型。

但它们也存在明显问题:

  • 原始用户问题未必适合直接作为检索查询;
  • 向量相似度只能提供粗粒度的语义匹配;
  • 相似但实际上无关的 Memory 容易进入上下文;
  • 随着 Memory 数量增长,检索噪声会越来越明显。

1.2 由 LLM 驱动的记忆操作

另一类方法使用 LLM 完成 Memory 的写入、检索、组织和更新。例如,模型可以判断哪些内容值得保存、哪些 Memory 与当前问题真正相关,以及如何将新记忆连接到已有记忆结构。

这类方法通常能够获得更好的语义判断能力,但如果每轮都需要多次调用大型模型,就会积累显著的在线延迟和推理成本。

因此,论文关注的是一个效率与效果之间的权衡:

Memory 路线 主要优势 主要问题
向量检索型 Memory 在线速度快、成本低 查询构造和候选过滤不足,检索准确性不稳定
LLM 驱动型 Memory 语义判断和记忆操作能力更强 在线阶段需要反复调用大模型,延迟较高
LightMem 使用 SLM 执行高频在线操作,将复杂整合放到离线阶段 仍依赖多个模型模块以及预先设计的控制流程

LightMem 的基本思路是:高频、结构化、需要低延迟的在线 Memory 操作不一定需要大型模型,可以交给专门的小语言模型(Small Language Model,SLM);更复杂的抽象和长期知识整合则由离线大模型处理。


2. LightMem 的整体设计

LightMem 将 Memory 操作模块化,并在两个维度上进行拆分:

  1. 将记忆分成短期记忆、中期记忆和长期记忆;
  2. 将实时在线操作与非实时离线整合分开。

系统中的主要模型组件包括:

组件 所处阶段 主要职责
SLM-1:Controller 在线 分析检索意图、生成假设查询、选择 Memory 层、分配检索预算
SLM-2:Selector 在线 对向量检索候选进行语义一致性验证和压缩
SLM-3:Writer 在线 将当前交互压缩为 MTM 条目,并维护 MTM
离线大模型 离线 将高价值 MTM 抽象、去标识化并增量整合到 LTM
回答生成模型 在线 读取当前上下文和检索结果,生成最终回答

这里的多个 SLM 并不是共同生成最终回答,而是分别负责 Memory 管线中的结构化子任务。论文将这些任务限制为相对明确的输入、决策和输出格式,以减少对开放式生成能力的依赖。

image

【Figure 2(LightMem 整体架构,包括 STM、MTM、LTM,以及由多个 SLM 驱动的在线路径和大模型驱动的离线整合路径)】

Figure 2 中需要重点观察两条路径:

  • 在线路径负责查询规划、Memory 检索、回答生成和 MTM 写入;
  • 离线路径负责从 MTM 中提炼长期知识,并增量更新图结构 LTM。

离线更新不会阻塞在线交互。


3. 三层记忆结构

LightMem 将记忆分成 STM、MTM 和 LTM。三者不是简单按照保存时间划分,而是保存不同类型、不同抽象层次的信息。

3.1 短期记忆 STM

短期记忆(Short-Term Memory,STM)就是当前 SLM 上下文窗口中保留的最近若干轮对话。

STM 的特点是:

  • 保存当前会话的近期交互;
  • 随对话逐轮更新;
  • 只作为工作记忆使用;
  • 不持久化到外部存储;
  • 不参与外部检索。

由于 SLM 的上下文容量有限,STM 通常只是经过截断的近期对话,而不是完整历史。

3.2 中期记忆 MTM

中期记忆(Mid-Term Memory,MTM)是个性化情景记忆(episodic memory)的主要载体。

每个 MTM 条目包含:

  • 简洁的语义摘要;
  • 时间信息;
  • 访问次数等使用统计;
  • 用于向量检索的 embedding;
  • 用户标识符。

MTM 保存的是用户相关的历史交互证据,例如用户偏好、过去作出的决策和特定事件。每个用户拥有逻辑隔离的 MTM,检索时使用用户标识进行约束,避免不同用户的个性化记忆相互混淆。

系统为每位用户的 MTM 设置容量上限 B。实验中使用的上限为 10^4 个条目。当条目数量超过限制时,系统会:

  • 删除陈旧、低效用的条目;
  • 根据时间和访问统计决定淘汰对象;
  • 合并重复或高度重叠的内容;
  • 进一步压缩冗余记忆。

3.3 长期记忆 LTM

长期记忆(Long-Term Memory,LTM)保存从高价值 MTM 片段中离线提炼出来的长期语义知识。

它与 MTM 的区别是:

属性 MTM LTM
信息性质 用户相关的情景记忆 稳定、可复用的语义知识
用户标识 包含 不包含
是否保存个人事件 保存压缩后的个人交互信息 不保存原始个人事件
组织方式 可检索的 Memory 条目 轻量级知识图
更新方式 每轮在线增量写入 离线批量整合
主要用途 个性化回忆和近期事件检索 一般知识、规律及多跳推理

LTM 中的信息需要经过去标识化处理。论文将其设计成跨用户共享的全局 Memory,其中保存稳定事实、领域规律和跨交互趋势,而不是某个用户的原始对话记录。


4. SLM-1:意图建模与检索控制

SLM-1 的角色是检索控制器,而不是检索器或回答生成器。

在第 t 轮交互中,它读取:

  • 当前用户输入 x_t
  • STM 中截断后的近期上下文 C_t

随后生成一个结构化检索计划,决定三个问题:

  1. 搜索什么;
  2. 到哪一层 Memory 中搜索;
  3. 在固定 Top-K 预算下,每类查询可以获得多少候选名额。

4.1 识别缺失信息

用户问题中经常包含不明确的表达,例如:

  • “它怎么样了?”
  • “上次那个项目怎么办?”
  • “最近我决定了什么?”
  • “给我推荐一家吃晚饭的地方。”

这些问题可能包含未解析的代词、隐含实体、不完整的时间范围或对历史对话的依赖。直接使用原句做向量检索,容易得到模糊或错误的候选。

SLM-1 首先识别这些缺失信息,再结合近期上下文将其显式化。

4.2 生成 HQ

SLM-1 将用户输入改写为一个或多个假设查询(Hypothetical Queries,HQs)。

这里的 HQ 不是假设答案,而是面向检索的独立查询。它的作用是把隐含的信息需求拆成明确的搜索目标。

论文给出的示例是:

用户输入:“Recommend a dinner spot.”

SLM-1 可以将其拆成两个 HQ:

  • 查询用户偏爱的菜系或饮食限制,路由到 MTM;
  • 查询附近评价较高的餐厅,路由到 LTM。

这样,个性化需求和一般事实需求便不会混在同一个模糊查询中。

4.3 路由与预算分配

SLM-1 会根据查询的信息性质确定检索目标:

  • 与用户偏好、用户历史或个人事件有关的查询进入 MTM;
  • 与公共事实、一般知识或共享规律有关的查询进入 LTM;
  • 同时涉及两类信息时,可以生成多个 HQ 并分别路由。

所有 HQ 共享一个固定的最终 Top-K 预算。SLM-1 要在 MTM 和 LTM 之间分配这项预算,而不是让每个查询无限制返回候选。

其输出可以概括为:

retrieval_plan = {
    hypothetical_queries,
    metadata_constraints,
    memory_routes,
    retrieval_budget
}

其中,元数据约束可以包含用户 ID、时间窗口以及 Memory 类型或来源标签。

这些约束一方面用于减少搜索噪声,另一方面也用于执行用户级 Memory 隔离。


5. SLM-2:两阶段 Memory 检索

得到检索计划后,LightMem 不会直接把向量检索的 Top-K 结果交给回答模型,而是采用“粗检索 + 语义过滤”的两阶段流程。

5.1 第一阶段:带元数据约束的向量粗检索

系统针对每个 HQ,在相应的 MTM 或 LTM 中执行向量检索。

如果生成了 n 个 HQ,系统将第一阶段总候选预算固定为 2K,并将预算平均分配给各个 HQ:

每个 HQ 的候选预算约为 2K / n
第一阶段合并候选数不超过 2K
最终返回数不超过 K

第一阶段的目标是召回覆盖率,而不是完成最终选择。

用户 ID、时间范围和类型标签会在向量检索期间作为元数据过滤条件。由此,系统先把庞大的 Memory 搜索空间压缩成一个固定大小的候选集合。

5.2 第二阶段:语义一致性过滤

SLM-2 同时读取:

  • SLM-1 生成的所有 HQ;
  • 第一阶段产生的至多 2K 个候选;
  • 候选对应的必要元数据。

然后逐一判断候选是否能够直接支持至少一个 HQ。

SLM-2 的相关性判断以语义对齐为主,而不是只观察表面词汇是否相似。仅仅在主题上宽泛相关,但无法为当前检索意图提供直接支持的条目,应当被排除。

最终,SLM-2 从 2K 个候选中保留不超过 K 个 Memory,交给回答模型。

这相当于一次固定比例的候选压缩:

Memory 库
    -> 元数据过滤与向量粗检索
    -> 最多 2K 个候选
    -> SLM-2 语义一致性判断
    -> 最多 K 个最终 Memory

该设计有三个作用:

  • 将语义判断限制在固定大小的候选池中,控制计算量;
  • 弥补纯向量相似度无法进行细粒度语义验证的问题;
  • 主动丢弃约一半候选,减少输入回答模型的噪声和 Token 数量。

SLM-2 只执行选择,不能改写 Memory、扩展查询、生成解释或回答用户。


6. 回答生成

经过两阶段检索得到的 Memory 集合 R_t 会与 STM 中的近期上下文 C_t 拼接,然后交给固定的回答生成模型:

response = Generator(current_query, STM_context, retrieved_memory)

回答生成模型本身不负责修改或控制 Memory。

实验中,LightMem 和所有对比方法使用相同的回答生成配置,以尽量隔离 Memory 机制带来的影响。主要实验固定使用 GPT-4o-mini 作为回答生成模型,同时也在 GPT-4o、Qwen2.5 和 Llama 3.2 等不同规模的模型上进行评估。


7. SLM-3:在线 Memory 写入与 MTM 维护

回答生成后,SLM-3 读取:

  • 当前用户输入;
  • 当前系统回答;
  • 相关的 STM 上下文。

它从这次交互中提取未来可能复用的用户相关信息,将其压缩为简短、自包含的语义摘要,并追加到该用户的 MTM 中。

SLM-3 不应简单保存完整对话,而是要把暂时性的对话转换为可复用的 Memory 表示。

7.1 冗余处理

如果新 Memory 与已有条目高度重复或语义重叠,系统会合并或重写这些条目,避免 MTM 不断积累重复信息。

7.2 冲突处理

当新旧 Memory 发生冲突时,SLM-3 根据以下信息处理:

  • 时间线索;
  • 累积证据强度。

例如,用户较新的偏好可能取代过去的偏好。论文给出了这一处理原则,但没有在正文中提供一套适用于所有冲突类型的确定性规则。

7.3 容量控制

当 MTM 超过容量上限 B 时,系统利用新近性和访问统计:

  • 淘汰陈旧、低效用的条目;
  • 压缩仍然存在的冗余内容;
  • 将 MTM 大小重新控制在上限以内。

SLM-3 只维护当前用户的 MTM,不执行跨用户抽象,也不负责检索或生成用户回答。


8. 离线长期记忆整合

如果所有长期知识整合都发生在每轮在线交互中,就会重新引入较高的响应延迟。因此,LightMem 将复杂的长期抽象交给具有大上下文窗口的离线 LLM。

该过程异步执行,不阻塞用户当前的交互。

8.1 选择待整合的 MTM

每次离线整合只处理增量批次,而不是从头重建整个 MTM 和 LTM。

候选主要包括:

  • 新写入的 MTM;
  • 最近被检索并重新激活的 MTM;
  • 在容量压力下被标记为低效用的 MTM。

8.2 抽象与去标识化

离线 LLM 将情景性的交互摘要抽象为更加稳定的一般知识,同时移除用户身份和会话特有细节。

其目标不是把个人历史直接复制进全局 LTM,而是提取可跨上下文复用的知识单元。

8.3 增量更新图结构 LTM

系统先在现有 LTM 中搜索与新知识候选最相近的语义锚点,然后只更新其局部邻域:

  • 插入新节点;
  • 建立新边;
  • 与已有节点合并;
  • 更新已有节点;
  • 丢弃不适合长期保留的候选。

因此,每次整合都只是局部增量更新,而不是重新构建整张知识图。

8.4 证据积累与遗忘

随着整合周期增加,相同知识可以积累更多支持证据。

对于长期缺乏支持的弱知识,系统应用置信度衰减,并进一步降低权重或删除,使偶然信息和过时信息逐渐退出 LTM。

论文定义的 LTM 图元素如下:

类别 类型 含义
节点 Entity 具体对象、地点或命名项目,如 Python script、Paris、Project X
节点 Concept 表示共享属性的抽象类别,如 Programming Language、Capital City
IsA 实体与概念之间的类别归属关系
HasProperty 实体与某种属性或状态之间的关系
RelatedTo 基于共现或功能相关性的通用语义联系
Implies 从推理轨迹中提取的逻辑或因果依赖

LTM 的图结构主要用于关联组织和多跳访问。


9. 在线—离线解耦带来的计算特性

在线阶段的检索和写入由量化 SLM 执行,并受到固定预算约束;长期整合则异步执行。

论文将这一设计的效果概括为:

  • 在线检索计算量由固定的 K 控制;
  • LTM 的演化不会直接增加在线回答延迟;
  • 大模型只在离线整合阶段处理较重的抽象任务;
  • 每次离线更新只处理增量批次。

论文报告的 LTM 更新特征如下:

指标 数值 含义
批量更新间隔 每 10–15 轮 当积累足够新条目或出现 MTM 容量压力时触发
节点增长速度 约每 4 轮新增 1 个节点 大量交互被压缩和过滤,只有部分信息进入 LTM
离线处理时间 约 3.5 秒/批次 包含抽象、图连接和结构更新,不计入在线延迟
完整系统 F1 4.12 包含离线整合
关闭离线更新后的 F1 3.96 禁用 LTM 演化后性能下降

10. Prompt 与组件接口设计

论文附录提供了 SLM-1、SLM-2、SLM-3 和离线 LLM 的完整 Prompt 设计原则。

所有 Prompt 采用统一结构:

字段 作用
Role 明确模型在系统中的职责
Input 明确模型能够访问的信息
Task 定义模型必须执行的具体任务
Constraints 限制模型不能执行的行为
Output Format 定义固定、可被程序解析的输出格式

这种设计是为了让在线 SLM 主要执行结构化控制与判断,而不是开放式生成。

其中:

  • SLM-1 只能进行查询分解、路由和预算分配,输出 JSON;
  • SLM-2 只能从现有候选中做选择,输出 JSON;
  • SLM-3 只能生成一个或多个短语义 Memory 摘要;
  • 离线 LLM 输出新增或更新后的 LTM 知识单元及其图连接。

11. 实验设置

11.1 数据集

论文使用两个长期对话数据集。

数据集 主要特点 评估重点
LoCoMo 长对话平均约 9K Token Single-hop、Multi-hop、Temporal、Open-domain 和 Adversarial 问答
DialSim 基于电视剧构建,包含 1300 个跨越多年时间的多方对话 Session 长期多方对话中的回答一致性

11.2 对比方法

论文选择了五种代表性基线:

  • LoCoMo 的完整上下文方案;
  • ReadAgent;
  • MemoryBank;
  • MemGPT;
  • A-MEM。

这些方法覆盖了完整历史回放、摘要压缩、外部检索、分页式 Memory 和 LLM 驱动的自组织 Memory 等不同设计。

11.3 Backbone

实验涉及:

  • GPT-4o;
  • GPT-4o-mini;
  • Qwen2.5-1.5B;
  • Qwen2.5-3B;
  • Llama-3.2-1B;
  • Llama-3.2-3B。

11.4 评价指标

LoCoMo 主要报告:

  • F1;
  • BLEU-1;
  • 有效上下文 Token 长度。

DialSim 额外报告:

  • ROUGE-L;
  • ROUGE-2;
  • METEOR;
  • SBERT 相似度。

其中,SBERT 用于衡量生成回答与参考回答之间的语义一致性,避免只根据字面重叠评价答案。

11.5 实现配置

LightMem 的默认在线控制模块采用本地部署的量化 Llama-3.2-1B-Instruct,并通过 Ollama 运行。论文还使用 Qwen2.5-1.5B-Instruct 验证 SLM 选择的鲁棒性。

其他关键配置包括:

配置项 设置
回答生成模型 GPT-4o-mini
Embedding 模型 all-MiniLM-L6-v2
Embedding 维度 384
粗检索近邻数 Top-10
SLM-2 训练方式 LoRA 微调
SLM-2 训练样本 2000 个 (Query, Subgraph, Path) 样本
MTM 容量上限 10^4
测试硬件 单张 NVIDIA RTX 4090 24GB

论文说明,其他未特别列出的设置沿用 A-MEM。


12. LoCoMo 主要结果

论文在六种不同规模的模型上比较 LightMem 与基线。完整表格包含五类问题的 F1 和 BLEU-1,下面摘录能够反映主要结论的结果。

Backbone 方法 Multi-hop F1 Temporal F1 Adversarial F1 有效上下文长度
GPT-4o-mini A-MEM 27.02 45.85 50.03 2520
GPT-4o-mini LightMem 28.85 46.20 54.50 1150
GPT-4o A-MEM 32.86 39.41 36.35 1216
GPT-4o LightMem 34.50 40.10 41.50 680
Qwen2.5-1.5B A-MEM 18.23 24.32 46.00 1300
Qwen2.5-1.5B LightMem 21.50 25.60 49.80 720
Llama-3.2-1B A-MEM 19.06 17.80 58.81 1376
Llama-3.2-1B LightMem 22.40 19.90 63.50 750

论文报告,LightMem 在 LoCoMo 上相对 A-MEM 的平均 F1 提升约为 2.5。

与完整上下文回放方案相比,LightMem 不需要把接近 16K Token 的完整历史输入模型。以 GPT-4o-mini 为例:

  • LoCoMo 完整上下文方案使用 16910 Token;
  • MemGPT 使用 16977 Token;
  • LightMem 使用 1150 Token。

因此,LightMem 的结果不仅涉及回答指标,也体现为更短的有效上下文。

需要注意的是,LightMem 并非在 GPT-4o 的所有单项指标上都超过完整上下文方案。例如 GPT-4o 上的 Single-hop F1,LoCoMo 完整上下文方案为 61.56,而 LightMem 为 49.80。论文的主要结论是 LightMem 在不同模型规模及多数问题类别上表现得更加稳定,并在多跳和时间推理方面具有明显优势,而不是在每个单项上都绝对领先。


13. DialSim 结果

在使用 GPT-4o-mini 的 DialSim 实验中,结果如下。

方法 F1 BLEU-1 ROUGE-L ROUGE-2 METEOR SBERT
LoCoMo 2.55 3.13 2.75 0.90 1.64 15.76
MemGPT 1.18 1.07 0.96 0.42 0.95 8.54
A-MEM 3.45 3.37 3.54 3.60 2.05 19.51
LightMem 4.12 3.95 4.20 4.15 2.48 23.40

LightMem 在所有指标上取得最高结果。其 SBERT 相似度由 A-MEM 的 19.51 提升至 23.40。

这说明改进不只体现在生成文本与参考答案的字面重合程度上,也体现在语义一致性上。不过从绝对数值看,DialSim 的 F1 等词汇指标仍然较低,表明长期多方对话模拟本身具有较高难度。


14. 消融实验

论文分别移除或简化 LightMem 的关键模块:

  • 移除 SLM-2 语义重排序,只使用 embedding Top-K;
  • 移除 HQ 和检索路由,直接使用原始问题检索;
  • 移除 MTM,只使用 STM 和 LTM;
  • 移除离线整合,不再从 MTM 更新 LTM;
  • 移除 LTM 图结构,改用扁平向量库。

以 DialSim、Llama-3.2-1B 的 F1 为例:

设置 F1 相对完整系统的变化
完整 LightMem 4.12
不使用语义重排序 3.83 -0.29
不使用 HQ 和检索路由 3.87 -0.25
不使用 MTM 3.75 -0.37
不使用离线整合 3.96 -0.16

移除 MTM 带来的下降最大,说明保存个性化情景信息的中间层对于长期对话是必要的。

只采用向量检索时,性能也会明显下降,说明第二阶段的语义过滤并非仅增加了额外处理步骤,而是在帮助系统排除表面相似但不能直接支持当前意图的 Memory。

移除离线整合造成的下降相对较小,但仍然稳定存在。论文据此说明,LTM 的持续演化可以提供额外收益,但在线 MTM 和检索机制承担了更直接的作用。

移除图结构后,SBERT 从 23.40 降至 22.82,说明图结构 LTM 对语义质量和关联推理有所帮助。


15. 延迟与可扩展性

论文在统一配置下使用 GPT-4o-mini 比较检索延迟和端到端延迟。

方法 检索 P50/ms 检索 P95/ms 端到端 P50/ms 端到端 P95/ms
LoCoMo 0 0 2054 3658
ReadAgent 34 97 614 1027
MemoryBank 16 51 439 1047
MemGPT 143 451 2087 3451
A-MEM 856 1583 914 3682
LightMem 83 167 581 1325

LoCoMo 的检索延迟为 0,是因为它不执行外部 Memory 检索,而是直接输入完整上下文。这并不意味着其整体响应最快:其端到端 P50 为 2054 ms。

LightMem 的检索速度不是所有方法中最快的。ReadAgent 和 MemoryBank 的检索延迟更低,但 LightMem 在检索质量和延迟之间取得了更平衡的结果。

与需要较重 Memory 操作的 A-MEM 相比,LightMem 的检索 P50 从 856 ms 降至 83 ms;其端到端 P50 为 581 ms。论文同时报告 LightMem 的上下文通常更短,这有助于降低 Prompt 构造和回答生成成本。


16. MTM 增长时的性能稳定性

随着 Memory 库增长,向量检索会面临越来越多的相似候选和检索噪声。

论文沿同一条完整对话轨迹,分别统计 MTM 增长到约 100、1000、5000 和 10000 条时的累计 F1。

MTM 规模 纯向量检索 F1 LightMem F1 差值
约 100 3.95 3.98 +0.03
约 1000 3.90 4.05 +0.15
约 5000 3.86 4.09 +0.23
10000 3.83 4.12 +0.29

当 MTM 较小时,两种方法差距有限。随着条目数量增加,纯向量检索的表现逐渐下降,而 LightMem 保持相对稳定。

这一趋势与 SLM-2 的作用一致:Memory 越多,粗检索产生的噪声越明显,第二阶段语义过滤的价值也越突出。

这里的数据来自同一条对话轨迹在不同自然增长阶段的累计统计,并不是针对每一种 Memory 大小重新独立运行模型。


17. 错误注入压力测试

长期 Memory 系统中的错误可能跨轮传播。因此,论文分别在三个在线模块中注入错误。

组别 设置 F1 SBERT
A 完整 LightMem 4.12 23.40
B SLM-1 中注入 50% HQ 噪声 3.95 23.08
C 移除 SLM-2 重排序 3.83 22.56
D SLM-3 中注入 50% 写入噪声 3.78 22.45
E 三种错误级联出现 1.85 11.20

SLM-1 的查询噪声造成中等程度下降,说明后续语义过滤可以抵消一部分查询规划错误。

移除 SLM-2 后下降更加明显,说明粗检索候选需要经过语义筛选。

SLM-3 写入噪声造成的影响更大,因为错误内容会进入 MTM,并在未来多轮检索中持续产生影响。它不是一次性的回答错误,而是对 Memory 库的长期污染。

当错误查询、缺少过滤和错误写入同时出现时,F1 降至 1.85,表明模块错误可能跨阶段、跨轮次积累并放大。


18. Update Gap:MTM 与 LTM 之间的更新间隙

LTM 采用离线周期性更新,因此新信息写入 MTM 后,不会立刻进入 LTM。这会形成一个更新间隙(update gap)。

如果系统只检索 LTM,就可能找不到尚未完成整合的近期事实;如果只检索 MTM,又可能缺少较早的长期知识。

论文在 LoCoMo 的 Multi-hop 子集上进行了压力测试。

设置 Multi-hop F1
完整 LightMem,同时检索 MTM 与 LTM 28.85
只检索 LTM 19.45
只检索 MTM 20.12
MTM 噪声饱和 23.10

同时从 MTM 和 LTM 检索,可以将尚未整合的近期事实与较早的长期知识组合起来,从而缓解离线更新带来的时间差。

但是,当 MTM 被大量噪声占据时,固定 Top-K 预算也会被无关的近期记录消耗,使真正相关的新事实更难进入最终候选。因此,并行检索能够缓解 update gap,但无法完全消除严重 Memory 污染的影响。


19. 失败案例:模糊意图导致焦点稀释

论文分析了 SLM-1 的一种轻微失败模式。

假设用户询问:

“你能提醒我,我对项目时间线作了什么决定吗?”

真正需要的用户决策保存在 MTM 中,但 LTM 可能包含通用的项目规划原则。

SLM-1 可能生成三个 HQ:

  1. 检索用户的时间线决策,路由到 MTM;
  2. 消除项目指代歧义,路由到 MTM;
  3. 检索通用时间线规划知识,路由到 LTM。

在固定 Top-K 预算下,第三个查询会占用一部分检索名额,使通用建议混入结果。

最终回答通常仍然能够召回正确的用户决策,但可能因为附带一般性建议而变得不够集中或简洁。论文将这种现象称为焦点稀释(focus dilution)。

它主要影响 F1、BLEU 等词汇重叠指标,而语义相似度通常较稳定。SLM-2 的语义过滤能够保留主要的 MTM 证据,但无法保证完全去除所有宽泛相关的信息。


20. 论文的核心贡献

LightMem 的主要贡献可以归纳为以下三点。

20.1 用专门化 SLM 承担在线 Memory 操作

论文没有让一个大型模型同时负责所有 Memory 操作,而是把查询控制、候选筛选和 Memory 写入拆成多个结构化子任务,分别交给小语言模型。

复杂、低频、无需实时完成的长期抽象则留给离线大模型。

20.2 在固定预算下进行两阶段检索

第一阶段以向量检索保证召回覆盖率,第二阶段以 SLM 进行语义一致性判断。系统先检索 2K 个候选,再压缩到最终不超过 K 个 Memory。

这种设计试图同时避免两种极端:

  • 只使用向量检索导致候选噪声过多;
  • 对整个 Memory 库进行大模型语义判断导致成本过高。

20.3 将个性化情景记忆与共享长期知识分离

MTM 保存带用户标识的个性化事件;LTM 保存经过去标识化的共享语义知识。

在线并行检索两层 Memory,使系统既能访问近期尚未整合的信息,也能使用较早形成的长期知识。


21. 局限性

论文明确指出,目前只研究了一种特定的、由专门化 SLM 驱动的在线—离线解耦 Memory 管线。

尚未被充分探索的内容包括:

  • 不同的离线整合策略;
  • 不同的在线控制策略;
  • 这些替代策略对性能和效率的影响。

从论文给出的压力测试来看,系统还存在以下已观测到的边界:

  • SLM-1 的模糊查询分解可能造成检索焦点稀释;
  • SLM-3 的错误写入会形成持续性的 Memory 污染;
  • 多个模块同时失效时,错误会在长期交互中级联放大;
  • MTM 噪声过多时,固定 Top-K 预算可能被无关条目占据;
  • 离线更新意味着 MTM 与 LTM 之间天然存在更新间隙。

这些现象不意味着论文提出了对应的完整解决方案,而是实验中展示出的系统行为和仍需进一步研究的问题。


22. 总结

LightMem 面向 LLM Agent 长期 Memory 中的效率—效果权衡,提出了一套由多个小语言模型驱动的模块化记忆系统。

它将 Memory 分为:

  • 保存近期上下文的 STM;
  • 保存用户情景信息的 MTM;
  • 保存去标识化共享知识的图结构 LTM。

在线阶段:

  1. SLM-1 分析意图、生成 HQ、路由查询并分配预算;
  2. 向量检索在元数据约束下产生 2K 个粗候选;
  3. SLM-2 进行语义一致性判断,将候选压缩到最多 K 个;
  4. 回答模型结合 STM 和检索 Memory 生成响应;
  5. SLM-3 将本轮可复用信息写入并维护 MTM。

离线阶段:

  1. 大上下文 LLM 读取增量 MTM 批次;
  2. 将情景记录抽象并去除用户标识;
  3. 在 LTM 图中寻找语义锚点;
  4. 增量插入、合并、更新或删除知识;
  5. 根据证据积累和置信度衰减执行长期维护。

实验表明,LightMem 在 LoCoMo 和 DialSim 上整体优于多种 Memory 基线,并在较短有效上下文下取得较低的在线延迟。与此同时,压力测试也表明,查询规划、语义过滤和写入质量并不是相互独立的:其中任一环节发生错误都可能影响后续 Memory,而多个环节的错误还会跨轮次积累和放大。

LightMem 的核心并不是单纯用小模型替代大模型,而是根据 Memory 操作的频率、复杂度和实时性,将不同任务分配给不同规模的模型,并通过固定预算、分层存储和在线—离线解耦控制整个长期记忆管线。

参考

  1. Jiaquan Zhang et al. Lightweight LLM Agent Memory with Small Language Models. ACL 2026.
  2. Adyasha Maharana et al. Evaluating Very Long-Term Conversational Memory of LLM Agents. ACL 2024.
  3. Charles Packer et al. MemGPT: Towards LLMs as Operating Systems. 2023.
  4. Wanjun Zhong et al. MemoryBank: Enhancing Large Language Models with Long-Term Memory. AAAI 2024.
  5. Kuang-Huei Lee et al. A Human-Inspired Reading Agent with Gist Memory of Very Long Contexts. ICML 2024.
  6. Wujiang Xu et al. A-MEM: Agentic Memory for LLM Agents. 2025.
posted @ 2026-09-14 13:21  YourF4u1t  阅读(13)  评论(0)    收藏  举报