LeanMem: Simple and Efficient Long-Term Memory for LLM Agents

论文阅读:LeanMem——面向 LLM Agent 的简单高效长期记忆

论文标题:LeanMem: Simple and Efficient Long-Term Memory for LLM Agents
作者:Yuxin Liao、Le Wu、Min Hou、Hao Liu、Han Wu、Zishu Wang
作者单位:合肥工业大学
发表位置:arXiv 预印本(cs.AI),v1,2026 年 8 月 4 日
arXiv 编号:2608.03463
原文链接:https://arxiv.org/abs/2608.03463
主题:LLM Agent、长期记忆、异构记忆、检索规划
核心问题:如何在减少记忆构建与推理开销的同时,避免统一压缩造成的细粒度证据丢失。


1. 引言:长期记忆中的效率与保真度矛盾

LLM Agent 要持续进行跨会话交互,必须能够保留用户属性、跟踪状态变化,并在很久之后重新找到相关证据。由于模型上下文窗口有限,系统通常会从历史对话中抽取信息,构建一个可检索的外部记忆库。

现有方法通常采用相对统一的处理流程:把一段用户与助手的对话送入 LLM,识别有用信息,将其总结为记忆条目,并更新已有记忆。这一做法面临两类相互牵制的问题:

  • 处理更多原始上下文,有助于保留证据,但会增加记忆构建的 token 消耗。
  • 更激进地摘要和压缩,可以降低成本,却可能不可逆地丢失未来问题所需的细节。

一些工作从构建侧降低开销,例如过滤冗余对话、预先压缩输入或延迟整合;另一些工作从检索侧提高保真度,例如迭代检索与多跳推理。前者仍可能过滤掉有用细节,后者则会增加推理阶段的 token 和延迟。

LeanMem 的出发点是:不同对话内容的可压缩性、时间动态性和保真要求并不相同,因此不应该使用同一种记忆表示。

对话内容大致可以分成四类:

内容性质 例子 合适的处理方式
长期价值很低 问候、确认、复述、临时请求 忽略
稳定且容易结构化 用户身份、长期偏好、固定属性 压缩为画像记忆
随时间变化 工作进展、状态更新、按时间发生的事件 保存为带时间锚点的事件记忆
细节密集且难以安全压缩 列表、计划、轮班表、分步骤讨论 建立轻量索引,并保留回到原对话的指针

image

【论文 Figure 1(不同对话内容在可压缩性和存储要求上的差异)】

基于这一观察,LeanMem 将整个长期记忆流程设计为三个相互配合的阶段:

  1. Controlled Memory Writing(受控记忆写入):先判断是否值得存储,再选择画像、事件或记录三种表示。
  2. Selective Memory Evolution(选择性记忆演化):只更新会动态变化的事件记忆。
  3. Adaptive Evidence Composition(自适应证据组合):针对当前问题选择记忆类型,并为不同类型分配不同检索预算。

2. 预备知识:长期记忆系统的一般流程

设跨多个会话累积的全部对话历史为 H,外部记忆库为 M。长期记忆系统通常包含两个阶段:

  • 记忆构建:从原始对话中抽取有价值的信息,转换为可检索的记忆条目,并在新交互到来时维护这些条目。
  • 记忆使用:面对查询 q,从 M 中检索支持证据,交给模型完成推理和答案生成。

部分系统还会重复执行检索与反思,直到认为证据足够。LeanMem 的目标不是简单增加检索轮数,而是在写入时选择最合适的表示,在维护时只更新真正会变化的部分,并在查询时按需组合证据。


3. LeanMem 方法

3.1 总体架构

LeanMem 的三阶段分别对应记忆的构建、维护和使用:

阶段 输入 关键决策 输出
受控记忆写入 历史对话中的主题片段 是否存储,以及使用何种表示 画像、事件、记录三类记忆
选择性记忆演化 新写入的事件及相关旧事件 是否补充、修订或延长已有状态 局部更新后的时间状态表示
自适应证据组合 当前查询和异构记忆库 需要哪些记忆类型、各取多少 在上下文预算内组织好的证据

image

【Figure 2(LeanMem 总体架构:主题分段、受控写入、选择性演化和自适应证据组合)】

3.2 受控记忆写入

受控写入包含四步:关键话语过滤、主题分段、写入调度和记忆实例化。

3.2.1 关键话语过滤

LeanMem 先用规则移除结构上信息量较低的轮次,包括问候、确认和复述。

论文针对非对称的用户—助手对话,将用户话语作为主要路由锚点。原因是用户通常负责引入个人需求、偏好和状态变化,而助手回答更多是在展开当前请求。因此,助手话语不会独立成为关键话语,但系统仍保留原始对话,之后需要细节时仍可访问助手内容。

这里需要区分两种“丢弃”:

  • 关键话语过滤发生在语义处理之前,移除的是结构上低信息的轮次。
  • 写入动作 ignore 发生在主题片段已经形成之后,表示该片段虽然有语义内容,但没有长期证据价值,例如一次性的临时请求。

3.2.2 主题分段

单个对话轮次往往缺少足够上下文,而完整会话又可能混合多个话题。LeanMem 因此选择“主题片段”作为后续写入决策的基本单位。

系统先计算相邻关键话语的余弦相似度。话题切换通常对应相似度的突然下降,因此论文用相似度曲线的“谷深”寻找边界。对位置 i,谷深可以用下面的普通文本形式表示:

d_i = 左侧 w 个相似度的均值 + 右侧 w 个相似度的均值 - 2 * s_i
threshold = mean(D) + 0.05 * std(D)

其中,s_i 是第 i 对相邻话语的相似度,D 是当前会话中所有有效位置的谷深集合。如果某个位置的谷深既是局部最大值,又不低于自适应阈值,就将其选为主题边界。

3.2.3 写入调度

对每个主题片段,调度器从四个动作中选择一种:

Y = {ignore, profile, event, record}

设计目标可以概括为:在未来推理所需证据损失不超过容忍上限的条件下,选择成本最低的表示。LeanMem 并不直接数值估计成本和信息损失,而是让一个基于 LLM 的调度器按照固定标准判断三个维度:

  • 稳定性:这段信息是否能在后续交互中持续复用。
  • 时间依赖性:它的含义是否依赖状态变化或时间顺序。
  • 保真要求:未来准确使用时,是否必须保留细节丰富的原始内容。

具体路由规则如下:

动作 路由条件 典型内容
profile 稳定、容易结构化 身份、属性、长期偏好
event 包含更新、进展或时间顺序 事件状态、阶段变化
record 内容密集,不能安全压缩 清单、方案、表格、详细讨论
ignore 不具有持续的证据价值 临时请求等

当多个条件重叠时,调度协议规定:时间依赖性优先于稳定性,而高保真要求会覆盖压缩型表示。例如,一条信息看似是用户属性,但如果它正在随时间变化,就应进入事件记忆;如果准确回答必须依赖大量原始细节,则应进入记录记忆。

调度器返回一个受固定模式约束的结构:

r_i = <write_action, source_indices, extracted_attributes>

其中 source_indices 指向支撑该决定的原始对话位置;只有在动作是 profile 时,extracted_attributes 才包含属性—值对。论文实现中,调度器与相应实验配置使用同一个指令遵循模型:闭源设置使用 GPT-4.1-mini,开源设置使用 Qwen3-8B。每个主题片段调用一次调度器。

3.2.4 三类记忆的实例化

调度结果确定后,系统根据源索引恢复支撑对话片段,并生成对应记忆:

记忆类型 保存内容 是否额外调用 LLM 设计目的
画像记忆 结构化属性—值对 否,直接复用调度器的抽取结果 用最小表示保存稳定事实
事件记忆 事件主题、时间锚点、状态描述 是,执行模式受限的抽取 支持时间排序和状态演化
记录记忆 检索要旨、关键词/实体、原文指针 仅用 LLM 生成简短要旨;GLiNER 抽取实体 轻量索引与原始证据保真兼得

画像记忆避免重复调用 LLM。事件记忆只输出三个必要字段,不做自由形式摘要。记录记忆也不试图把详细内容压缩成一个完整总结,而是保存:

record = <retrieval_gist, keywords_and_entities, source_pointer>

其中,检索要旨用于初步召回,轻量 GLiNER 模型抽取关键词和实体,源指针则允许系统在真正需要细节时回到原始对话。这里的短索引并不是信息越少越好,而是要足够简短、具体且有区分度;完整细节仍由原文指针保留。

3.3 选择性记忆演化

三类记忆的维护需求不同:画像记忆描述稳定属性,记录记忆保存不可变的源索引,只有事件记忆表示会被后续交互修订的过程。因此,LeanMem 只让事件记忆发生演化。

为降低在线维护成本,系统将写入与演化解耦:

  1. 新事件先进入事件缓冲区,并立即可被检索。
  2. 缓冲区达到预设容量后,触发一次延迟整合。
  3. 每个缓冲事件根据主题和状态召回相关旧事件,形成局部上下文。
  4. 相关事件按时间锚点排序,由 LLM 推断最新状态。
  5. 新事件可能补充已有主题、修订当前状态,或延长其时间线。

这一过程只更新局部相关事件,不反复重建整个记忆库;把多个事件批量演化,也摊薄了 LLM 调用成本。它还提前完成了部分跨会话时间证据整合,从而降低查询阶段多跳检索的负担。

3.4 自适应证据组合

固定 top-k 检索默认所有问题需要相同数量、相同类型的证据。LeanMem 则先分析查询的证据需求,再决定如何检索。

LLM 规划器按照固定提示模板分析四个方面:证据粒度、时间依赖、保真要求和聚合范围,并生成检索计划:

plan = <constraints, evidence_demand, memory_types, type_weights, retrieval_depths>
  • constraints 包含实体、属性、时间和关系约束。
  • evidence_demand 描述问题需要何种证据。
  • memory_types 指定画像、事件、记录中的一个或多个类型。
  • type_weights 表示问题对各类记忆的相对依赖。
  • retrieval_depths 为每种类型分配各自的 top-k 深度。

稳定属性查询更依赖画像记忆;状态变化和时间推理更依赖事件记忆;细节核验和来源追溯则更依赖记录记忆。

检索后,系统根据“类型相关性 + 查询约束匹配程度”进行重排,并乘以该类记忆的依赖权重。最后不把所有结果简单拼成一个全局 top-k 列表,而是按证据角色组织:

  • 画像条目提供稳定用户背景。
  • 事件条目按时间顺序排列,展示状态变化。
  • 记录条目只在需要高保真细节时,展开其指针所指向的原始对话。

由此,LeanMem 在上下文预算内按需组装证据,而不是让所有查询都承担相同的检索成本。


4. 实验

4.1 实验设置

论文在两个长期对话问答基准上评估 LeanMem:

数据集 规模与特点 评估范围
LoCoMo 10 段对话,平均约 16K tokens,最多 32 个会话 只评估有标准答案的 Category 1–4,共 1,540 个问题
LongMemEval-S 500 段交互历史,平均约 115K tokens、40–50 个会话,每段历史配一个问题 500 个问题

对比方法包括 FullText、Naive RAG、MemoryOS、A-MEM、LightMem 和 SimpleMem。所有记忆方法分别以 GPT-4.1-mini 和本地部署的 Qwen3-8B 实例化。FullText 直接输入完整历史;Naive RAG 检索 top-10 对话轮次;各方法使用 all-MiniLM-L6-v2 编码记忆以建立索引和完成检索。

效果指标包括证据召回率 Recall 和由 GPT-4.1-mini 判断的答案准确率 Accuracy,二者均报告 5 次运行的平均值。效率指标包括:

  • 每段对话的记忆构建 tokens;
  • 每个问题的推理 tokens;
  • 每个问题的推理延迟。

4.2 总体结果

下面提取论文 Table 1 中 LeanMem 的核心结果。token 数量单位为 K,括号中的准确率增量是相对同一设置下准确率最高的记忆基线。

数据集 主干模型 Recall Accuracy 相对最强记忆基线 构建 tokens 推理 tokens 延迟(秒)
LoCoMo GPT-4.1-mini 83.80 84.87 +5.54 69.45 3.04 2.77
LoCoMo Qwen3-8B 85.55 84.41 +5.84 92.92 3.01 3.23
LongMemEval-S GPT-4.1-mini 97.67 91.80 +15.07 117.61 3.62 2.16
LongMemEval-S Qwen3-8B 93.30 77.40 +2.80 160.35 3.95 2.14

论文报告,上表中 LeanMem 的 Accuracy 相对最强记忆基线均达到配对检验显著性,p < 0.05。整体上,LeanMem 在两个数据集、两个主干模型下都取得最高准确率,同时保持最低或接近最低的构建成本、推理 token 与延迟。

LoCoMo 的历史相对较短,但问题类型更多样,强调从异构证据中灵活取用信息。以 GPT-4.1-mini 为例,LeanMem 的 Recall 为 83.80,Accuracy 为 84.87;相较对应的最强基线,构建 token、推理 token 和延迟分别下降 26.8%、23.6% 和 13.4%。

LongMemEval-S 的平均历史长达约 115K tokens,更强调远距离证据保存和跨会话状态跟踪。在 GPT-4.1-mini 设置中,LeanMem 达到 97.67 Recall 和 91.80 Accuracy,比最强记忆基线分别高 2.52 和 15.07 个百分点,同时只使用 117.61K 构建 tokens、3.62K 推理 tokens 和 2.16 秒延迟。

Qwen3-8B 上也观察到相同总体趋势,说明结果并不只依赖某个闭源主干模型。由于 LongMemEval-S 的平均历史超过 Qwen3-8B 的上下文窗口,FullText 无法在该设置中运行。

论文还比较了 LeanMem 与 A-Mem:在不同设置下,LeanMem 的 Accuracy 最多提高 20.40 个百分点,构建 token 最多减少 17.24 倍,推理 token 最多减少 8.41 倍。

4.3 不同问题类型

image
image

【Figure 3 和 Figure 4(GPT-4.1-mini 在 LongMemEval-S 与 LoCoMo 各问题类别上的准确率)】

在 LoCoMo 的四类可回答问题上,LeanMem 都取得最高 Accuracy。相对每类最强基线,它在 Multi-Hop、Temporal、Open-Domain 和 Single-Hop 上分别提高 12.02、6.23、2.46 和 10.57 个百分点。

论文将 Single-Hop 与 Open-Domain 上的提升联系到画像记忆和源对齐记录记忆:前者保存可复用事实,后者保留细粒度细节。Temporal 与 Multi-Hop 上的改善则对应事件记忆和自适应证据组合,它们能够组织状态变化,并组合来自不同记忆类型的互补证据。

在 LongMemEval-S 上,提升主要集中在需要远距离状态跟踪和跨会话证据整合的问题,包括 Single Session Preference、Multi-Session、Temporal Reasoning 和 Knowledge Update。这与选择性事件演化及按查询组织证据的设计目标一致。

4.4 消融实验

消融实验使用 GPT-4.1-mini。表中的 token 是构建与推理 token 之和,单位为 K;延迟单位为秒。

配置 LoCoMo Accuracy LoCoMo token/延迟 LongMemEval-S Accuracy LongMemEval-S token/延迟
LeanMem 84.87 72.49 / 2.77 91.80 121.23 / 2.16
去掉关键话语过滤 75.58 109.75 / 4.70 82.20 149.42 / 3.48
去掉主题分段 82.79 92.92 / 3.98 79.60 184.33 / 3.96
去掉存储调度 72.79 123.56 / 3.36 71.00 172.73 / 3.60
去掉事件记忆演化 84.42 89.38 / 3.43 81.20 125.14 / 3.42
去掉检索规划 77.92 94.15 / 3.79 81.20 135.25 / 2.92

各组件的作用可以从结果中分别看到:

  • 关键话语过滤:去除后,无信息轮次进入后续流程,准确率下降,token 与延迟上升。
  • 主题分段:去除后,一个会话被作为单个构建单元,多个话题相互混杂;LongMemEval-S Accuracy 从 91.80 降到 79.60。
  • 存储调度:用统一摘要替换异构表示,在两个数据集上都产生最大的准确率下降,同时增加 token 使用。这是论文关于“最小充分表示”的最直接证据。
  • 事件记忆演化:LoCoMo 上影响较小,但 LongMemEval-S Accuracy 从 91.80 降至 81.20。长历史中的相关状态若不被整合,会保持碎片化,并在查询时需要更多证据。
  • 检索规划:用固定 top-k 检索替换后,准确率下降、推理成本上升,说明不同问题确实需要不同的记忆类型与检索预算。

4.5 案例分析

image

【Figure 5(三类记忆从构建、演化到查询使用的案例)】

论文通过案例展示三类记忆的不同生命周期:

  • 画像记忆将稳定、可复用的信息以最小充分形式保存,之后不再演化;未来查询用户事实时,可以直接提供精确证据而不引入无关上下文。
  • 记录记忆为信息密集内容生成轻量检索索引,并保留原始对话指针;重排阶段利用关键词提高问题与记录的匹配程度,真正需要细节时再回源。
  • 事件记忆把事件抽取为主题、时间锚点和状态,并将相关变化按时间顺序整合;未来查询更新情况时,可以提供连贯的时间证据。

5. 结论

LeanMem 研究的是长期记忆系统应如何表示异构对话信息。它反对对所有历史内容统一摘要:稳定属性适合紧凑结构化,动态信息需要时间状态跟踪,细节密集内容则应保留回到原始来源的能力。

整套方法围绕“按证据性质选择最低成本的充分表示”展开:

  1. 写入时过滤低价值内容,并把有用片段路由到画像、事件或记录记忆。
  2. 维护时只演化会变化的事件记忆,并采用缓冲、局部、延迟更新。
  3. 查询时分析证据需求,按记忆类型分配检索预算,并按角色组织证据。

LoCoMo 与 LongMemEval-S 上的结果表明,这一设计能够同时提高答案准确率,并降低构建和推理开销。消融实验进一步显示,异构存储调度是效果与效率平衡的核心,事件演化对长历史状态跟踪尤其重要,而检索规划避免了固定 top-k 带来的证据不足或无效开销。

论文没有单独设置“局限性”或“未来工作”章节。从已报告的实验范围看,验证集中在两个长期对话问答数据集、两种主干模型和问答准确率/召回率等指标;论文未进一步报告其他 Agent 任务形态、更多模型规模或真实长期部署中的结果。这些属于本文实验覆盖范围的边界,而不是论文额外提出的结论。

参考

  1. Yuxin Liao, Le Wu, Min Hou, Hao Liu, Han Wu, Zishu Wang. LeanMem: Simple and Efficient Long-Term Memory for LLM Agents. arXiv:2608.03463, 2026. 论文页面
  2. Adyasha Maharana et al. Evaluating Very Long-Term Conversational Memory of LLM Agents. ACL 2024.(LoCoMo)
  3. Di Wu et al. LongMemEval: Benchmarking Chat Assistants on Long-Term Interactive Memory. arXiv:2410.10813, 2024.
posted @ 2026-08-10 16:06  YourF4u1t  阅读(8)  评论(0)    收藏  举报