Agent长期记忆主流&前沿选型
Memory OS
MemGPT: Towards LLMs as Operating Systems
核心思想:把记忆当作是虚拟内存管理,让agent学会管理上下文,agent应该是有内存层级的长期进程
记忆分层:
main context,类比RAM,prompt内容
core memory,常驻内存,用户画像,agent身份,稳定偏好
archive memory,磁盘,可搜索的长期历史
recall memory,聊天日志,过去对话的完整记忆或摘要
缺点:
过度依赖LLM自己判断该记什么,可能LLM会漏掉信息,错写不重要的信息
检索质量依赖于memory写入质量
记忆结构偏文本化,擅长存储自然语言记忆,但对实体关系/时间变化/业务状态这些结构化知识不够强
Generative Agents:Interactive Simulacra of Human Behavior
小镇Agent,将agent架构分成:memory,reflection,planning,每个agent会保存自己的观察记录,然后系统定期从大量低层记忆里总结出高层反思,再根据记忆和反思生成计划
缺点:
记忆真实性难以保证,可能从真实观察 推导出错误结论
缺少严格的记忆更新 和 遗忘机制,对旧记忆过期 冲突处理比较少
多agent持续观察反思规划,消耗的LLM调用很多
Reflexion:Language Agents with Verbal Reinforcement Learning
agent失败后 不更新模型参数,而是让模型写一段自然语言反思,放进memory buffer里,下一次尝试同类任务时,把这段反思放进上下文,帮助agent避免重复犯错
传统强化学习要更新参数,而reflexion用语言反思来模拟学习过程
缺点:
反思可能是错的,会污染后续行为
过拟合经验,一次失败写下来的规则可能只适合单个case
记忆管理粗糙:没有去重,合并,过期,版本控制
依赖明确反馈:如果任务没有清晰的成功和失败信号
Voyager:An Open-Ended Embodied Agent with LLMs
skill library设计:agent把学会的复杂行为保存成可执行代码,以后遇到类似任务可以检索并复用
经验——》代码技能——〉技能描述——》向量检索——〉复用/组合
把记忆从文本 升级成 代码的可执行技能,函数比自然语言经验更稳定也更复用
缺点:
安全问题:agent自动生成并保存可执行代码的话,需要做权限控制,沙箱,审计等
技能泛化有限:真实业务中的API,权限,数据结构经常变化
依赖于可执行环境:需要环境可执行代码并返回反馈,很多现实任务没有那么清晰的环境
Mem0:Production-Ready Long-Term Memory
从持续对话中动态提取,巩固,检索重要信息
graph memory:用图结构捕捉对话元素之间的复杂关系
对话输入——》判断是否值得记——〉抽取memory——》和旧memory合并/更新——〉检索相关memory——》注入上下文
实现低成本低延迟可扩展的记忆模块
缺点:
抽取器质量决定上限:memry提取如果错了,后续所有检索和回答都会错
记忆更新很难:比如覆盖旧偏好 vs 新增一个矛盾事实,LLM怎么判断?
A-MEM:Agentic Memory for LLM Agents
memory system大多只是存储+检索,缺少组织能力
zetterlkasten卡片盒方法:每条记忆不是简单的文本chunk,而是带上下文描述/关键词/标签/链接的结构化note,新记忆加入时 系统会分析历史记忆,建立相关链接,并更新旧记忆的上下文表示
新经验 ↓ 生成 memory note:描述 / 标签 / 关键词 ↓ 寻找相关旧记忆 ↓ 建立链接 ↓ 更新旧记忆表示 ↓ 形成动态知识网络
优点:
强调记忆的organization,通过组织结构来减少长期agent记忆的检索噪声
支持memory evolution,新记忆进入后更新旧记忆标签,上下文和连接关系,让记忆网络持续变好
缺点:
写入成本高,每条记忆要生成note,打标签,找关联,更新旧记忆
链接质量依赖于LLM,如果记忆连接出错,会造成记忆网络污染
可解释但不一定可控
AgeMem:Learning Unified Long-Term and Short-Term Memory Management
现有的记忆管理方法把短期记忆和长期记忆分开管理,太过依赖外部controller,AgeMem把记忆操作变成agent policy的一部分,用三阶段progressive RL和step-wise GRPO训练这种记忆管理行为
不是手写记忆存取规则,而是让模型自己学会自己管理记忆
写规则的话泛化能力有限,而AgeMem把memory management变成可学习策略
优点:
第一,方向很前沿。
如果成立,agent 不再依赖固定 memory pipeline,而是能根据任务动态管理短期和长期记忆。
第二,同时处理 STM 和 LTM。
这比只做长期向量库更完整,因为很多失败来自短期上下文选择不当,而不只是长期记忆缺失。
第三,记忆操作是 tool-based action。
这和现代 agent 框架兼容:search memory、write memory、summarize memory、delete memory 都可以是工具。
第四,论文报告在多个 long-horizon benchmark 上优于 memory-augmented baselines。
缺点:
第一,训练成本高。要做 RL,不是普通业务团队随便能复现的。
第二,reward 设计困难。记忆操作的收益经常是延迟体现的:现在写的一条 memory,可能十步之后才有用。
第三,工程落地还早。相比 Mem0、Zep 这类可以直接接入的系统,AgeMem 更偏研究路线。
第四,安全和可控性问题更大。如果 agent 自己决定删除、更新、保留记忆,必须有审计、权限和人为干预机制。


浙公网安备 33010602011771号