RoMeRL: Balancing Feedback Coverage and the Memory-Reward Trap in Self-Evolving Agent Memory via Reduced-Order Utility States
论文阅读:RoMeRL——用低阶记忆状态平衡反馈覆盖与记忆—奖励陷阱
论文标题:RoMeRL: Balancing Feedback Coverage and the Memory-Reward Trap in Self-Evolving Agent Memory via Reduced-Order Utility States
作者:Yi Yang、Zhennan Chen、Yihong Zhuang、Tiehan Fan、Yinan Chen、Jian Li、Jian Yang、Ying Tai
发表位置:arXiv 预印本
arXiv 编号:2608.02508
版本:v2,2026 年 8 月 4 日
原文链接:https://arxiv.org/abs/2608.02508
论文代码:https://github.com/YOUNG-fnxm/RoMeRL
论文分类:Machine Learning(cs.LG)、Computation and Language(cs.CL)
主题:大语言模型智能体、长期记忆、自我进化、运行时强化学习
核心问题:当智能体积累的历史经验越来越多时,怎样在不更新底层大模型参数的前提下,让有限的任务反馈更有效地训练外部记忆,同时减少无关或错误记忆被错误奖励的风险?
1. 这篇论文属于什么领域?
这篇论文与强化学习有关,但它研究的不是传统意义上的策略训练,也没有使用 PPO、DQN 等算法去更新大语言模型参数。更准确地说,它位于下面几个方向的交叉处:
- 大语言模型智能体(LLM Agent);
- 智能体长期记忆;
- 无参数更新的自我进化;
- 基于任务奖励的运行时记忆学习。
论文中的“强化学习”发生在智能体的外部记忆系统里。智能体完成任务后得到成功或失败的结果,系统利用这个结果更新被检索记忆的效用值,也就是 Q 值。下一次面对相似任务时,系统综合考虑记忆与任务的语义相似度以及 Q 值,决定应该把哪些经验放进大模型的上下文。
因此,这项工作的目标不是让大模型本身通过训练获得新参数,而是让智能体在使用过程中逐步学会:哪些历史经验值得再次调用,哪些经验应该被替换,哪些失败虽然没有直接成功,却仍然包含可复用的信息。
2. 研究背景:智能体为什么需要学习记忆?
大语言模型本身通常是无状态的。一次交互结束后,过去完成任务的步骤、遇到的错误和得到的反馈不会自动变成以后可复用的经验。智能体记忆系统通过保存和检索历史轨迹,弥补了这一缺陷。
早期方法主要依靠预先设计的工作流来管理记忆。例如,系统可以保存完整的情节记忆,将失败转写为反思,把成功轨迹总结成技能,或者通过语义相似度检索相关经验。这类方法不需要训练底层模型,但记忆的生成、选择和遗忘通常由固定规则或提示词控制。
后续的学习型记忆方法开始利用下游任务结果来优化记忆系统。其基本流程是:
- 保存过去的任务轨迹;
- 为每条轨迹维护一个效用值;
- 新任务到来时,按照语义相似度和效用值检索若干记忆;
- 智能体参考这些记忆执行任务;
- 根据最终成功或失败,更新本次使用过的记忆效用。
这种方法使外部记忆可以随交互不断演化,却也引出了论文关注的两个耦合问题:反馈稀释和记忆—奖励陷阱。
3. 轨迹级记忆强化学习的两个问题
3.1 记忆越多,单条记忆得到的反馈越少
设系统已经保存了 N_t 条轨迹,并为每条轨迹维护一个独立 Q 值。一次任务最多检索并更新 k 条记忆,经过 T 次任务交互后,整个系统最多获得 k * T 次记忆级更新。
问题在于,N_t 会随历史不断增长,但每天能够执行的任务数量和每次能够检索的记忆数量都是有限的。因此,有限反馈会被分散到越来越大的效用空间中:
- 很多新记忆进入系统后从未被再次检索;
- 大量 Q 值长期停留在初始值;
- 少数频繁访问的记忆集中了大部分更新;
- 系统越来越难判断整个记忆池中哪些内容真正有用。
论文把“当前记忆自进入系统后还没有收到过直接效用更新”的比例称为 Cold-Q ratio。这个比例越高,说明越多记忆仍处于效用冷启动状态。
从理论上看,如果希望同时把所有轨迹的原始回报估计到给定误差范围内,所需反馈预算会随记忆数量近似线性增长,并额外带有对数项。也就是说,记忆池持续扩张时,想把每条记忆都学清楚,交互成本也必须持续增长。
3.2 任务成功不等于每条被检索记忆都有贡献
一次任务往往会同时检索多条记忆,而系统最后只获得一个任务级奖励。假设智能体参考了 A、B、C 三条经验并成功完成任务,常见做法会把这个成功结果同时用于更新 A、B、C 的 Q 值。
然而,任务成功可能主要由 A 带来;B 可能没有贡献,C 甚至可能是过时或错误的经验。只看最终奖励,系统无法知道每条记忆的真实边际贡献。
论文将这里的几个量区分开来:
- 观测效用:某条记忆被检索时,任务最终回报的平均值;
- 边际效用:在其他条件保持一致时,加入这条记忆与不加入它之间的回报差;
- 归因偏差:由检索选择、共同出现的其他记忆、上下文交互和任务混杂因素造成的偏差;
- 任务基线:即使没有这条记忆,任务本身也可能取得的回报。
轨迹级 Q 值从共同任务结果中学习到的是观测效用,而不是单条记忆的边际效用。增加检索次数可以降低统计方差,让观测效用估计得更稳定,却不能自动消除任务基线和归因偏差。
3.3 Memory-Reward Trap:记忆—奖励陷阱
论文把一种特别有害的情况定义为 Memory-Reward Trap,简称 MRT:
一条记忆的真实边际贡献不为正,但由于它经常与其他有效记忆共同出现,或者更容易出现在本来就能成功的任务中,它观察到的回报仍然高于不使用该记忆时的基线。
这样的记忆可能是弱相关、带噪声、已经过时或来自失败轨迹。它本身没有帮助,却因为出现在成功任务的上下文里而获得正向更新。Q 值提高后,它又更容易被后续任务检索,形成持续的错误强化。

【Figure 1(更强探索提高记忆覆盖率,同时使更多弱相关或错误记忆暴露于错误奖励)】
一个直觉上的解决方案是增加探索,例如使用 UCB,让访问次数较少的记忆获得更多检索机会。但论文指出,这只解决了问题的一半:
- 更强探索确实覆盖了更多冷门记忆;
- 同时也把更多低质量记忆带入成功任务;
- 这些记忆可能因为共享奖励而被错误提升;
- 最终可能出现覆盖率提高、任务性能反而下降的现象。
因此,核心矛盾不是简单的“探索不足”,而是怎样提高反馈覆盖,又不扩大受到错误奖励传播影响的效用空间。
4. RoMeRL 的核心思路:不再为每条轨迹永久维护一个效用状态
RoMeRL 的完整名称是 Reduced-Order Memory Reinforcement Learning,即低阶记忆强化学习。它没有尝试在不断膨胀的记忆池中进行更激进的探索,而是直接改变强化学习所作用的记忆状态。
传统方法把状态表示为一个随历史增长的 Q 值向量:每增加一条轨迹,就增加一个需要长期学习的效用变量。RoMeRL 则把一个任务的可变长度历史压缩为固定的 2 x 2 状态。
两个划分维度分别是:
- 结果极性:正向,也就是成功证据;负向,也就是失败证据。
- 记忆动态:巩固型,用于保存全局选择出的稳定证据;适应型,用于追踪当前状态或重要的状态转变。
两种结果极性与两种记忆动态组合,形成四个语义固定的坐标。坐标中的具体内容可以更新、晋升或替换,但坐标身份和需要维护的效用数量不会增长。
| 坐标 | 英文名称 | 保存内容 | 选择或更新依据 | 主要作用 |
|---|---|---|---|---|
| PCC | Positive Consolidated Coordinate | 正向巩固记忆 | 所有成功轨迹中效率最高的一条 | 保存全局稳定的成功参考 |
| PAC | Positive Adaptive Coordinate | 正向适应记忆 | 首次失败之后最早出现的成功轨迹 | 保存从失败跨越到成功的恢复模式 |
| NCC | Negative Consolidated Coordinate | 负向巩固记忆 | Q 值超过负向初始阈值的失败轨迹中效用最高的一条 | 保存被后续结果证明可能有用的失败经验 |
| NAC | Negative Adaptive Coordinate | 负向适应记忆 | 最近一次失败轨迹 | 追踪智能体当前最需要纠正的错误状态 |
需要注意,“每个任务固定四个坐标”并不等于整个系统永远只保存四条记忆。论文按任务维护状态,因此系统总记忆量仍会随任务数量增长;被控制住的是每个任务的活跃效用维度,它最多为 4,不再随该任务的交互历史无限增加。

【Figure 2(RoMeRL 总体架构及 PCC、PAC、NCC、NAC 四个语义坐标)】
5. 四个语义坐标怎样工作?
5.1 PCC:保存最有效率的成功轨迹
PCC 从该任务所有成功轨迹中选择效率指标最优的一条。论文在方法定义中用 ell_i 表示轨迹效率,因此 PCC 保存的是全局成功经验中效率最好的代表,而不是最近一次成功轨迹。
当出现更高效的新成功轨迹时,新轨迹替换旧内容,但继承当前 PCC 的效用值作为热启动。这样做把“这个坐标长期积累的价值判断”与“坐标当前承载的具体轨迹”分开:代表内容可以更新,效用学习不必每次从初始值重新开始。
5.2 PAC:保存失败后首次成功的转变
PAC 选择第一次失败之后最早出现的成功轨迹。它关心的不是全局最短路径,而是智能体怎样第一次跨过失败到成功的边界。
因此,PCC 与 PAC 保存的是两类不同的正向信息:PCC 强调稳定、整体最优的成功解法;PAC 强调从错误状态恢复到可行解的转变过程。
5.3 NCC:从失败中保留可复用信息
失败轨迹不一定毫无价值。有些失败记录了关键诊断、纠错步骤或可迁移的操作信息,只是整条任务轨迹最终没有成功。
RoMeRL 不会把所有失败永久保存为活跃效用变量。失败首先进入 NAC;如果该轨迹在后续被使用时积累了足够高的效用,其 Q 值超过负向初始化阈值,同时高于当前 NCC 的效用,它才会被晋升到 NCC。
因此,NCC 是经过后续任务结果筛选的负向巩固记忆。它使系统能够利用有信息量的失败经验,而不必无限保留全部失败轨迹。
5.4 NAC:持续跟踪最近失败
NAC 始终保存最近一次失败轨迹。每当出现新失败时,旧内容就被替换。
这一坐标让记忆状态对近期错误保持敏感,同时限制错误轨迹的长期占用:每次新失败都只更新同一个语义坐标,而不是新增一个永久的效用变量。
6. 检索、替换与效用更新的完整流程
RoMeRL 在运行时的主要信息流如下:
- 新任务到来后,系统先确定对应的任务状态;
- 当前非空的 PCC、PAC、NCC、NAC 构成活跃候选集合,最多有四个候选;
- 系统计算任务描述与每条候选记忆之间的向量余弦相似度;
- 检索分数由语义相似度与该坐标的 Q 值加权组成;
- 得分最高的若干记忆被放入大语言模型上下文;
- 大模型参考这些记忆完成任务,底层模型参数保持冻结;
- 系统用最终任务奖励更新本次被检索坐标的 Q 值;
- 新轨迹再按照成功或失败、效率和时间顺序更新相应坐标。
检索分数可以用下面的普通文本形式表示:
score(memory) = (1 - omega_Q) * semantic_similarity + omega_Q * Q
其中,omega_Q 控制历史效用在检索中的权重。实验将其设为 0.5,即语义相关性与学习得到的效用各占一半。
对于被检索的坐标,运行时 Q 值仍采用标准的指数移动更新:
new_Q = old_Q + alpha * (reward - old_Q)
论文实验中的学习率 alpha 为 0.3。当一个新代表替换旧内容时,它继承该坐标当前的 Q 值;此后的任务反馈会逐渐使继承值适应新代表。论文强调,这种继承是热启动,不表示新旧记忆具有完全相同的真实效用。
7. 为什么固定维度能够改善反馈利用?
论文从反馈密度和错误坐标占用两个方面进行分析。
7.1 固定反馈预算集中到更少的效用变量
在 T 次交互、每次最多更新 k 条记忆的条件下,如果系统维护 d 个活跃坐标,并且反馈分配大致均衡,那么每个坐标平均可以获得约 k * T / d 次更新。
传统轨迹级方法的维度是不断增长的 N_t,RoMeRL 的每任务维度固定为 4。在相同反馈预算下,RoMeRL 每个坐标的平均更新次数约为传统方法的 N_t / 4 倍。状态压缩并没有创造额外奖励,而是把有限反馈集中到较少且语义稳定的效用变量上。
这项结论依赖“反馈分配大致均衡”的假设。如果实际访问极度不平衡,平均反馈密度依然会提高,但不能仅凭平均值保证每个坐标的估计方差都按理论界限下降。
7.2 限制错误奖励能够长期占据的活跃空间
在轨迹级记忆池中,只要每条轨迹都有一定概率落入 MRT,可能受到错误奖励影响的效用变量数量就会随 N_t 增长。
在固定维度状态中,错误内容最多只能占据有限数量的活跃坐标,而且替换机制提供了纠正机会。论文用一个通用的“干净—错误”状态转移模型描述这一过程:错误进入概率越低、错误被干净内容替换的概率越高,稳态下错误坐标的占用比例就越低。
这项分析说明了固定维度和替换机制为什么能够限制污染的持续存在,但它并没有直接给出实际系统中的因果污染率。论文也指出,要估计这些转移量,需要带有坐标级因果标签的配对反事实运行,或者等价的归因信息。
8. 实验设置
论文在两个基准上进行评估,底层大语言模型始终保持冻结。
| 基准 | 任务范围 | 使用的主干模型 | 主要能力 |
|---|---|---|---|
| LifelongAgentBench OS | 500 个操作系统任务 | DS-V4-flash | Bash 命令、文件与权限、文本处理、压缩、进程和系统监控 |
| LifelongAgentBench DB | 500 个数据库任务 | DS-V4-flash | SQL 查询、过滤、分组、聚合、连接、集合操作和数据修改 |
| ALFWorld | 文本化具身家庭环境,共六类任务 | GPT-5.4-mini | 找物体、导航、清洁、加热、冷却、检查和放置 |
向量编码使用 Text-Embedding-3-Large,生成温度设为 0。实验比较的方法包括:无记忆、Pass@10、RAG、Mem0、MemP、MemRL 以及 RoMeRL。相同基准内,各方法使用相同主干模型和交互预算。
主要指标包括:
- SR(Success Rate):成功率;
- CSR(Cumulative Success Rate):跨多个轮次至少成功一次的任务比例;
- Cold-Q ratio:进入当前状态后仍未获得直接 Q 更新的记忆比例;
- Feedback density:当前记忆进入状态后平均获得的更新次数;
- 平均记忆数量、LLM 调用量,以及受控噪声实验中的正向噪声更新次数和最终噪声比例。
9. 主要实验结果
9.1 LifelongAgentBench
表中的 OS 和 DB 均写为“最后一轮 SR / CSR”。
| 方法 | OS | DB |
|---|---|---|
| RAG | 0.700 / 0.752 | 0.556 / 0.844 |
| Mem0 | 0.691 / 0.733 | 0.575 / 0.841 |
| MemP | 0.768 / 0.796 | 0.631 / 0.942 |
| MemRL | 0.808 / 0.820 | 0.632 / 0.934 |
| RoMeRL | 0.824 / 0.838 | 0.680 / 0.952 |
9.2 ALFWorld 六类任务
| 方法 | 拾取放置 | 灯下检查 | 清洁放置 | 加热放置 | 冷却放置 | 拾取两个物体 |
|---|---|---|---|---|---|---|
| No Memory | 0.883 | 0.827 | 0.861 | 0.850 | 0.855 | 0.788 |
| RAG | 0.891 | 0.834 | 0.868 | 0.855 | 0.858 | 0.796 |
| Mem0 | 0.897 | 0.841 | 0.873 | 0.858 | 0.872 | 0.805 |
| MemRL | 0.908 | 0.855 | 0.887 | 0.865 | 0.871 | 0.812 |
| RoMeRL | 0.968 | 0.957 | 0.901 | 0.862 | 0.880 | 0.826 |
在两个 LAB 任务的最后一轮 SR 与六类 ALFWorld 任务上做宏平均后,RoMeRL 的总体成功率为 0.862,强于最佳基线 MemRL 的 0.830,提高 3.2 个百分点。需要保留这个绝对尺度:改进是稳定的,但不是所有单项都更高,例如 ALFWorld 的加热放置任务中,RoMeRL 为 0.862,略低于 MemRL 的 0.865。
9.3 反馈覆盖与运行效率
与 MemRL 相比,RoMeRL 的关键变化如下:
| 指标 | MemRL | RoMeRL | 变化 |
|---|---|---|---|
| 最终 Cold-Q ratio | 44.9% | 9.0% | 下降约 80.0% |
| 反馈密度 | 4.96 | 29.93 | 约 6.0 倍 |
| 平均记忆数量 | 45K | 7K | 减少 84.4% |
| 平均 LLM 调用量 | 570K | 450K | 减少 21.1% |

【Figure 3(OS 任务上的 Feedback density 与 Cold-Q ratio 变化曲线)】
MemRL 的 Cold-Q ratio 从约 29% 上升到 44.9%,说明随着记忆池增长,越来越多记忆得不到直接反馈。RoMeRL 则把这一比例从约 28% 降到 9.0%,同时提高单个活跃代表获得反馈的次数。
论文进一步解释,LLM 调用减少不只是因为保存的记忆更少。角色明确的活跃记忆降低了检索冗余、陈旧或弱相关经验的概率,使提示中的经验更集中;系统也避免为无法进入相应坐标的无效轨迹反复生成程序性记忆,并可能用更少交互步骤完成任务。
10. 受控 MRT 压力测试
为了直接观察奖励污染,作者将第一轮记忆池中 10% 的条目替换为噪声版本。这些噪声条目保留原始标题,但把关键动作或反思字段置空,因此它们仍然具有可检索的语义线索,却缺少实际可执行内容。
噪声只在第一轮注入,之后各方法在相同预算下运行十轮。结果如下:
| 方法 | 第十轮成功率 | 噪声条目获得正向更新的平均次数 | 最终噪声比例 |
|---|---|---|---|
| MemRL | 79.2% | 3.7 | 1.02% |
| MemRL + UCB | 78.4% | 7.2 | 1.20% |
| RoMeRL | 82.0% | 2.4 | 0.15% |
UCB 提高了对低访问记忆的探索,但噪声条目获得的正向更新从 3.7 次增加到 7.2 次,最终噪声比例也由 1.02% 上升到 1.20%,而成功率略有下降。这与论文提出的探索—污染矛盾一致。
RoMeRL 中,大部分噪声内容在前三轮就被质量更高的记忆替换。它没有从根本上识别每条噪声的因果贡献,但固定坐标和替换机制降低了噪声长期保留并继续传播的机会。
11. 跨模型记忆迁移
作者还把训练过程中形成的记忆状态冻结,再迁移给不同的推理模型。结果写为“验证分数 / 平均执行步数”。
| 任务 | 推理模型 | 无迁移记忆 | 使用迁移记忆 | 变化 |
|---|---|---|---|---|
| OS | GPT-5.4-mini | 67.0 / 3.23 | 81.6 / 2.22 | +14.6 / -1.01 |
| OS | Gemini-3.5-flash | 74.0 / 4.53 | 81.4 / 3.02 | +7.4 / -1.51 |
| DB | GPT-5.4-mini | 93.0 / 2.15 | 96.8 / 2.00 | +3.8 / -0.15 |
| DB | Gemini-3.5-flash | 96.2 / 2.44 | 97.6 / 2.18 | +1.4 / -0.26 |
四种组合中,冻结记忆状态都提高了验证分数并减少了平均执行步数。这说明四坐标状态中保存的程序性信息并不完全依赖于生成这些记忆时使用的主干模型,可以被其他模型复用。
12. 消融实验:四个坐标是否都有作用?
论文在保留 PCC 和 NAC 作为基本正负锚点的前提下,分别移除 NCC 与 PAC。
12.1 移除 NCC
移除 NCC 后,最后一轮成功率和累计成功率都下降。完整模型中,NCC 占 OS 已使用坐标的 27.14%,在 DB 中占 42.78%。这说明经过后续效用筛选的失败经验不仅影响当前表现,也有助于扩大跨轮次解决过的任务覆盖范围。
12.2 移除 PAC
移除 PAC 主要降低最后一轮成功率,对累计成功率影响较小。PAC 的占用比例不高,在 OS 中为 8.21%,在 DB 中为 5.05%,但删除它仍会损害当前性能。论文据此认为,失败后首次成功所表示的恢复模式虽然稀疏,却能够帮助智能体重现已经发现的解法。
NCC 和 PAC 的作用是互补的:前者保存被证明可能有用的负向巩固证据,后者保存从失败转向成功的正向适应证据。


【Figure 4 与 Figure 5(坐标消融曲线及四类坐标在 OS、DB 任务中的占用分布)】
13. Q 值是否只是成功标签的复制?
论文在附录中分析最终 Q 值分布。RoMeRL 的 Q 值与记忆生成来源之间具有更强关联,点二列 Pearson 相关系数从 MemRL 的 0.493 提升到 0.673;停留在初始 Q=0.5 的记忆比例从 47.8% 降到 5.0%,说明更多活跃记忆真正接收过效用反馈。
但 Q 值并不是简单复制“成功/失败”标签。RoMeRL 最高 Q 区间中仍有约 19.9% 的记忆来自失败轨迹,而 MemRL 对应比例只有 5.3%。结合论文案例,这些高效用失败记忆可能包含可复用的纠正、诊断信息或程序性经验。
因此,RoMeRL 不是只回放成功案例,而是用后续任务结果对正负记忆进行分级筛选。
14. 论文的局限性
RoMeRL 缓解了反馈稀释和错误奖励长期污染,但没有彻底解决信用分配问题。
首先,系统仍然使用任务级结果更新共同检索的记忆。固定维度可以限制被污染的活跃支持集,也能通过替换减少错误内容的持续时间,但它不能精确回答某条记忆对最终成功究竟贡献了多少。
其次,论文关于错误坐标稳态占用的分析依赖通用状态转移模型。要在真实系统中估计干净坐标变成错误坐标的概率,以及错误坐标被纠正的概率,需要坐标级因果标签、成对的反事实运行或等价的归因方法,而当前系统并没有直接提供这些信息。
最后,实验集中在 ALFWorld 以及 LifelongAgentBench 的 OS、DB 子集。作者把开放式、长期时域环境中的验证留给未来工作。
论文提出的后续方向包括:将更精细的信用归因与细粒度奖励结合,并在更加开放、交互链条更长的任务中评估低阶记忆状态。
15. 总结
RoMeRL 关注的是自我进化智能体中的外部记忆学习。传统轨迹级方法为每条历史经验维护独立 Q 值,导致效用空间随历史不断增长,有限反馈被不断摊薄;与此同时,多条共同检索的记忆共享任务级奖励,使无关、过时或错误经验可能在成功任务中被错误强化。
论文没有依靠更强探索覆盖越来越大的记忆池,而是把每个任务的活跃效用状态压缩为 PCC、PAC、NCC、NAC 四个语义坐标。新经验更新、晋升或替换坐标内容,而不是永久增加新的效用变量。这样既提高了单位坐标的反馈密度,也限制了错误奖励能够长期影响的活跃空间。
实验显示,RoMeRL 在冻结底层大模型的条件下,将总体平均成功率从最佳基线的 0.830 提升到 0.862,同时降低 Cold-Q ratio、记忆规模和 LLM 调用量。受控噪声实验与坐标消融进一步支持了固定维度、角色化记忆和替换机制的作用。
这篇论文因此可以被概括为:一项位于“强化学习与 LLM Agent 长期记忆”交叉方向的工作。它不是训练大模型策略,而是利用任务奖励学习一个紧凑、可替换的外部记忆状态,让智能体在持续交互中更有效地复用经验。
参考
- Yi Yang et al. RoMeRL: Balancing Feedback Coverage and the Memory-Reward Trap in Self-Evolving Agent Memory via Reduced-Order Utility States. arXiv:2608.02508, 2026. 论文原文
- RoMeRL 官方代码仓库:https://github.com/YOUNG-fnxm/RoMeRL

浙公网安备 33010602011771号