"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning" 论文笔记
清华、浙大与美团 LongCat 团队合作的 AgentOPSD,目前挂在 Arxiv 26.08 上,做的是长程多轮 Agentic RL 里的回合级信用分配。可验证奖励的 RL 只在整条轨迹结束时给一个稀疏的 0/1 信号,GRPO 这类方法把轨迹级优势均匀广播到每个 token,无法把成败真正归因到那几个关键决策,交互步数越长,这个问题越严重
这篇工作的核心主张是:一个回合的信用不该由它自身孤立的局部信号决定,而应看这个信号把"最终成功"的估计概率改变了多少。作者把每回合的自蒸馏差距解释成一次贝叶斯信念更新的新证据,在对数几率空间里递归维护一个"轨迹成功信念",再把这个信念的边际修正量当作回合级信用,重塑 GRPO 的优势。整个过程不需要额外 rollout,也不需要学习一个 critic,只多一次 teacher 前向
背景
多轮 Agent 与静态单轮推理不同,它要持续和部分可观测的环境交互,每一步根据当前观测行动、环境再转移到新观测。同一条轨迹里的决策作用差异很大:成功轨迹里也可能有冗余、误导性的动作,失败轨迹里也可能藏着有用的推理。GRPO 及其 Agent 变体从结果奖励构造轨迹级优势,然后均匀地广播到整条轨迹的每个 token,这种统一信用无法把少数关键决策和常规操作区分开,而且交互 horizon 越长问题越突出,所以回合级信用分配对识别真正影响结果的决策很关键
另一条互补路线提供更稠密的 token 级监督。On-policy distillation 让学生在自己的 rollout 上向 teacher 学习,自蒸馏变体(OPSD)则通过让同一个策略额外条件在"仅训练时可见的特权信息"上,省掉了单独的 teacher。但把 OPSD 直接用到 Agentic RL 上有两个错配:
-
OPSD 的 token 级信号和 Agent 交互天然不对齐,多个 token 共同构成一个动作,环境只在回合边界响应
-
现有的 step-aware 方法即便按步来看,也是孤立地给每一步打分,没有考虑此前交互累积下来的证据
由此中心难题是把孤立的局部 OPSD 信号转化为依赖历史的回合级信用
方法

问题设定与 GRPO 基线
给定任务 \(x\) 和初始观测 \(o_0\),Agent 从 \(s_1=(x,o_0)\) 出发。第 \(k\) 回合按当前策略采样动作 \(a_k=(y_{k,1},\dots,y_{k,L_k})\sim\pi_\theta(\cdot\mid s_k)\),\(s_k\) 是可见的交互历史、\(L_k\) 是动作长度,观测到 \(o_k\) 后历史变为 \(s_{k+1}=(s_k,a_k,o_k)\),一条 \(K\) 回合的轨迹 \(\tau\) 结束后拿到二元奖励 \(R(\tau)\)。GRPO 对每个任务采样 \(G\) 条轨迹,用组内奖励的均值与标准差算出序列级优势,并把它赋给该轨迹里每一个 token,回合级信用始终没解决
从结果贡献到贝叶斯回合证据
直接度量第 \(k\) 回合的反事实贡献,需要对 \(a_k\) 之后所有可能的后续做边际化,长程交互下不可行。作者改用事后(hindsight)的证据视角:记 \(C\) 为"轨迹最终成功"这一事件,若 \(a_k\) 有助于成功,它就应该更像成功行为、而不像失败行为,贝叶斯规则把信念的变化写成动作侧的似然比:
右边是理想的 Bayes factor,符号表示这个动作增加还是减少对最终成功的支持。由于结果条件分布拿不到,作者用一个可计算的每回合自蒸馏对比来事后估计它:让同一个策略分别在"特权成功相关的 self-teacher"和"标准学生"两种上下文下,对同一个学生生成的动作打分。两者的 token 上下文为 \(h_{k,t}=(s_k,y_{k,<t})\) 与 \(h^+_{k,t}=(s_k,c^+,y_{k,<t})\),其中 \(c^+\) 是仅训练时检索到的、描述有用子目标与动作模式的 skill
对每个 token 定义 detached 的似然比 \(\delta_{k,t} = \log \pi_\theta(y_{k,t}\mid h^+_{k,t}) - \log \pi_\theta(y_{k,t}\mid h_{k,t})\),\(\delta_{k,t}>0\) 说明 \(c^+\) 提高了该 token 的似然。对回合内 \(L_k\) 个 token 求和,得到回合级证据:
附录证明了在两个假设下 \(e_k\) 是理想 Bayes factor 的可计算近似,且始终保持符号一致(\(\text{sign}(e_k)=\text{sign}(\mathcal{B}_k)\)),AgentOPSD 只用到它的符号与排序,因此把 \(e_k\) 当作一个 tractable 的贝叶斯启发式证据代理
递归信念更新
上一步得到的 \(e_k\) 只是一个孤立分数,看不出这条证据在前面回合的基础上到底关不关键。作者的办法是维护一个"这条轨迹最终会成功"的信念 \(B_k\),每个回合就看它把这个信念推动了多少
信念的起点 \(B_0\) 取组内成功率 \(\bar{R}=S/G\),也就是这一批采样轨迹里成功的比例;之后每个回合把自己的证据 \(e_k\) 累加进来,越早的回合按衰减因子 \(\gamma\) 逐渐淡出:
\(c_k\) 是带衰减的证据累加值,外面套一个 sigmoid 把它压回 0 到 1 之间的信念,\(\gamma\) 越小,久远回合的影响消退得越快。一个回合有多重要,就看它让信念动了多少:
前面的系数 \(B_{k-1}(1-B_{k-1})\) 说明:信念还半信半疑(接近 0.5)时,一条证据能撬动的幅度最大;等信念已经笃定成功或失败,再多的证据也几乎改不动。更新在回合边界进行,逐 token 的版本只用于消融对比
结果对齐信用与有界优势重塑
有了每个回合的信念变化 \(\Delta B_k\),还要给它定个方向。方向由这条轨迹最终是成功还是失败决定(即验证器给的结果),大小则用信念被推动的幅度:\(q_k = \text{sign}(A_{\text{seq}})\,\Delta B_k\)。这样一来,成功轨迹里把信念往上推的回合、失败轨迹里把信念往下压的回合,都会拿到正的信用
不过 \(q_k\) 只用来调节 GRPO 优势的大小。对每条轨迹,先把它各回合的 \(q_k\) 在轨迹内部标准化,再转成一个乘子 \(w_k\):
乘子 \(w_k\) 被夹在 \([1-b,\,1+b]\) 之间且恒为正,所以它只会把信用高的回合放大一点、信用低的回合缩小一点,绝不会把 GRPO 优势的正负号翻过来。\(b\) 决定放大缩小的幅度,\(\lambda\) 决定整体重塑的强度,\(\lambda=0\) 时 \(\widetilde{A}_k\) 就等于原始的 \(A_{\text{seq}}\),完全退回 GRPO。每个 token 继承它所在回合的 \(\widetilde{A}\),代入裁剪的 GRPO 目标:
整套方法不额外加蒸馏损失,self-teacher 只提供不回传梯度的信号,唯一通过重塑后的 \(\widetilde{A}\) 起作用。相比 GRPO,代价仅是每条轨迹多一次 teacher 前向,信念重塑都是逐元素的简单运算,不加 rollout、不加可学习参数
实验
在三个多轮交互环境上评测:ALFWorld(文本具身,六类家务任务)、Search-QA(Search-R1 设定,NQ、TriviaQA、HotpotQA 等七个数据集)、WebShop(在线购物,128 个固定验证任务)。骨干用 Qwen2.5-3B/7B-Instruct,8×H800 训练,特权 skill 只在训练时按关键词检索注入,推理时不用任何外部 skill。对比方法覆盖训练无关(Vanilla、Skill-Prompt)、组相对 RL(GRPO、Skill-GRPO)、自蒸馏 RL(OPSD、GRPO+OPSD、Skill-SD、RLSD、SDAR、StepOPSD)三组,所有方法共享同一骨干、数据与预算
主要结果

Qwen2.5-7B 上 AgentOPSD 在 ALFWorld 达到 89.1% 平均成功率,Search-QA 49.2%、WebShop 90.2/79.7。关键论点是"收益来自信用构造而非特权访问":AgentOPSD 与特权基线用同一批检索 skill,差别只在于 teacher-student 差距如何进入学习,而它在八个跨规模聚合对比里全面超过 GRPO+OPSD、Skill-SD、RLSD,在八个里六个超过 SDAR,且推理阶段完全不用 skill。这说明孤立的局部 teacher-student 差距还不是可靠的信用信号,把差距累进信念状态、再按信念修正来赋信用,才能更好地找出真正改变结果的回合
随交互步数增长的鲁棒性

AgentOPSD 面向的正是"均匀信用最有害"的长程场景。作者用每子任务成功率对成功轨迹平均回合数做回归,看每多一个回合掉多少成功点:均匀信用的方法掉得最快(RLSD 每回合 \(-3.59\)、GRPO \(-2.91\)),而 AgentOPSD 最平,只有 \(-0.54\)。轨迹越长,单一广播优势要覆盖的决策越多,依赖历史的信念修正就越有用
超参数敏感性
单独扫每个旋钮、其余固定在 \(\lambda=0.5,\gamma=0.95,\epsilon_{\text{high}}=0.24\)。重塑权重 \(\lambda\) 效果最清晰,\(\lambda=0.5\) 最好、更小的值都变差;证据衰减 \(\gamma\) 在 \(\{1.0,0.95,0.9,0.8\}\) 内波动只有几个点、无单调趋势,说明对旧证据折扣多快不敏感,主结果统一用温和的 \(\gamma=0.95\);策略裁剪 \(\epsilon_{\text{high}}\) 几乎无影响,重塑后的目标继承了 GRPO 的信赖域鲁棒性
总结
AgentOPSD 的核心贡献是把回合级信用形式化为"每个回合对成功信念的修正量":在对数几率空间里,把每回合的自蒸馏差距接到一个递归贝叶斯更新上,从而说明孤立的自蒸馏差距本身并不是顺序信用。它把 token 级 teacher-student 差距在回合边界聚合成对齐环境的证据,再让证据在轨迹成功信念里递归传播,不需额外 rollout 或学习 critic
个人看来,这套方法最巧的一点是"符号来自验证器、幅度来自信念修正"的分工,配合恒正的有界乘子既能重分配信用又不翻转 GRPO 方向,工程上只多一次 teacher 前向、几乎零额外成本,落地代价很低。消融里"去掉 \(B_0\) 锚定掉到 78.9"和"只留幅度掉到 80.5"说明性能相当依赖先验锚定与结果符号这两个较"外部"的信号,递归本身带来的净增益(82.8→89.1 里含粒度等多项)值得进一步拆分确认;此外证据 \(e_k\) 依赖训练时可检索的特权 skill \(c^+\),在没有高质量 skill 库的任务上能否复现同样收益,还需要更多验证
PDF 链接:https://arxiv.org/abs/2608.05987
Github 链接:https://github.com/ZethWang/AgentOPSD

浙公网安备 33010602011771号