论文速读记录 | 2026.09
- When Context Returns: Toward Robust Internalization in On-Policy Distillation
- Error Bounds of Imitating Policies and Environments
- Error Bounds of Imitating Policies and Environments for Reinforcement Learning
- Provably and Practically Efficient Adversarial Imitation Learning with General Function Approximation
- Adversarial Imitation Learning with General Function Approximation: Theoretical Analysis and Practical Algorithms
When Context Returns: Toward Robust Internalization in On-Policy Distillation
- 来源:同学的最新力作。
- arxiv:https://arxiv.org/abs/2606.11627
- pdf:https://arxiv.org/pdf/2606.11627
- html:https://arxiv.org/html/2606.11627v2
- 参考博客:CSDN | NCA:解决 OPD 中重新加入 context 后,模型性能反而下降的问题
我去,感觉是一个非常好的故事。
ai 速读:在策略蒸馏(On-Policy Distillation, OPD),把“特权上下文(privileged context)”内化(internalize)到学生模型后,为什么重新把特权上下文放回去,反而会让模型变差,以及如何解决这个问题。
🦜「特权上下文(privileged context)」,在这篇论文里指的是:训练时教师模型可以额外看到、但部署时学生模型希望不再依赖的信息,通常是系统提示、任务提示、专家推理过程、游戏状态说明、解题策略等。学生通过 OPD(on-policy distillation)把“有特权上下文时的行为”内化到参数里,从而在推理时不需要再提供这些上下文。
可以把它理解为:
- 教师:输入 \(x\) + 特权上下文 \(c\),表现更好;
- 学生:只输入 \(x\),要学会像教师看到 \(c\) 时那样表现;
- 部署:理想情况下不再传入 \(c\),但学生已经“记住”了 \(c\) 的作用。
一个具体例子:Sokoban 文本游戏。论文中 Text Games 任务使用 Sokoban。特权上下文是给教师的一段“游戏经验”提示,例如:
在 Sokoban 中,
P是玩家,X是箱子,O是箱子目标,#是墙。
任务是把X推到O上,玩家自己到达O不算成功。
玩家可以推箱子,但不能拉箱子。
推箱子前要检查箱子目的地,避免把箱子推进角落或墙边。
一个有效动作序列可能是:s, s, a, s, d。
这段提升就是特权上下文:
- 教师模型在生成动作时可以看到它,因此更容易做出正确决策;
- 学生模型训练时只看到棋盘状态,目标是不需要这个提示也能玩好;
- 训练成功后,理想情况下部署时不再传入这段经验,学生也能表现良好。
概括论文核心内容:
- 背景
- 语言模型常用“特权上下文”提升表现,例如系统提示、任务提示、思维链、游戏状态说明等。
- 在策略蒸馏的目标是:让教师模型在有上下文时表现好,并把这些能力“内化”到学生模型,使学生推理时不需要上下文也能表现好。
- (感觉确实是工业界关心的方向)
- 关键发现:Context-Induced Degradation
- 论文发现一个反直觉现象:学生已经学会无上下文完成任务后,如果再把原来的特权上下文重新给它,性能反而下降,甚至会把原本正确的预测改错。
- 作者称之为 context-induced degradation,即“上下文引发的性能退化”。
- 原因在于,标准 OPD 只优化“无上下文学生”去匹配“有上下文教师”,即只追求 privileged fidelity,但没有约束学生“有上下文时的行为”。
- 提出目标:Context Invariance
- 论文认为,真正鲁棒的内化,不仅要让学生无上下文时像教师,还要让它在“有上下文”和“无上下文”两种情况下输出保持一致。
- 这种性质被论文称为 context invariance,即上下文已经被内化后,再加回去应该是冗余的,不应改变行为。
- 方法:No-Context Anchoring, NCA
- 论文先形式化了 view-robust internalization risk,同时评估学生的无上下文视图和有上下文视图。有 / 无上下文视图的意思就是,我们是否给 student 模型上下文 c。
- 理论上,精确最小化该风险可推出 context invariance;但实际近似优化下,也就是我们优化这个 objective 趋于 0,但没有真的精确等于 0 时,像 DualOPD 这样的 objective 并不总能保证两视图一致。
- 这篇论文的解释似乎是, teacher 模型可能是多模态的,比如说,它可能是一个双峰分布;如果我们让 student 模型在有无 context C 的时候,都与 teacher 模型相对齐,可能有 context 的 student 模型对齐到了一个峰,而没有 context 的 student 模型对齐到了另一个峰(虽然它们可能都与 Teacher 模型对齐,前面的 objective 已经被优化的很小、趋于 0 了)。这会导致有无 context 的切换会直接改变 student 模型的行为,与我们的 context invariance 的动机相违背。
- 因此提出 NCA:保留标准 OPD,同时加一个轻量一致性正则:\[\mathrm{KL}(\mathrm{sg}[g_\theta(\cdot|x)] \| g_\theta(\cdot|x,c)) \]即用学生“无上下文输出”的 stop-gradient 版本作为锚,让“有上下文输出”通过前向 KL 去对齐它。
- 这样只增加一次前向计算,能直接促进有 / 无上下文视图一致,且不破坏原 OPD 目标。
- 还有一些理论,具体可参见:CSDN | NCA:解决 OPD 中重新加入 context 后,模型性能反而下降的问题
- 实验结果
- 在 14 个配置、三个领域上评估:系统提示问答、文本游戏、数学推理;涉及 Llama、Qwen 等多个模型。
- NCA 在多数设置中提升有上下文准确率,并在 14 个设置中的 12 个减少 context harm,平均降低 7.2 个百分点的 harm,提升 5.3 个百分点的 both-view success。
- 同时保持或提升无上下文性能。
- 机制分析显示,NCA 显著提高无上下文与有上下文输入在隐藏状态层面的相似性,并重定向参数更新方向,而不是简单增加更新复杂度。
- 结论与意义
- 论文指出:评估特权上下文蒸馏,不能只看学生无上下文时表现如何,还要看“上下文重新出现时是否稳定”。
- 主要局限包括:实验大多单训练种子、机制分析限于一个模型-任务配置、在上下文仍然很有帮助的 Regime B 中固定锚可能次优。
总结:这篇论文发现并命名了 OPD 中的“上下文重新引入导致性能退化”现象,提出用 NCA 正则让学生在有/无特权上下文时保持一致,从而提升内部化的鲁棒性。
Error Bounds of Imitating Policies and Environments
- arxiv:https://arxiv.org/abs/2010.11876
- html:https://arxiv.org/html/2010.11876v1
- 来源:[mask] ,NeurIPS 2020。
Error Bounds of Imitating Policies and Environments for Reinforcement Learning
- ieee xplore:https://ieeexplore.ieee.org/document/9485061
- 来源:[mask] ,上一篇的期刊版本。
1 ai 速读
强化学习里,让智能体自己试错很慢。模仿学习就是:给专家操作记录,让智能体照着学。两种常见学法:
-
BC,行为克隆
像监督学习:看到专家在状态 \(s\) 做什么动作 \(a\),就学着输出同样动作。
问题:一步错,步步错。专家演示没覆盖的状态,智能体一旦走到那里,就可能乱做,然后越走越偏。这叫复合误差。 -
GAIL,生成对抗模仿学习
类似 GAN:一个“裁判”判断动作来自专家还是智能体,智能体努力骗过裁判。
它匹配的不是单步动作,而是整体“经常访问哪些状态-动作”。所以更能抓住全局结构,长时域下更稳。
文章的核心结论:
- BC:专家和学到的策略,价值差距随“有效规划时域” \(1/(1-\gamma)\) 的平方增长。
即 \(\frac{1}{(1-\gamma)^2}\)。长时域下很吃亏。 - GAIL:价值差距只随 \(1/(1-\gamma)\) 线性增长。
即 \(\frac{1}{1-\gamma}\)。长时域下优势明显。 - 期刊版进一步证明:
- 不能和环境交互时,任何模仿学习算法都逃不过平方下界,所以 BC 的上界几乎最优。
- 能和环境交互时,下界变成线性,说明交互很重要,GAIL 的线性优势有理论支撑。
- 把环境转移模型也当“智能体”(所谓双智能体 dual-agent 架构)来模仿:
- 用 BC 学环境,只最小化单步预测误差,策略评估误差仍会平方累积。
- 用 GAIL 学环境,匹配状态-动作-下一状态分布,策略评估误差关于模型偏差变成线性。
这对基于模型的强化学习 MBRL 很有启发:环境模型不要只用 BC 学,可以用 GAIL 风格学。
2 两版对比:会议扩期刊到底扩了什么?
| 部分 | 短版/会议版 | 长版/期刊版 |
|---|---|---|
| 策略模仿理论 | BC 上界、GAIL 上界 | 增加下界:无交互平方、有交互线性 |
| 样本复杂度 | 有 BC 的 Corollary 1 | 增加环境模仿 Corollary 2,更完整 |
| 实验 | MuJoCo 为主 | 增加表格环境验证 scaling、消融 |
| 附录 | A-E | 在线补充 A-H,证明和细节更全 |
| 摘要/引言 | 核心贡献 | 强调下界、样本复杂度、MBRL 应用 |
| 其他 | Broader Impact | Index Terms、作者简介、更规范格式 |
总结:会议版讲清楚“GAIL 比 BC 好”;期刊版进一步证明“BC 差是理论下界决定的,交互能改善;GAIL 学环境也能缓解 MBRL 的模型偏差”。
人工 diff 了一下会议版 / 期刊版,感觉只是加了一个理论,以及可能一些实验量不是特别大的实验(?)
- 感觉期刊版的 abstract 比会议版更冗长()一些衔接句比较多
- 怎么感觉 abstract 一模一样。intro 第一段也一模一样。
- 感觉 intro 的 gap 段,也就是现在学术界做了 xx,但还没有做 xx,期刊版写的更好。
- 期刊版 intro 的 method 段,第一段基本跟会议版是一样的。然后增量贡献,又新写了一段,第二个 method 段。(开始怀疑因为这个文章发的比较早,所以比较粗糙扩刊也能中。还是说扩刊都这么粗糙呢(?))
- intro 版的 method 3 段,也就是用 imitation learning 学 env transition model,感觉期刊版写的更细节一些。
- 现在感觉这个文章偏理论。
- 2 preliminaries 也写更详细了一些,但是基本感觉没变化。额外介绍了 model-based RL。
- 3 related work 感觉有一部分是扩写的,有一部分基本没变化,有一部分是新增的。
- 4.1 的理论,对 BC 的一个理论分析,期刊版和会议版基本一样。
- 4.2 的理论提到一个神经网络距离,他们说实证上来看,这个数值跟散度度量差异比较大,他们应该是用神经网络距离来证明的,感觉很有趣。不过感觉这个理论我完全看不懂。感觉 4.2 也是期刊版和会议版基本一样。
- 期刊有一个新的 4.3 节,应该是有一些新的理论。4.3.1 4.3.2 构造了一些神秘的特殊 MDP 来证明下界,(问 dpsk)只要能构造出来一个坏 MDP 证明算法会出现很坏的情况,那么它就已经是一个性能下界了,所以这样证下界好像是正确、正常的。(具体技术细节完全没有研究)
- 5 也是 method,是 model-based RL 的相关理论。会议版期刊版基本一样,期刊版新加了一个定理。跟期刊版新增的 4.3 节没关系。
- 6 exp 似乎期刊版写冗长了一点。dpsk 说期刊版加了 tabular 实验(有点神秘,是 toy 实验吗),以及看起来像一个 ablation。但总之感觉每个实验都会让故事变得更完整,并不是随机加的。我没有仔细 check。
关于理论证明全都放在附录里,这个可能值得看一下,他们是怎么处理的。 dpsk:
期刊版对理论证明的处理,可以概括成一句话:正文只留“定理 + 直观解释 + 证明思路”,完整证明全部搬到在线补充材料(Appendix)里,并在正文中明确引用。 这是期刊扩写时很常见的做法,因为期刊正文页数有限,而证明往往很长。
具体来说,他们是这样处理的:
-
1 在开头就声明“证明在附录”。期刊版第 1 页就写了:
All proofs of theoretical claims can be found in the Appendix, which can be found on the Computer Society Digital Library at http://doi.ieeecomputersociety.org/10.1109/TPAMI.2021.3096966.
意思是:所有理论证明都在附录,附录在 IEEE 在线数字图书馆。这样读者一看就知道:正文不会展开证明,想看细节去补充材料。
-
2 正文只给定理、引理、推论,不给完整证明。期刊版正文中,定理和引理都是直接陈述结果,然后给一两句解释或证明思路,不写完整推导。
-
3 正文中会有一个“证明框架”的概述。虽然完整证明在附录,但正文并不是完全不给证明线索。他们会提出一个核心分析框架,比如 error-propagation framework(误差传播框架),然后说明这个框架怎么用,详细步骤在附录。
-
4 附录里放什么?期刊版的附录在在线补充材料里,通常包含:完整的数学证明;辅助引理和它们的证明;误差传播的详细推导;下界构造的详细过程;样本复杂度的推导;环境模仿的证明;算法伪代码、实验细节等。
-
从会议版可以看到,会议版的附录 A 到 E 就包含了这些内容。期刊版把这些内容搬到了在线补充材料,正文只保留引用。
如果我们要学这种写法,可以这样做:
- 会议版:证明可以放在正文后面的附录,论文自包含。
- 期刊版:把详细证明移到在线补充材料,正文只留:
- 定理陈述;直观解释;
- 证明思路(用了什么框架、分解成几部分);
- 明确引用“详细证明见附录 X”。
- 保持编号对应:正文的 Theorem 1 对应附录 A.1,Lemma 2 对应附录 B.3,方便审稿人查找。
- 正文中不要重复证明:能说“由 Lemma Y 直接可得”就不要再推一遍。
- 补充材料要完整:所有正文引用的证明、辅助引理、下界构造都要在补充材料里写清楚。
Provably and Practically Efficient Adversarial Imitation Learning with General Function Approximation
- arxiv:https://arxiv.org/abs/2411.00610
- html:https://arxiv.org/html/2411.00610v1
- 来源:[mask] ,NeurIPS 2024。
Adversarial Imitation Learning with General Function Approximation: Theoretical Analysis and Practical Algorithms
- arxiv:https://arxiv.org/abs/2605.01778
- html:https://arxiv.org/html/2605.01778v1
- 来源:[mask] ,上一篇的期刊版本。
1 ai 速读
感觉这个太理论了,没有细看,感觉工作似乎做的非常好。
1. 它们研究什么问题?
模仿学习就是:不让智能体自己试错找奖励,而是给它看专家怎么做事,让它模仿专家。
模仿学习里有两类主流方法:
-
BC,行为克隆:直接监督学习,专家在什么状态做什么动作,我就照抄。问题:小错误会累积。专家走一条路,你稍微偏一点,之后状态分布就变了,越错越远。
-
AIL,对抗模仿学习:像 GAN 一样,先学一个“奖励函数”来区分专家和当前策略,然后让策略去最大化这个奖励,最终希望策略行为像专家。实践里很强,比如 GAIL、IQLearn、HyPE 等,但理论长期落后。
这篇论文要解决的核心缺口是:
以前的 AIL 理论大多只在“表格环境”或“线性函数”这种简化设定下成立;但实际算法用的是神经网络,也就是“通用函数逼近”。理论和实践脱节。
所以两篇论文都在做一件事:
在通用函数逼近下,提出一个既能证明有效率、又能真正用神经网络实现的 AIL 方法。
这个方法叫 OPT-AIL。
2. OPT-AIL 的核心思想
它把对抗模仿学习拆成两个优化问题:
-
奖励学习:
奖励函数不是固定不变的,它会随着策略变化。今天策略差,奖励要指出哪里不像专家;明天策略变了,奖励也要变。
所以作者把奖励学习看成一个“在线优化”问题:每轮只能根据过去的反馈更新,用“无遗憾算法”来学奖励。 -
策略学习:
奖励学到以后,策略学习就变成一个普通强化学习问题:在这个奖励下,怎么学一个高价值策略。
作者用“乐观正则化”来鼓励探索,意思是:对不确定但可能好的动作给一点乐观加分,让策略敢探索。
理论上的关键结论是:
在通用函数逼近下,OPT-AIL 需要多项式数量的专家轨迹和环境交互轨迹,就能学到接近专家的策略。
这是以前没有的。以前要么只做表格,要么只做线性,要么算法复杂到没法用神经网络实现。
实践上:
OPT-AIL 只需要近似优化两个目标,所以可以直接用神经网络实现。在 DMControl 连续控制任务上,它超过了 BC 和多个 SOTA 深度 AIL 方法。
3. 两篇的关系
可以这样理解:
| 对比项 | 第二篇:会议版 | 第一篇:期刊扩展版 |
|---|---|---|
| 标题 | Provably and Practically Efficient AIL with General Function Approximation | AIL with General Function Approximation: Theoretical Analysis and Practical Algorithms |
| 方法 | 只有 model-free OPT-AIL | model-free + model-based OPT-AIL |
| 理论 | 一个主定理 | 两个主定理,model-free 和 model-based 各一个 |
| 实验 | 较少 baseline,主要验证专家样本效率和交互效率 | 更多 baseline,加入 model-based 对比、消融、奖励模型质量、更多专家轨迹数量 |
| 附录 | 有证明、实现、额外实验、NeurIPS checklist | 有完整证明、实现、额外实验,期刊式结构 |
| 定位 | 会议论文 | 会议论文扩展成期刊论文 |
2 会议版和期刊版的 diff(人工 diff)
- 0 abstract 和 1 intro,感觉这个扩刊相比上一个扩刊,把各种语言都 paraphrase 了一遍。以及添加了新的 model-based 部分。
- 2 related work 感觉也差不多,可能写的更详细了,以及添加了对 model-based 的讨论。把会议版的 paragraph 变成了期刊版的 subsection。
- 3 preliminaries,语言似乎直接照搬,没有 paraphrase。理论似乎写的更详细了。
- 4 method 具体是怎么重构的呢?
- 会议版的 4 method 变成了期刊版的 4 method + 5 practical implementation。
- dpsk 说是这样的,我没有细看:
| 会议版(第二篇) | 期刊版(第一篇) | 变化本质 |
|---|---|---|
| 4 Optimization-based AIL | 4 Optimization-based AIL | 大标题不变 |
| 4.1 Theoretical Analysis of OPT-AIL | 4.1 Algorithm Description | 会议版“理论分析”里其实混着算法描述,期刊版把算法描述单独提出来 |
| 4.2 Theoretical Analysis | 会议版理论保证在 4.1 末尾,期刊版独立成 4.2 | |
| 4.2 Practical Implementation of OPT-AIL | 5 Practical Implementation of OPT-AIL | 会议版实践实现放在第 4 节,期刊版独立成第 5 节 |
| 只有 model-free OPT-AIL | model-free + model-based OPT-AIL | 期刊版多了一条完整方法线 |
| Algorithm 1:MF 理论 | Algorithm 1:MF 理论;Algorithm 2:MB 理论 | 理论算法从 1 个变 2 个 |
| Algorithm 2:MF 实践 | Algorithm 3:MF 实践;Algorithm 4:MB 实践 | 实践算法从 1 个变 2 个 |
- 5 exp,5.1 setting 基本是 paraphrase。后面实验似乎添加了 model-based 的 baseline,但是移除了一些 model-free 的。似乎还有新的 ablation 添加。

浙公网安备 33010602011771号