论文速读记录 | 2026.09




When Context Returns: Toward Robust Internalization in On-Policy Distillation

我去,感觉是一个非常好的故事。

ai 速读:在策略蒸馏(On-Policy Distillation, OPD),把“特权上下文(privileged context)”内化(internalize)到学生模型后,为什么重新把特权上下文放回去,反而会让模型变差,以及如何解决这个问题。

🦜「特权上下文(privileged context)」,在这篇论文里指的是:训练时教师模型可以额外看到、但部署时学生模型希望不再依赖的信息,通常是系统提示、任务提示、专家推理过程、游戏状态说明、解题策略等。学生通过 OPD(on-policy distillation)把“有特权上下文时的行为”内化到参数里,从而在推理时不需要再提供这些上下文。

可以把它理解为:

  • 教师:输入 \(x\) + 特权上下文 \(c\),表现更好;
  • 学生:只输入 \(x\),要学会像教师看到 \(c\) 时那样表现;
  • 部署:理想情况下不再传入 \(c\),但学生已经“记住”了 \(c\) 的作用。

一个具体例子:Sokoban 文本游戏。论文中 Text Games 任务使用 Sokoban。特权上下文是给教师的一段“游戏经验”提示,例如:

在 Sokoban 中,P 是玩家,X 是箱子,O 是箱子目标,# 是墙。
任务是把 X 推到 O 上,玩家自己到达 O 不算成功。
玩家可以推箱子,但不能拉箱子。
推箱子前要检查箱子目的地,避免把箱子推进角落或墙边。
一个有效动作序列可能是:s, s, a, s, d。

这段提升就是特权上下文:

  • 教师模型在生成动作时可以看到它,因此更容易做出正确决策;
  • 学生模型训练时只看到棋盘状态,目标是不需要这个提示也能玩好;
  • 训练成功后,理想情况下部署时不再传入这段经验,学生也能表现良好。

概括论文核心内容:

  1. 背景
    • 语言模型常用“特权上下文”提升表现,例如系统提示、任务提示、思维链、游戏状态说明等。
    • 在策略蒸馏的目标是:让教师模型在有上下文时表现好,并把这些能力“内化”到学生模型,使学生推理时不需要上下文也能表现好。
    • (感觉确实是工业界关心的方向)
  2. 关键发现:Context-Induced Degradation
    • 论文发现一个反直觉现象:学生已经学会无上下文完成任务后,如果再把原来的特权上下文重新给它,性能反而下降,甚至会把原本正确的预测改错。
    • 作者称之为 context-induced degradation,即“上下文引发的性能退化”。
    • 原因在于,标准 OPD 只优化“无上下文学生”去匹配“有上下文教师”,即只追求 privileged fidelity,但没有约束学生“有上下文时的行为”。
  3. 提出目标:Context Invariance
    • 论文认为,真正鲁棒的内化,不仅要让学生无上下文时像教师,还要让它在“有上下文”和“无上下文”两种情况下输出保持一致。
    • 这种性质被论文称为 context invariance,即上下文已经被内化后,再加回去应该是冗余的,不应改变行为。
  4. 方法:No-Context Anchoring, NCA
    • 论文先形式化了 view-robust internalization risk,同时评估学生的无上下文视图和有上下文视图。有 / 无上下文视图的意思就是,我们是否给 student 模型上下文 c。
    • 理论上,精确最小化该风险可推出 context invariance;但实际近似优化下,也就是我们优化这个 objective 趋于 0,但没有真的精确等于 0 时,像 DualOPD 这样的 objective 并不总能保证两视图一致。
    • 这篇论文的解释似乎是, teacher 模型可能是多模态的,比如说,它可能是一个双峰分布;如果我们让 student 模型在有无 context C 的时候,都与 teacher 模型相对齐,可能有 context 的 student 模型对齐到了一个峰,而没有 context 的 student 模型对齐到了另一个峰(虽然它们可能都与 Teacher 模型对齐,前面的 objective 已经被优化的很小、趋于 0 了)。这会导致有无 context 的切换会直接改变 student 模型的行为,与我们的 context invariance 的动机相违背。
    • 因此提出 NCA:保留标准 OPD,同时加一个轻量一致性正则:

      \[\mathrm{KL}(\mathrm{sg}[g_\theta(\cdot|x)] \| g_\theta(\cdot|x,c)) \]

      即用学生“无上下文输出”的 stop-gradient 版本作为锚,让“有上下文输出”通过前向 KL 去对齐它。
    • 这样只增加一次前向计算,能直接促进有 / 无上下文视图一致,且不破坏原 OPD 目标。
    • 还有一些理论,具体可参见:CSDN | NCA:解决 OPD 中重新加入 context 后,模型性能反而下降的问题
  5. 实验结果
    • 在 14 个配置、三个领域上评估:系统提示问答、文本游戏、数学推理;涉及 Llama、Qwen 等多个模型。
    • NCA 在多数设置中提升有上下文准确率,并在 14 个设置中的 12 个减少 context harm,平均降低 7.2 个百分点的 harm,提升 5.3 个百分点的 both-view success。
    • 同时保持或提升无上下文性能。
    • 机制分析显示,NCA 显著提高无上下文与有上下文输入在隐藏状态层面的相似性,并重定向参数更新方向,而不是简单增加更新复杂度。
  6. 结论与意义
    • 论文指出:评估特权上下文蒸馏,不能只看学生无上下文时表现如何,还要看“上下文重新出现时是否稳定”。
    • 主要局限包括:实验大多单训练种子、机制分析限于一个模型-任务配置、在上下文仍然很有帮助的 Regime B 中固定锚可能次优。

总结:这篇论文发现并命名了 OPD 中的“上下文重新引入导致性能退化”现象,提出用 NCA 正则让学生在有/无特权上下文时保持一致,从而提升内部化的鲁棒性。

Error Bounds of Imitating Policies and Environments

Error Bounds of Imitating Policies and Environments for Reinforcement Learning

1 ai 速读

强化学习里,让智能体自己试错很慢。模仿学习就是:给专家操作记录,让智能体照着学。两种常见学法:

  1. BC,行为克隆
    像监督学习:看到专家在状态 \(s\) 做什么动作 \(a\),就学着输出同样动作。
    问题:一步错,步步错。专家演示没覆盖的状态,智能体一旦走到那里,就可能乱做,然后越走越偏。这叫复合误差。

  2. GAIL,生成对抗模仿学习
    类似 GAN:一个“裁判”判断动作来自专家还是智能体,智能体努力骗过裁判。
    它匹配的不是单步动作,而是整体“经常访问哪些状态-动作”。所以更能抓住全局结构,长时域下更稳。

文章的核心结论:

  • BC:专家和学到的策略,价值差距随“有效规划时域” \(1/(1-\gamma)\) 的平方增长。
    即 \(\frac{1}{(1-\gamma)^2}\)。长时域下很吃亏。
  • GAIL:价值差距只随 \(1/(1-\gamma)\) 线性增长。
    即 \(\frac{1}{1-\gamma}\)。长时域下优势明显。
  • 期刊版进一步证明:
    • 不能和环境交互时,任何模仿学习算法都逃不过平方下界,所以 BC 的上界几乎最优。
    • 能和环境交互时,下界变成线性,说明交互很重要,GAIL 的线性优势有理论支撑。
  • 把环境转移模型也当“智能体”(所谓双智能体 dual-agent 架构)来模仿:
    • 用 BC 学环境,只最小化单步预测误差,策略评估误差仍会平方累积。
    • 用 GAIL 学环境,匹配状态-动作-下一状态分布,策略评估误差关于模型偏差变成线性。
      这对基于模型的强化学习 MBRL 很有启发:环境模型不要只用 BC 学,可以用 GAIL 风格学。

2 两版对比:会议扩期刊到底扩了什么?

部分 短版/会议版 长版/期刊版
策略模仿理论 BC 上界、GAIL 上界 增加下界:无交互平方、有交互线性
样本复杂度 有 BC 的 Corollary 1 增加环境模仿 Corollary 2,更完整
实验 MuJoCo 为主 增加表格环境验证 scaling、消融
附录 A-E 在线补充 A-H,证明和细节更全
摘要/引言 核心贡献 强调下界、样本复杂度、MBRL 应用
其他 Broader Impact Index Terms、作者简介、更规范格式

总结:会议版讲清楚“GAIL 比 BC 好”;期刊版进一步证明“BC 差是理论下界决定的,交互能改善;GAIL 学环境也能缓解 MBRL 的模型偏差”。

人工 diff 了一下会议版 / 期刊版,感觉只是加了一个理论,以及可能一些实验量不是特别大的实验(?)

  • 感觉期刊版的 abstract 比会议版更冗长()一些衔接句比较多
    • 怎么感觉 abstract 一模一样。intro 第一段也一模一样。
  • 感觉 intro 的 gap 段,也就是现在学术界做了 xx,但还没有做 xx,期刊版写的更好。
    • 期刊版 intro 的 method 段,第一段基本跟会议版是一样的。然后增量贡献,又新写了一段,第二个 method 段。(开始怀疑因为这个文章发的比较早,所以比较粗糙扩刊也能中。还是说扩刊都这么粗糙呢(?))
    • intro 版的 method 3 段,也就是用 imitation learning 学 env transition model,感觉期刊版写的更细节一些。
    • 现在感觉这个文章偏理论。
  • 2 preliminaries 也写更详细了一些,但是基本感觉没变化。额外介绍了 model-based RL。
  • 3 related work 感觉有一部分是扩写的,有一部分基本没变化,有一部分是新增的。
  • 4.1 的理论,对 BC 的一个理论分析,期刊版和会议版基本一样。
    • 4.2 的理论提到一个神经网络距离,他们说实证上来看,这个数值跟散度度量差异比较大,他们应该是用神经网络距离来证明的,感觉很有趣。不过感觉这个理论我完全看不懂。感觉 4.2 也是期刊版和会议版基本一样。
    • 期刊有一个新的 4.3 节,应该是有一些新的理论。4.3.1 4.3.2 构造了一些神秘的特殊 MDP 来证明下界,(问 dpsk)只要能构造出来一个坏 MDP 证明算法会出现很坏的情况,那么它就已经是一个性能下界了,所以这样证下界好像是正确、正常的。(具体技术细节完全没有研究)
  • 5 也是 method,是 model-based RL 的相关理论。会议版期刊版基本一样,期刊版新加了一个定理。跟期刊版新增的 4.3 节没关系。
  • 6 exp 似乎期刊版写冗长了一点。dpsk 说期刊版加了 tabular 实验(有点神秘,是 toy 实验吗),以及看起来像一个 ablation。但总之感觉每个实验都会让故事变得更完整,并不是随机加的。我没有仔细 check。

关于理论证明全都放在附录里,这个可能值得看一下,他们是怎么处理的。 dpsk:

期刊版对理论证明的处理,可以概括成一句话:正文只留“定理 + 直观解释 + 证明思路”,完整证明全部搬到在线补充材料(Appendix)里,并在正文中明确引用。 这是期刊扩写时很常见的做法,因为期刊正文页数有限,而证明往往很长。

具体来说,他们是这样处理的:

  • 1 在开头就声明“证明在附录”。期刊版第 1 页就写了:

    All proofs of theoretical claims can be found in the Appendix, which can be found on the Computer Society Digital Library at http://doi.ieeecomputersociety.org/10.1109/TPAMI.2021.3096966.

    意思是:所有理论证明都在附录,附录在 IEEE 在线数字图书馆。这样读者一看就知道:正文不会展开证明,想看细节去补充材料。

  • 2 正文只给定理、引理、推论,不给完整证明。期刊版正文中,定理和引理都是直接陈述结果,然后给一两句解释或证明思路,不写完整推导。

  • 3 正文中会有一个“证明框架”的概述。虽然完整证明在附录,但正文并不是完全不给证明线索。他们会提出一个核心分析框架,比如 error-propagation framework(误差传播框架),然后说明这个框架怎么用,详细步骤在附录。

  • 4 附录里放什么?期刊版的附录在在线补充材料里,通常包含:完整的数学证明;辅助引理和它们的证明;误差传播的详细推导;下界构造的详细过程;样本复杂度的推导;环境模仿的证明;算法伪代码、实验细节等。

  • 从会议版可以看到,会议版的附录 A 到 E 就包含了这些内容。期刊版把这些内容搬到了在线补充材料,正文只保留引用。

如果我们要学这种写法,可以这样做:

  1. 会议版:证明可以放在正文后面的附录,论文自包含。
  2. 期刊版:把详细证明移到在线补充材料,正文只留:
    • 定理陈述;直观解释;
    • 证明思路(用了什么框架、分解成几部分);
    • 明确引用“详细证明见附录 X”。
  3. 保持编号对应:正文的 Theorem 1 对应附录 A.1,Lemma 2 对应附录 B.3,方便审稿人查找。
  4. 正文中不要重复证明:能说“由 Lemma Y 直接可得”就不要再推一遍。
  5. 补充材料要完整:所有正文引用的证明、辅助引理、下界构造都要在补充材料里写清楚。

Provably and Practically Efficient Adversarial Imitation Learning with General Function Approximation

Adversarial Imitation Learning with General Function Approximation: Theoretical Analysis and Practical Algorithms

1 ai 速读

感觉这个太理论了,没有细看,感觉工作似乎做的非常好。

1. 它们研究什么问题?

模仿学习就是:不让智能体自己试错找奖励,而是给它看专家怎么做事,让它模仿专家。

模仿学习里有两类主流方法:

  • BC,行为克隆:直接监督学习,专家在什么状态做什么动作,我就照抄。问题:小错误会累积。专家走一条路,你稍微偏一点,之后状态分布就变了,越错越远。

  • AIL,对抗模仿学习:像 GAN 一样,先学一个“奖励函数”来区分专家和当前策略,然后让策略去最大化这个奖励,最终希望策略行为像专家。实践里很强,比如 GAIL、IQLearn、HyPE 等,但理论长期落后。

这篇论文要解决的核心缺口是:

以前的 AIL 理论大多只在“表格环境”或“线性函数”这种简化设定下成立;但实际算法用的是神经网络,也就是“通用函数逼近”。理论和实践脱节。

所以两篇论文都在做一件事:

在通用函数逼近下,提出一个既能证明有效率、又能真正用神经网络实现的 AIL 方法。

这个方法叫 OPT-AIL。

2. OPT-AIL 的核心思想

它把对抗模仿学习拆成两个优化问题:

  1. 奖励学习:
    奖励函数不是固定不变的,它会随着策略变化。今天策略差,奖励要指出哪里不像专家;明天策略变了,奖励也要变。
    所以作者把奖励学习看成一个“在线优化”问题:每轮只能根据过去的反馈更新,用“无遗憾算法”来学奖励。

  2. 策略学习:
    奖励学到以后,策略学习就变成一个普通强化学习问题:在这个奖励下,怎么学一个高价值策略。
    作者用“乐观正则化”来鼓励探索,意思是:对不确定但可能好的动作给一点乐观加分,让策略敢探索。

理论上的关键结论是:

在通用函数逼近下,OPT-AIL 需要多项式数量的专家轨迹和环境交互轨迹,就能学到接近专家的策略。

这是以前没有的。以前要么只做表格,要么只做线性,要么算法复杂到没法用神经网络实现。

实践上:

OPT-AIL 只需要近似优化两个目标,所以可以直接用神经网络实现。在 DMControl 连续控制任务上,它超过了 BC 和多个 SOTA 深度 AIL 方法。

3. 两篇的关系

可以这样理解:

对比项 第二篇:会议版 第一篇:期刊扩展版
标题 Provably and Practically Efficient AIL with General Function Approximation AIL with General Function Approximation: Theoretical Analysis and Practical Algorithms
方法 只有 model-free OPT-AIL model-free + model-based OPT-AIL
理论 一个主定理 两个主定理,model-free 和 model-based 各一个
实验 较少 baseline,主要验证专家样本效率和交互效率 更多 baseline,加入 model-based 对比、消融、奖励模型质量、更多专家轨迹数量
附录 有证明、实现、额外实验、NeurIPS checklist 有完整证明、实现、额外实验,期刊式结构
定位 会议论文 会议论文扩展成期刊论文

2 会议版和期刊版的 diff(人工 diff)

  • 0 abstract 和 1 intro,感觉这个扩刊相比上一个扩刊,把各种语言都 paraphrase 了一遍。以及添加了新的 model-based 部分。
  • 2 related work 感觉也差不多,可能写的更详细了,以及添加了对 model-based 的讨论。把会议版的 paragraph 变成了期刊版的 subsection。
  • 3 preliminaries,语言似乎直接照搬,没有 paraphrase。理论似乎写的更详细了。
  • 4 method 具体是怎么重构的呢?
    • 会议版的 4 method 变成了期刊版的 4 method + 5 practical implementation。
    • dpsk 说是这样的,我没有细看:
会议版(第二篇) 期刊版(第一篇) 变化本质
4 Optimization-based AIL 4 Optimization-based AIL 大标题不变
4.1 Theoretical Analysis of OPT-AIL 4.1 Algorithm Description 会议版“理论分析”里其实混着算法描述,期刊版把算法描述单独提出来
4.2 Theoretical Analysis 会议版理论保证在 4.1 末尾,期刊版独立成 4.2
4.2 Practical Implementation of OPT-AIL 5 Practical Implementation of OPT-AIL 会议版实践实现放在第 4 节,期刊版独立成第 5 节
只有 model-free OPT-AIL model-free + model-based OPT-AIL 期刊版多了一条完整方法线
Algorithm 1:MF 理论 Algorithm 1:MF 理论;Algorithm 2:MB 理论 理论算法从 1 个变 2 个
Algorithm 2:MF 实践 Algorithm 3:MF 实践;Algorithm 4:MB 实践 实践算法从 1 个变 2 个
  • 5 exp,5.1 setting 基本是 paraphrase。后面实验似乎添加了 model-based 的 baseline,但是移除了一些 model-free 的。似乎还有新的 ablation 添加。


posted @ 2026-08-01 00:30  MoonOut  阅读(79)  评论(0)    收藏  举报