论文速读记录 | 2026.05




On Variational Bounds of Mutual Information

没有细看。ai 省流:

现有互信息变分界在高维情况下特性不清晰,各种下界(如 NWJ、InfoNCE)之间的关系和偏差-方差权衡不明,且当真实互信息较大时,已有变分下界会出现严重退化:要么偏差极高(如 InfoNCE 上界为 log K),要么方差极大(如基于 Donsker-Varadhan 的界),缺乏一个能灵活平衡二者的方案。

这篇文章在一套统一框架下,梳理了几乎所有主流变分界,揭示了它们之间的推导关系。

  • 首次证明了 InfoNCE 是互信息的下界,并给出了 MINE 启发式梯度校正的正当性。
  • 提出连续统下界 Iα,通过非线性组合批内混合分布与学习到的边缘分布,在偏差与方差之间平滑插值,一举桥接 NWJ 和 InfoNCE。
  • 在受控高维实验中,系统刻画了各下界的偏差、方差及梯度误差,证实 Iα 能有效折中,均方误差优于纯 NWJ 或 InfoNCE。
  • 为已知编码器 p(y|x) 的场景(似乎这种场景在实际中比较少)引入无需额外参数的“留一法上界”和结构化下界,可夹逼真实互信息;还将此扩展至总相关上界,用于解耦表示学习。

Sparse Reward Subsystem in Large Language Models

故事:作者在 LLM 中定位到了两类特殊的神经元,它们的功能与人类大脑中的特定区域非常相似:

  • 价值神经元(Value Neurons):类似于大脑的 vmPFC/OFC 区域,代表模型对当前状态“价值”的内部预期(即预测自己是否能正确回答问题)。
  • 多巴胺神经元(Dopamine Neurons):类似于大脑的 VTA/SNc 区域,负责编码奖励预测误差(RPE)。当模型获得比预期更高的奖励时,这些神经元会高度激活;反之则抑制。

关键结论:

  • 稀疏性(Sparsity):预测奖励所需的神经元非常少。实验表明,仅保留不到 1% 的神经元就足以维持预测的准确性。
  • 推理的关键性:通过干预实验发现,如果屏蔽掉这 1% 的价值神经元,模型的推理能力会显著下降,而随机屏蔽相同比例的其他神经元则几乎没有影响。
  • 鲁棒性与迁移性:这种子系统在不同的模型规模(如 0.5B 到 14B)、不同的架构(如 Qwen, Llama, Phi, Gemma)以及不同的数据集(如 GSM8K, MATH500)之间都具有高度的一致性。

这项研究证明了,LLM 不仅仅是在进行简单的概率预测,其内部还存在一个能够自我评估的机制。这为理解 LLM 的内部推理过程、检测幻觉以及通过内部信号优化模型训练提供了新的视角。

完全没看实验是怎么做的。

On the Role of Iterative Computation in Reinforcement Learning

  • 来源:Eysenbach 新文章,跟 RL 有关,好像 abstract 有点吸引人;我可能没看过这类文章,有点好奇。
  • arxiv:https://arxiv.org/abs/2602.05999

主要内容:

  • motivation:标准 RL 将策略看作 state → action 的静态函数,每次决策使用固定计算量,这使得计算量(compute time)和参数量(parameter count)被混淆在一起。然而,不同 state 下做出正确决策所需的计算量 可能差别巨大,固定计算量既浪费又低效。(感觉是 sml 喜欢的神秘 idea…
  • 核心观点:传统强化学习往往用更深的网络(更多参数)来换取更强能力,这导致了计算与参数的“捆绑”。该论文则挑战了这一观点,认为,即使参数量固定,增加策略在执行任务时使用的计算量(如“思考”或迭代的步数),也能极大地提升能力。
  • 理论:论文使用计算理论(图灵机模型)对强化学习策略的“计算量”进行了形式化定义,并证明了两条定理:
    • Policy Hierarchy Theorem (策略层级定理):存在一些 MDP 任务,拥有更多计算资源的策略可以表现得任意好,而计算受限的策略则无法学好。这为“增加计算能解决更复杂问题”提供了理论依据。
    • Long Horizon Generalization (长程泛化定理):在目标导向的任务中,计算资源受限的策略可能在训练任务上“死记硬背”而过拟合,但无法泛化到需要更多步数才能完成的测试任务上。而拥有更多计算量的策略则能学到真正的“算法”解,从而泛化成功。
  • method:为了验证理论,论文设计了一个名为 IRU(Interpolation Recurrent Unit)的极简循环架构,在不增加参数量的前提下,通过增加循环次数来增加计算量。
    • IRU 就是一个可复用的计算单元,它的任务是根据当前输入和“记忆”,更新“记忆”。IRU 接收两个东西:1. x:外部输入,比如状态(经过初始编码)或状态-动作对。2. c_i:上一轮迭代后的“细胞状态”(记忆),一个向量。然后执行以下计算:
    # 公式 (2): 遗忘门
    f_i = sigmoid( FORGET([x, tanh(c_i)]) )   # f_i 在 0~1 之间
    
    # 公式 (3): 输入门 / 候选值
    I_i = tanh( INPUT([x, tanh(c_i)]) )        # I_i 是候选的新记忆
    
    # 公式 (4): 更新的细胞状态
    c_{i+1} = f_i * c_i + (1 - f_i) * I_i
    
    • 这里的 FORGET 和 INPUT 是两个可训练的线性层(带偏置)。 [x, tanh(c_i)] 表示将输入和上一状态(经过 tanh 压缩)拼接。新的记忆 \(c_{i+1}\) 是由旧记忆 \(c_i\) 和新候选 \(I_i\) 通过权重 \(f_i\) 做线性插值得来的。(有点像很古早的 rnn(?)因为 rnn 也是共享参数的)
  • 实验证明,循环次数越多,策略越 work:
    • 多出来的计算量到底是让模型“想得更明白”(更强的表达能力),还是让它能探索到更好的数据?论文做了一个巧妙的分离实验:
    • 主动智能体:用 IRU-(1) 在环境中边学边采数据。
    • 被动智能体:也用 IRU-(5),但只能训练在主动智能体采集的数据上。
    • 结果发现,被动 IRU-(5) 的性能大涨,甚至逼近主动 IRU-(5) 的水平。这说明,即使数据是由“笨”策略(计算少)收集的,一个“聪明”策略(计算多)也能从相同的数据中提取出更好的解决方案。所以增益主要来自模型容量/表达能力的提升,而不是探索的改进。
  • 与 rnn、lstm 的比较(ai 说的,我并不确信):
    • IRU 可以看作一个 “只有遗忘门和输入门,且没有输出门”的简化 LSTM,或者一个 “重置门恒为 1”的极简 GRU。论文本身的消融实验也证实,IRU 的性能与 LSTM 相当,但参数量减少一半,速度快一倍。
    • 训练稳定性:Vanilla RNN:容易发生梯度消失/爆炸,难以捕获长程依赖。IRU:其核心更新公式 \(c_{i+1} = f_i * c_i + (1 - f_i) * I_i\) 天然具备梯度高速公路。当遗忘门 \(f_i\) 接近 1 时,梯度可以几乎无损地从 \(c_{i+1}\) 流回 \(c_i\)。这类似于 LSTM 和 GRU 的加法 / 插值机制,使得即使循环步数 N 较大(如 5 或 10),训练也能保持稳定,这是 vanilla RNN 做不到的。

这个文章的作者,现在还没开源,处于 todo 状态。

WileReward: Learning Reward Models from In-the-Wild Human Interactions

故事:

随着大语言模型(LLM)的广泛部署,产生了海量的真实人机对话数据。这些数据中天然包含着用户对模型回复的隐式反馈,但此前这些信息的价值未被充分利用。

然而,直接从真实对话中提取反馈面临两大难题:1. 反馈稀疏:约82%的用户追问不包含明确的偏好信号,而明确的正面反馈尤其稀少(仅占约 1%)。2. 反馈噪声:用户反馈不可靠,例如在模型正确拒绝回答一个危险问题后,用户仍可能给出负面评价。

提出的数据集 + method:

  • 构建数据提取流程:论文设计了一套自动化流水线,从对话数据集(WildChat)中提取并识别用户反馈,将其分为五个满意度等级,并通过“隐式反馈挖掘”和“拒绝验证”两个策略来缓解噪声和稀疏问题。最终,构建了一个包含 18.6 万条高质量反馈数据的数据集,名为 WILDFB。
  • 直接训练奖励模型:利用 WILDFB 数据集,采用序数回归的方法,直接基于用户反馈的层级结构(而非偏好对)来训练奖励模型,得到的模型名为 WILDRewARD。

(不太明白… 虽然没有细读,并且我不懂 这可能确实是对社区贡献很大的工作,但是故事性这一块好像有些少…

Can We Really Learn One Representation to Optimize All Rewards?

ai 速读:

  • 这篇论文的核心是分析和改进一种叫“前向-后向表示学习”(Forward-Backward,FB)的无监督强化学习算法,并提出了一种更简单、更稳定的替代方案。
    • (这是我第一次听说这个方法)
  • RL 的无监督预训练为什么有意义(故事):只需预先在无奖励环境中学习通用的行为先验,之后便可“零样本”泛化到任意新任务,极大提升强化学习系统的通用性和样本效率;这类似于大语言模型的上下文学习能力,是构建通用智能体的关键一环。
  • 原始的 FB 算法号称能学出一种表示,在无需额外微调的情况下,直接推导出任意奖励函数下的最优策略。但论文发现这个理论在现实中存在严重缺陷:
    1. 存在条件严苛:要完美实现这个目标,表示维度必须至少等于状态-动作空间的总大小。在连续环境中,这几乎不可能。
    2. 压缩映射不压缩:论文发现 FB 的优化过程有一些循环依赖(要学策略就得先知道后继度量,要知道后继度量又得先知道策略),相当于应用一个“非收缩的贝尔曼算子”,在数学上无法保证收敛。实验中,FB 甚至无法在简单的 3 状态任务里学到准确的表示,误差较大。
  • 提出 One-Step FB 方法:基于上述分析,作者提出了更务实的 One-Step FB。它的核心思想是打破原算法里的循环依赖,不再试图直接学习最优策略的表示,而是退一步,先老老实实学好一个固定、已知的行为策略的表示。这个改变让它的优化目标有了稳定的不动点,收敛性更好。
  • 实验结果(ai 省流的,没有具体去看):
    1. 在简单的离散 CM P中,FB 在多项指标上(后续度量误差、策略 KL 散度、Q 值等变误差)都无法收敛到零;而 One-Step FB 在 4e4 步内误差就降到 1e-9 量级。
    2. 在 10 个连续控制基准(ExORL、OGBench,含图像输入)上,One-Step F B在零样本性能和在线微调效率上均显著优于 FB(零样本平均提升 +24%),也比大多数 baseline 更好。

The Magic Correlations: Understanding Knowledge Transfer from Pretraining to Supervised Fine-Tuning

  • 来源:Google scholar 邮件推送。其实没太看懂这个文章。
  • arxiv:https://arxiv.org/abs/2602.11217
  • 内容:
    • 当前,大语言模型(LLM)开发中的一个核心实践是:基于预训练(Pretraining)阶段的性能指标,来为后续的监督微调(SFT)阶段做出关键决策,例如数据配比、资源分配等。
    • 这个实践依赖于一个关键假设:预训练阶段的性能、模型内部表征,能够可靠地预测 SFT 后的性能,并且这种能力在训练阶段间是稳定传递的。这篇文章旨在系统性地审视并验证这一基本假设是否成立。
    • 实验发现:1. 准确率与置信度的“反向规模效应”:模型越大,准确率的跨阶段迁移性越好,但置信度的迁移性反而变差。2. 任务领域的巨大差异:常识推理和科学推理任务的跨阶段迁移性稳定且高;而语义理解和自然语言推理任务的迁移性则较弱或不稳定,说明微调会显著重组模型在这些任务上的能力。3. 不可靠的基准:像 WiC、MultiRC 这类需要精细语言理解的任务,以及在小规模下的 WinoGrande、MNLI,其预训练表现无法预测微调后的表现,不适合作为早期评估的依据。
    • 对实践的指导意义:1. 谨慎选择早期评估基准:应优先使用迁移性高的基准(如HellaSwag、PIQA、科学推理类)来做早期决策,并留意那些不可靠的基准。2. 不能只依赖小规模实验:做数据配比、质量筛选等决策时,如果只用小模型做实验,其结论可能在大模型上完全相反,存在误导风险。

Improving Interactive In-Context Learning from Natural Language Feedback

  • 来源:Google scholar 邮件推送,好像研究如何把静态数据转化为 multi-turn 数据,用于训练 LLM。
  • arxiv:https://arxiv.org/abs/2602.16066

(以下为速读幻觉,并且完全没看实验是怎么做的)

现在用 RL 训练 有可验证 01 reward 的题目,效果很好,但是如何利用 LLM 与人类交互的多轮、自然语言反馈数据,是一个非常好 很值得做的问题。

这篇文章提出了 RL²F 方法:

  • 让两个 LLM 互相用自然语言对话,一个扮演 teacher,另一个扮演 student(被训练的那一方)。
  • teacher 能访问正确答案等“特权信息”,但不会直接告诉学生 student,而是提供引导性反馈;student 则需根据反馈反复修改答案。这样,student LLM 可以通过强化学习进行训练,答对就给奖励,以此优化其在多轮自然语言 feedback 中学习的能力。
  • teacher 模型并不需要比 student 模型更强,它只是利用了信息不对称,因此,同一基础模型就能分饰两角。

感觉这个故事真好,非常有意义,并且还很简洁。简单 ai 速读了一下实验,感觉实验貌似也做的非常好。



posted @ 2026-05-01 18:11  MoonOut  阅读(154)  评论(0)    收藏  举报