论文速读记录 | 2026.07(1)



目录


(仅记录听 poster 的收获,算是一个自用的笔记。

这些领域有些不太了解,并且信息的传递可能有损失,不能保证所有信息的正确性)

[icml] Fix Before Search: Benchmarking Agentic Visual Query Pre-processing in Multimodal Retrieval-augmented Generation

一作给我讲了一个特别好的故事:

background

  • RAG 的流程是:用户给 LLM 一个 query,LLM 需要先在一个已经向量化(embedding 化)的内部数据库里,根据用户的 query 匹配向量相似度,从而找到最相关的参考信息,再同时提供给大模型,让大模型根据这些信息回答用户的 query。
  • 这里面的一个关键是:用户给的 query,如果直接拿去算 embedding 匹配向量相似度,相似度往往非常低。所以,目前的 RAG 方法往往会把用户的(文本形式)query 重写,以此来提高相似度 以及检索匹配的效率。
  • 比如一个经典的重写方法:一作介绍说,有一个很古早的工作,它的 RAG 内部数据库都是维基百科的形式,于是它把用户提的问题 通过大模型 重写成一个关于该问题的、类似百科结构的文本。因为结构上更相似,匹配的相似度就更高,效果也更好。总之,重写这一步是非常关键的。

gap

  • 但是,如果用户的 query 图片 + 文本的形式,也就是说,用户把文本形式的 query 连带着一张图片,一起给大模型,目前似乎没有人针对图片做重写,这是一个 gap。
  • 为什么图像也有“重写”的需求?我们考虑一个现实场景:用户想问大模型一个问题,并配了一张图。但这张图可能非常糊,比如被旋转了 90 度,或者是直接拍电脑屏幕得到的。目前大家的处理方法,是直接用多模态模型 把图片转成 embedding,然后送去一起做向量相似度计算。
  • 但是,这种模糊、质量较差的图片,计算相似度的效果并不是很好。具体的,作者们手动把目前一些带图片的 RAG 问题中的图片,进行旋转、裁剪等操作“变坏”后,发现现有方法的性能直接大幅下降。这证明了如果图片不干净,对检索的影响非常大。
  • 进而得到 motivation:如果我们能把图片处理一下,比如把位置摆正,调整好亮度、对比度,或者把拍屏幕的这部分精准地裁剪、截图截出来,整体的匹配性能就会有很大提升。
  • (听到这个 motivation 的时候,觉得这个工作做的非常好。感觉这种文章只要能把故事说圆,就一定能中;在 taste 方面给我带来很大启发。

具体工作

主要实验工作和结果可以分为以下几个部分(部分细节是我的推测,还没读原文,也没和一作确认具体细节):

  1. 第一部分工作:
    • 他们首先将图像进行旋转、裁剪等操作,把图像“变坏”。实验发现,在这些劣化图像上,现有方法的性能会出现大幅下降,从而得出结论:高质量图像是很重要的。
  2. 第二部分工作(提出解决思路并验证潜力):
    • 为了解决上述问题,他们设想给大模型提供一个工具集(Tool Set),比如包含旋转、裁切、调整对比度和颜色等图像处理工具。让大模型去调用这些工具,从而还原图片的清晰度,使其尽量恢复到 原本完美呈现的状态。
    • 为了验证这个思路的上限,他们做了一个理想化的实验:
    • 假设大模型能够做出最完美的恢复操作。由于图像的劣化过程(如旋转、改颜色)每一步基本都有对应的逆变换,因此可以得到一个逆操作序列(即 Oracle 轨迹)。唯一无法完全逆转的是裁剪操作(比如图片只剩一半,无法凭空长出另一半),但总的来说依然能构建出一个逆操作序列。
    • 在最理想的情况下,让大模型直接调用这个 Oracle 工具集来还原图像。
    • 实验结果显示,在这种理想调用下,性能得到了明显恢复,甚至能勉强追平之前完美图像的性能。这证明了只要工具集设计得当,且大模型能够完美调用,该方案的潜力是非常巨大的。
  3. 第三部分工作(发现现有能力的不足):
    • 他们接着测试了实际情况。如果直接给大模型 Prompt,让未经相关训练的现成大模型去调用工具,结果发现其表现仅仅比不调用工具、直接在脏图片上运行的性能稍微好一点点,几乎没有实质性提升。这证明了现有大模型在这一块的工具调用能力是严重不足的。
  4. 第四部分工作(通过 SFT 提升能力):
    • 为了解决能力不足的问题,他们利用前面构建 Oracle 调用轨迹的方法,获取了一批高质量的 Oracle 数据。接着,他们构造了一个包含约 1100 条数据的 SFT(监督微调)数据集。
    • 利用这批数据对模型进行微调后,发现模型的工具调用能力大幅上升,最终的图像恢复性能也得到了显著提升。

[icml] Reparameterization Flow Policy Optimization

背景:

  • 这篇文章是传统强化学习(RL)领域的工作,具体关注的是可微模拟器(differentiable simulator)。
  • 虽然我之前没怎么读过在可微模拟器中做强化学习的文章,但基本原理似乎是:只要模拟器是可微的,我们就不需要用策略梯度公式 去剔除不可微的部分,而是可以直接沿着轨迹,从轨迹的末端一直反向传播梯度 到起始端,一口气把梯度下降的梯度算出来。
  • 为什么 RPG(Reparameterized Policy Gradient)方法叫重参数化(reparameterization),是因为在可微强化学习中,如果采用随机策略,随机噪声(noise)本身是不可微的,但如果进行重参数化,就能变成可微的。这似乎是一个常用的数学 trick,不过我现在对具体细节有些不熟悉了。

gap & method:

  • 这项工作发现,现有的 RPG(Reparameterized Policy Gradient)方法存在一个 Gap:这些方法都是非常 on-policy 的,一条轨迹用一遍就扔掉了,导致样本效率(sample efficiency)比较低。
  • 因此,他们把这个方法改成了一个类似 PPO 的形式,从而引入了一定的 off-policy 机制。也就是说,一条数据可以重用 16 到 20 次再扔掉,与 PPO 的 off-policy 程度是一致的。
  • 采用这种设计后,数据效率得到了显著提升。

在具体技术细节上,还记得以下几点:

  1. 目标函数(objective):他们把目标函数写成了类似于 PPO 的形式,去最大化 advantage。
  2. 裁剪机制(clip):引入了 PPO 格式的 clip,用来过滤掉重要性采样比率(importance sampling ratio)差距过大的样本。这也是 PPO 的经典操作,因为要实现 off-policy 并重用过去产生的数据,必须通过重要性采样来对齐分布;但如果重要性采样的 ratio 过大,说明数据过于 off-policy,就需要将其丢弃。
  3. 损失函数:还引入了 KL 散度的 loss 等机制。

最后实验效果很好。

收获:感觉 differentiable RL 这一块挺有趣的。(同学说做 differentiable RL 最难的就是找一个可微的 simulator,有一个基于 issac gym 开发的 simulator 是可微的)

[icml] PowerFlow: Unlocking the Dual Nature of LLMs via Principled Distribution Matching

速记:

如果 RL 是锐化 LLM 的分布,那么我们希望可以直接给这个分布里面 每一个概率(大概是 P(y|x)?)都变成 α 次方。如果 α > 1,那么这个分布就是被锐化的。我们希望得到一个分布,它跟这个被锐化的分布的 KL 散度尽可能小。

(为什么不能直接把这个锐化后的分布拿到,而是要去算 KL 散度呢?因为这个分布 可能需要用 Beam Search(某种树搜索?)才能算出来,理论是可以算的,但是实际复杂度随着 length 呈指数增长,还是通过 rollout 出来的轨迹 进行无偏估计,效率比较高。

所以说:

  1. 我们的第一个目标:去匹配一个锐化后的分布。
  2. 我们的第二个目标:作者们发现 RL 锐化过后,好像会有大模型输出内容长度(length)变短的问题。如果我们希望 objective 是跟锐化过后的分布 KL 散度尽可能小,同时还有一个 constraint 是生成输出的长度 期望是不变的,把这个东西做一个拉格朗日乘子,发现它正好是 GFlowNet 的一个魔改形式。

这篇文章大概在做这样的内容。

[icml] MiniAppBench: Evaluating the Shift from Text to Interactive HTML Responses in LLM-Powered Assistants

启发:感觉这篇文章提出了一个非常新颖的交互范式。

速记:

传统的、我们习以为常的大模型交互方式,通常是“一问一答”的纯文本形式。但面对一些更复杂的用户需求时,纯文本具有一些局限性就很明显。比如,当需要解释一个复杂的物理原理时,我们可能会希望,LLM 能提供丰富多彩、甚至可以互动的图示;再比如,当用户想要记录每日食谱时,纯文本很难提供好用的记录工具,但是如果 LLM 能写一个基于 html 的 app 作为每日记录的接口,用户可能感觉更有帮助。

针对这种场景,这篇文章主打的概念,是让 AI 生成一个 HTML 形式的 MiniApp 来服务用户。

为了检测目前主流的开源和闭源大模型生成这种 HTML Mini App 的质量如何,他们做了一项偏 Benchmark 的工作。印象里,没有提出新的方法论,而是“造了一些题”,并构建了一套自动打分系统:

  1. 整理数据集:面向 MiniApp 的应用场景,整理了一批高质量的用户 Prompt。
  2. evaluation - 引入 Agent 自动测试:引入了一个基于 Computer Use 的 Agent,可以模拟人类,直接在屏幕上点击、操作鼠标,像真实用户一样去使用大模型生成的 MiniApp。
  3. 综合评估打分:结合 Agent 实际运行的反馈,以及 HTML 源码,让大模型从三个维度进行综合评估。记得其中两个维度是“是否符合功能需求”和“代码质量好不好”,第三个维度暂时记不清了。如果每个维度的打分都大于 0.8,就判定这个 App 编写成功。

[icml] From Reward-Free Representations to Preferences: Rethinking Offline Preference-Based Reinforcement Learning

TODO:

  • 了解一下 forward-backward 是什么,这样应该就能看懂这个文章了。
  • 合作者提到,这个组的文章似乎非常有趣,都是用无监督预训练 + 各种 RL 方法,感觉我后面可以调研一下。

ai 省流:

这篇工作主要关注的是 Offline Preference-Based RL(Offline PbRL)。

个人对这个工作的直观理解:我们希望使用 Offline 数据集训练一个 condition on z 的 policy \(\pi(\cdot | z)\),其中每一个 \(z\) 代表一种行为。然后我们通过 PbRL 的方法找到一个最好的 \(z^*\),从而就得到了最好的行为。

根据论文内容,他们的动机是:如果 preference 数据比较稀少,直接用稀少的 preference 数据去训练 reward model,很容易导致 reward model 过拟合;而 offline 数据往往非常丰富,因此可以先从 offline 数据中无监督地提取特征,然后再去学习较好的策略。(这个动机跟我们的新作 collie 也很像)

具体来说,方法分为两步:

  1. 第一步:训练一个 Condition 在 \(Z\) 上的 Policy
    • 这里使用 Forward-Backward(FB)表征学习方法。这种方法对状态转移概率做了一些线性分解的假设,公式(没记错的话)应该是 \(M(s,a, (s', a')) = F(s,a,z)B(s',a')\)
    • 根据一作的说法,FB 尤其适用于数据质量低、甚至是随机探索数据的 offline dataset。通过这种方法,可以得到一个 condition on z 的 policy。
  2. 第二步:寻找最优的 \(Z^*\)
    • 这篇文章假设(PbRL 会学出来的)reward 符合线性假设,即 reward 可以表示为 \(z\) 与另一个表征(记不清了)的点乘。将这种 reward 格式带入后,可以推导得到一种 InfoNCE 形式的对比学习目标。
    • Bradley-Terry 偏好损失 = SimCLR 对比学习损失,数学等价。
    • 从而,通过对比学习,使 \(Z\) 与被 prefer 的数据表征相似度更高,与不被 prefer 的数据表征相似度更低,从而学习到最优的 \(z^*\)
  3. 微调:
    • 在理论上该方法已经闭环,但存在一个实际问题:通过对比学习得到的 \(z^*\) 可能并不落在 offline 数据集现有的 \(z\) 分布之内。因此,后续仍需进行一些微调(Fine-tuning)来保证生成策略的质量。这块技术细节我记不太清了。

实验:

  • 在实验结果方面,FB 方法在数据质量较低的 Offline Dataset 场景下表现特别好,整体方法非常 Work。
  • 比较场景:DMC / Adroit / MetaWorld。

这篇文章给我最大的收获和经验,是(据一作所说)FB 方法非常适用于低质量数据的场景。后续可以借鉴这一经验,去调研更多相关领域的文献。

(以及,这篇工作对比了我们先前的工作 clarify。当时师兄说 clarify 基于欧几里得距离设计的对比学习 Loss 比较过时,而 InfoNCE 的做法更先进。这篇论文采用的正是 InfoNCE 的形式。无端想到,记下来。)

[icml] From Parameter Dynamics to Risk Scoring: Quantifying Sample-Level Safety Degradation in LLM Fine-tuning

gap & 分析 gap 的原因:

  • 论文发现:在良性数据上微调 LLM 时,模型的危险性也会上升,这是一个感觉反直觉的发现。
  • 分析原因:模型参数会持续向"危险方向"漂移。参数在危险方向上的投影持续增大,而参数在安全方向上的投影几乎不变(≈0)。
  • 危险方向 & 安全方向:如何得到:
    • 我们会首先用一个安全对齐数据集(包含一个危险的 query X、一个安全的好回答 Y_safe(可能是一个拒绝回答的回答),以及一个直接回答危险内容的坏回答 Y_unsafe),用这样的数据集进行 DPO 微调,从而在原有参数的基础上,得到一个对齐(aligned)的好模型。用微调后的对齐参数 \(\hat θ_{aligned}\) 减去微调前的原始参数 \(θ_0\),从而得到一个参数偏移的“安全方向”。
    • 同样地,可以得到一个危险方向:1. 拿一些危险 query X 和有害回答 Y 的成对数据,进行 SFT,从而得到一个 被微调坏了的危险模型。2. 拿这个危险模型的参数 \(\hat θ_{harmful}\) 减去原始模型的参数 θ_0,从而得到偏移的危险方向。
    • 一作提到,他们一开始做不出效果,是因为没有验证 这些危险方向和安全方向是否真的有效。一定要找到一个有效的方向(可能是尝试并验证了很多个方向)之后,这个方法才能 work。
  • 验证方向有效性的办法(危险方向):
    • 得到一个危险的参数漂移方向后,不断地往那个方向施加参数变化,如果能看到模型的危险程度在不断地单调上升(可能是对于一个危险 benchmark,提供危险回答的比例不断上升吗),那么说明找到了一个真正有效的危险方向。
    • 另外,一个方向并不是 在所有模型上都通用的。需要在不同的基座模型上,分别训练对应的危险和安全模型,然后再通过参数相减,才能得到每个模型专属的危险和安全方向。

逐训练样本,量化安全风险:

  • 核心思想:如果某个样本引起的参数更新在"危险方向"上的投影远大于"安全方向",那这个样本风险就高。
  • 计算步骤:计算单个样本引起的参数更新 → 将更新投影到危险方向和安全方向 → 风险分数 = 危险投影 - 安全投影(取模归一化后)。
    • 一作特别提到,不同的神经网络参数(可能是因为 scale 不一样),一定要归一化之后,才能得到一个有效的风险分数,不然做不出效果。
    • 相比之前方法的优势:参数空间操作;直接在参数层面分析,能识别逃过毒性检测的良性样本(也就是在 motivation & gap 中,能把好模型训坏的良性样本)。
  • 进一步,他们似乎直接使用了 一次梯度反向传播计算得到的梯度,在安全方向和危险方向上的投影,来作为风险分数的一个代理。(并不需要真的梯度更新,只需要计算一下梯度方向(不知道是否跟梯度模长有关))
  • 经过一些理论推导(我完全不了解细节),一个样本的风险分数,似乎会正比于它在 对齐模型和危险模型上的 SFT Loss 的差值。
    • 原本以为他们是直接计算 Loss 就可以。但实际上,他们后面(实验部分)的做法是,利用一次梯度计算的梯度方向作为一个代理来进行计算,并不是直接看 Loss 就可以。

实验:

  • 数据集:Alpaca、Dolly(良性微调数据)。
  • 具体实验:
    • 他们通过计算梯度方向的代理风险分数,从良性微调数据集中选出了五组子数据集。这五组数据的风险分数呈递增趋势。
    • 随后,他们使用这些数据对模型进行微调,并测试了微调后的性能。结果发现,模型实际表现出的危险性(ASR (Attack Success Rate),另一个模型给出的(?)Safety Score),呈现出从低到高、不断变危险的单调递增关系,从而证明他们所采用的代理风险分数是十分有效的。
  • 强迁移性:跨模型架构、参数规模、微调方法(LoRA→Full Fine-tuning)均有效。(这一块技术细节我没太 query,所以不太了解)

方法定位:SQSD —— 首个在参数空间中 对良性样本进行连续风险量化的方法。

[icml] Contrastive Reasoning Alignment: Reinforcement Learning from Hidden Representations

[icml] Pull Requests as a Training Signal for Repo-Level Code Editing

主要贡献是数据集。作者们从 GitHub 爬取了大量的 Pull Request(PR),并从这些原始 PR 中筛选出一些质量较高的。

核心 trick 之一 - 格式转换:

  • 将脆弱的、以行号作为索引的 diff 格式,转换成了基于上下文匹配的 Search-Replace 格式。
  • 因为 diff 格式依赖行号定位,而让大模型去数行号是非常困难的,所以替换成 Search-Replace 格式能有效解决这个问题。

数据集与训练:

  • 最终得到了 200 万(2 Million)的 PR 数据,并基于这些数据先进行了 Continual Pre-training(或 Mid-training)。
  • 在 Pre-training 之后,又进行了一些简单的 SFT。实验发现这种 Mid-training 的效果非常好。
  • SFT 数据构造:他们的 SFT 数据并不是用 Agentic 的方式构造的,而是基于一个固定的写死的流程,让模型一步一步去执行(例如先进行 Search,再写代码、修改等)。

主要亮点:

  • 最大贡献:贡献了一个高质量的数据集,以及这套清洗数据集的流程。
  • 核心卖点:似乎在主打“Agentless”轻量级流程,虽然我不太明白这个故事。

[icml] Unveiling Multi-regime Patterns in SciML: Distinct Failure Modes and Regime-specific Optimization

(虽然我不太懂,但感觉这篇文章在他们的领域里,一定是一篇很好的文章)

无论换什么模型(PINN、FNO、NODE 等)、什么物理方程、什么优化器,训练-测试误差图都稳定呈现三个区域:

  • Regime I (Well-Trained):训练损失 低,测试误差 低,成功:既优化得好,又泛化得好
  • II (Under-Trained):高,高,优化失败:模型连训练集都没拟合好。
  • III (Over-Trained):低,高,泛化失败:过拟合 / 数据不足,记住了但没学会物理规律。

这三个 regime 的粗粒度结构非常稳定,但边界位置会随物理难度、数据量、优化策略改变。

如果想要改善学习的效果,优化策略的效果是 regime-specific 的(图3),不同方法在不同 regime 表现不同。

此外,他们发现传统 CV 里"损失低 = 曲率低(flat minima)= 泛化好"的直觉在 SciML 里失效了:(感觉这是很有趣的发现)

  • Deceptive Sharpness(欺骗性尖锐):训练损失下降时,Hessian 最大特征值反而上升;模型正在进入"又尖又深"但正确的山谷,尖锐 ≠ 坏。
  • Deceptive Flatness(欺骗性平坦):Hessian 很小,但训练损失很高;模型卡在"平坦高原"上,梯度消失,优化停滞。

(相变:他们的那个 regime 可视化图 长得很像相变,也就是中学物理课本上出现的那种固体、液体、气体 在不同温度 气压下 的图。跟一作这样反馈的时候,一作感到很高兴,说他们老师原先在 CV 领域做过一个相变的文章。

[icml] Agentic Proposing: Enhancing Large language Model Reasoning via Compositional Skill Synthesis

可能是感觉做的最好的一篇,虽然我不太懂 llm。

https://sites.google.com/view/pbmorl/home

When Context Returns: Toward Robust Internalization in On-Policy Distillation

Learning to Learn with Contrastive Meta-Objective

(还没读。这篇文章看起来比较古典,做的是传统 ML,并不是做 llm 的。
(这个东西能用在 llm 上吗?现在看到一个东西,就会想它能否用在 llm 上

Multi-Type Preference Learning: Empowering Preference-Based Reinforcement Learning with Equal Preferences

MetaCURE: Meta Reinforcement Learning with Empowerment-Driven Exploration

Absolute Zero: Reinforced Self-play Reasoning with Zero Data

  • arxiv:https://arxiv.org/abs/2505.03335
  • 来源:neurips 2025 best paper 的一作 yue yang 的 NeurIPS 2025 spotlight 工作。被题目吸引住了,单纯好奇,想读一读。

auto-curriculum learning (Jiang et al., 2021b)

  • 来源:RSD。似乎可以做自动 curriculum learning,或许是有启发性的。

Meta-Motivo(Tirinzoni 等人,2025),zero-shot goal-conditioned RL

  • 来源:RGSD。可能包含一个技能库,也想看。速读一下就行。

Unsupervised Skill Discovery via Recurrent Skill Training

  • 来源:合作者推荐的 skill discovery 先前工作。

Learning to Discover Skills through Guidance

  • 来源:同上。

One After Another: Learning Incremental Skills for a Changing World

  • 来源:同上。

Direct then Diffuse: Incremental Unsupervised Skill Discovery for State Covering and Goal Reaching

  • 来源:同上。

Horizon Generalization in Reinforcement Learning

HIQL: Offline Goal-Conditioned RL with Latent States as Actions

Contrastive Preference Learning: Learning from Human Feedback without RL

Few is More: Task-Efficient Skill-Discovery for Multi-Task Offline Multi-Agent Reinforcement Learning

  • arxiv:https://arxiv.org/abs/2502.08985
  • 来源:同学的最新工作。
  • 主要内容:
    • 这篇文章关注的 setting 是 offline multi-task MARL;特别的,agent 只在(比如说)三个人合作的场景上训练,然后就可以泛化到任意多个人合作的场景。同学讲的故事是,用 transformer 作为一个翻译器,把三个人的合作动作翻译为多个人的,感觉这个故事听起来非常好。

Rethinking Reward Modeling in Preference-based Large Language Model Alignment

  • arxiv:https://arxiv.org/abs/2411.04991
  • OpenReview:https://openreview.net/forum?id=rfdblE10qm
  • 来源:ICLR 2025 oral。
  • 主要内容:
    • 这篇文章关注 LLM 的 RLHF。据说不采用 bradley-terry model 来建模 reward model,而是直接训一个分类器,学习一个 (x,y) 是好的还剩坏的,然后使用分类器的概率 logit 作为 RLHF 的 reward。
    • 是否使用了非成对的比较 \((x_1, y_1^+, x_2, y_2^-)\),而非把成对比较 \((x, y^+, y^-)\) 打乱(?)
    • 实验是否过于 toy(?)理论大概说了什么(?)

DOPL: Direct Online Preference Learning for Restless Bandits with Preference Feedback

Data Center Cooling System Optimization Using Offline Reinforcement Learning

SpikeLLM: Scaling up Spiking Neural Network to Large Language Models via Saliency-based Spiking

Rethinking Inverse Reinforcement Learning: from Data Alignment to Task Alignment

Why Distillation can Outperform Zero-RL: The Role of Flexible Reasoning

Thinkless: LLM Learns When to Think

Learning to Reason without External Rewards



posted @ 2026-07-01 21:39  MoonOut  阅读(85)  评论(0)    收藏  举报