[论文速通]Reinforcement Learning for Flow-Matching Policies——流匹配概率生成与GRPO探索

由于上学期读了pi0 pi0.5一家,所以是想了解一下流匹配如何做策略生成以及奖励函数生成

然后就偶然看到了这一篇文章

[2507.15073] Reinforcement Learning for Flow-Matching Policies

虽然不是纯血的流匹配生成,但是也了解了一些相关内容

也了解了其他一些内容

尝试讲一下吧,但是因为是日常读,所以中间那一大堆策略和数学实在是没有细读...

(顺便一提,感觉ai的助力不在于能帮你总结啊什么的,而是在于提问之后它能回答。这里我反而借鉴了机器学习的模式,不停犯错不停提问,直到大概理解这篇文章)

1.遇到的问题

本文提出了两个问题,

a.人类提供的策略样本有优劣之分,但在训练时的权重都一样,而纯种流匹配只会模仿而不能分辨策略的好坏;

b.人类提供的策略样本不一定是最优,也许有超脱咱们理解范围的最优策略存在。

(总之就是:人越是工于心计越是发现人类是有极限的所以我不做人类了JOJO)

 于是,本文提出了两种解决方法

针对a,对于策略,设计一个判别器,对于好的策略会产生更大的奖励,差的策略产生更小的奖励

针对b,在模型中加入一个探索器,对于策略序列进行拓展与探索

具体的实现还是有不少问题的,我觉得我没法很好地整理成条理清晰地路线,那还是以Q&A的形式展开吧

Q1:标准流匹配有“奖励”这个东西嘛?不应该是loss嘛

A1:是的,是loss没错。但是其实也是差不多的,就是好的策略会产生更大的梯度,促进模型学习。

 

Q2:判别器是什么?如何实现?

A2:判别器就是一个类似actor-critic中那个价值网络的东西,用来评估策略的好坏

这篇文章里的两种方法,提供了两种判别器,这个问题就先说针对问题a的

文章里提到大概有好几种方法,由人类计算出的多项式奖励(解决问题a就是这个方法,直接加了一个系数),由另外一个神经网络计算出的(这怎么不算一种流匹配生成奖励函数呢)

 

Q3:如果是用流匹配做奖励函数生成,那么评估策略的流匹配是不是也需要另外一个评估器?评估器是不是也可以用流匹配或者什么来评估?这么套娃上去会越来越简单吗?有明确的证明吗?

A3:这个问题从看了pi0的动作专家就开始疑惑了

很遗憾,套娃会使得模型变得极度不可控,目前也没有明确的证明说可以递归训练达到更好的效果。

所以大部分工作也只能套娃两层(或许这也是一个方向?)

 

Q4:探索是怎么实现的?

A4:在原始的dqn,是通过epsilon-greedy算法实现探索,在策略梯度里,是使用网络随机初始化,生成的概率分布随机采样进行的探索

而这篇文章所提供的方法是:

在策略序列上叠加一个高斯分布

具体过程,举例分析

原始轨迹: 1 1 2 2 1 1 2
              ↑
        以第3个数为中心
              ↓
加高斯凸起后: 1 1 3 2 1 1 2
            (中间凸起)

(感谢ds老师提供的可视化)

接下来,再对策略进行物理裁切,比如只有12两种状态,但是出现了3,把3裁切成2,符合物理规律。

本篇文章是对整体策略序列进行的探索,之后再对策略序列进行价值评估

 

2.实验

本文设置了一个场景,就是一个小车,有多个指标:少撞墙啊,速度快点啊,朝向啊什么的

实验1:

image

虚线:提供的次优策略(不给出最优策略是为了测试模型的探索能力)

蓝线:标准流匹配,很明显只能模仿,而且模仿效果不错哦(笑

粉线代表了解决问题1的模型,效果会好不少

黄线代表了解决问题2的模型,效果更好了,说明模型探索出了更优的策略

然后不同的图标代表了不同的奖励函数,posion就是目标点奖励,wall是不能撞墙等等

总之就是效果变好了

那这篇只看了大半天的论文也就差不多到这了

 


 

posted @ 2026-03-18 16:23  阿基米德的澡盆  阅读(48)  评论(0)    收藏  举报