[论文速通]Reinforcement Learning for Flow-Matching Policies——流匹配概率生成与GRPO探索
由于上学期读了pi0 pi0.5一家,所以是想了解一下流匹配如何做策略生成以及奖励函数生成
然后就偶然看到了这一篇文章
[2507.15073] Reinforcement Learning for Flow-Matching Policies
虽然不是纯血的流匹配生成,但是也了解了一些相关内容
也了解了其他一些内容
尝试讲一下吧,但是因为是日常读,所以中间那一大堆策略和数学实在是没有细读...
(顺便一提,感觉ai的助力不在于能帮你总结啊什么的,而是在于提问之后它能回答。这里我反而借鉴了机器学习的模式,不停犯错不停提问,直到大概理解这篇文章)
1.遇到的问题
本文提出了两个问题,
a.人类提供的策略样本有优劣之分,但在训练时的权重都一样,而纯种流匹配只会模仿而不能分辨策略的好坏;
b.人类提供的策略样本不一定是最优,也许有超脱咱们理解范围的最优策略存在。
(总之就是:人越是工于心计越是发现人类是有极限的所以我不做人类了JOJO)
于是,本文提出了两种解决方法
针对a,对于策略,设计一个判别器,对于好的策略会产生更大的奖励,差的策略产生更小的奖励
针对b,在模型中加入一个探索器,对于策略序列进行拓展与探索
具体的实现还是有不少问题的,我觉得我没法很好地整理成条理清晰地路线,那还是以Q&A的形式展开吧
Q1:标准流匹配有“奖励”这个东西嘛?不应该是loss嘛
A1:是的,是loss没错。但是其实也是差不多的,就是好的策略会产生更大的梯度,促进模型学习。
Q2:判别器是什么?如何实现?
A2:判别器就是一个类似actor-critic中那个价值网络的东西,用来评估策略的好坏
这篇文章里的两种方法,提供了两种判别器,这个问题就先说针对问题a的
文章里提到大概有好几种方法,由人类计算出的多项式奖励(解决问题a就是这个方法,直接加了一个系数),由另外一个神经网络计算出的(这怎么不算一种流匹配生成奖励函数呢)
Q3:如果是用流匹配做奖励函数生成,那么评估策略的流匹配是不是也需要另外一个评估器?评估器是不是也可以用流匹配或者什么来评估?这么套娃上去会越来越简单吗?有明确的证明吗?
A3:这个问题从看了pi0的动作专家就开始疑惑了
很遗憾,套娃会使得模型变得极度不可控,目前也没有明确的证明说可以递归训练达到更好的效果。
所以大部分工作也只能套娃两层(或许这也是一个方向?)
Q4:探索是怎么实现的?
A4:在原始的dqn,是通过epsilon-greedy算法实现探索,在策略梯度里,是使用网络随机初始化,生成的概率分布随机采样进行的探索
而这篇文章所提供的方法是:
在策略序列上叠加一个高斯分布
具体过程,举例分析
原始轨迹: 1 1 2 2 1 1 2
↑
以第3个数为中心
↓
加高斯凸起后: 1 1 3 2 1 1 2
(中间凸起)
(感谢ds老师提供的可视化)
接下来,再对策略进行物理裁切,比如只有12两种状态,但是出现了3,把3裁切成2,符合物理规律。
本篇文章是对整体策略序列进行的探索,之后再对策略序列进行价值评估
2.实验
本文设置了一个场景,就是一个小车,有多个指标:少撞墙啊,速度快点啊,朝向啊什么的
实验1:

虚线:提供的次优策略(不给出最优策略是为了测试模型的探索能力)
蓝线:标准流匹配,很明显只能模仿,而且模仿效果不错哦(笑
粉线代表了解决问题1的模型,效果会好不少
黄线代表了解决问题2的模型,效果更好了,说明模型探索出了更优的策略
然后不同的图标代表了不同的奖励函数,posion就是目标点奖励,wall是不能撞墙等等
总之就是效果变好了
那这篇只看了大半天的论文也就差不多到这了

浙公网安备 33010602011771号