[论文速通]CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models——思维链与VLA
[2503.22020] CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models
也是紧跟着师兄们的步伐,了解了一下思维链,这个最近比较火的东西
首先什么是思维链
思维链顾名思义就是思维的链(废话)
让大模型可以先思考自己要干什么,再进一步给出解答,而不是直接照本宣科往外崩答案。
这一点在LLM上得到了广泛应用
于是乎,机器人大模型这边也借鉴了相关的思想
今天速通的这篇文章就是这个思路
下面来讲讲具体是如何思维链的吧
1.传统vla的缺陷
像是pi0啊gr00t这些,它们的效果虽然好,但是还是差了点意思(论文里这么说的),因为它们不会思考接下来要干什么
所以对于空间的理解,任务连贯性的理解会比较差
2.如何解决
本文提出了一个方法,利用大模型的推理能力,去预测“下一帧”的世界长什么样
当然这个说法比较笼统,具体实现的话
CoT-VLA选用了跟pi0差不多的结构,都是一个VLM+一个动作生成网络
但是区别就在于,CoT-VLA中让VLM把图像输入信息token化
(这一步很像pi0.5的预训练)
然后利用大模型的回归能力,让它预测接下来的几个视觉token
并和观测一起送入大模型中
(这里有点像卡尔曼滤波嗷,先进行预测,然后再利用真实信息进行修正)
大概就是这么个思想,论文中的阐述是这样的:
传统VLA:
$$\hat{\mathbf{a}}_t \sim P_\theta (\mathbf{a}_t \mid \mathbf{s}_t, l)$$
就是说,动作a是视觉和语言的条件概率
CoT-VLA:
$$\hat{\mathbf{s}}_{t + n} \sim P_{\theta}(\mathbf{s}_{t + n} \mid \mathbf{s}_t, l)$$
看到没,把预测的内容一并加进了动作预测中
(就这么简单粗暴)
3.实验与疑问
说实话,这篇文章感觉有点占坑或者灌水的意思...
pi0大杀四方已经是2024年10月的事了,这篇文章是2025年3月提出的,但完全没敢跟pi0对比,只敢欺负欺负openVLA这个老家伙了
然后效果也没有特别好,只是比openVLA强点有限
那就着重说一下我觉得哪里有问题吧
其实主要就是一点
这个预测实在是太草率了
就是把预测的token和采集的视觉token并排,往动作专家里一扔,完事了
实验上也没有测试消融了预测、消融了真实采集的区别
或许这里有文章可做呢
其实也就差不多了,这篇文章倒是不难理解
记录一下(闲的没事)

浙公网安备 33010602011771号