[论文速通]CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models——思维链与VLA

[2503.22020] CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models

也是紧跟着师兄们的步伐,了解了一下思维链,这个最近比较火的东西

首先什么是思维链

思维链顾名思义就是思维的链(废话)

让大模型可以先思考自己要干什么,再进一步给出解答,而不是直接照本宣科往外崩答案。

这一点在LLM上得到了广泛应用

于是乎,机器人大模型这边也借鉴了相关的思想

今天速通的这篇文章就是这个思路

下面来讲讲具体是如何思维链的吧

1.传统vla的缺陷

像是pi0啊gr00t这些,它们的效果虽然好,但是还是差了点意思(论文里这么说的),因为它们不会思考接下来要干什么

所以对于空间的理解,任务连贯性的理解会比较差

2.如何解决

本文提出了一个方法,利用大模型的推理能力,去预测“下一帧”的世界长什么样

当然这个说法比较笼统,具体实现的话

CoT-VLA选用了跟pi0差不多的结构,都是一个VLM+一个动作生成网络

但是区别就在于,CoT-VLA中让VLM把图像输入信息token化

(这一步很像pi0.5的预训练)

然后利用大模型的回归能力,让它预测接下来的几个视觉token

并和观测一起送入大模型中

(这里有点像卡尔曼滤波嗷,先进行预测,然后再利用真实信息进行修正)

大概就是这么个思想,论文中的阐述是这样的:

传统VLA:

$$\hat{\mathbf{a}}_t \sim P_\theta (\mathbf{a}_t \mid \mathbf{s}_t, l)$$

就是说,动作a是视觉和语言的条件概率

CoT-VLA:

$$\hat{\mathbf{s}}_{t + n} \sim P_{\theta}(\mathbf{s}_{t + n} \mid \mathbf{s}_t, l)$$

看到没,把预测的内容一并加进了动作预测中

(就这么简单粗暴)

3.实验与疑问

说实话,这篇文章感觉有点占坑或者灌水的意思...

pi0大杀四方已经是2024年10月的事了,这篇文章是2025年3月提出的,但完全没敢跟pi0对比,只敢欺负欺负openVLA这个老家伙了

然后效果也没有特别好,只是比openVLA强点有限

那就着重说一下我觉得哪里有问题吧

其实主要就是一点

这个预测实在是太草率了

就是把预测的token和采集的视觉token并排,往动作专家里一扔,完事了

实验上也没有测试消融了预测、消融了真实采集的区别

或许这里有文章可做呢

其实也就差不多了,这篇文章倒是不难理解

记录一下(闲的没事)

 

posted @ 2026-03-25 09:36  阿基米德的澡盆  阅读(88)  评论(0)    收藏  举报