[论文速通]TIDAL: Temporally Interleaved Diffusion and Action Loop for High-Frequency VLA Control
再开个专题吧,把读到的一些论文总结一下。
水平实在是有限,就写一下我的精读结果,和其中的一些问题
那么,今天读到的论文是
TIDAL: Temporally Interleaved Diffusion and Action Loop for High-Frequency VLA Control
https://arxiv.org/abs/2601.14945v1
就是某种VLA的解耦加速算法
1.简介
首先,文章介绍了一些主流VLA的速度计算瓶颈,比如最熟悉的pi0,它的轨迹规划过程是想一步动一步,也就是动作专家与骨干网络在每一次机器人运动时都要全部前向传播一次。
虽然pi0的网络参数只有3.3b左右,但仍旧不能达到实时规划
并且,VLA的控制是开环控制,也就是将运动指令输入给电机,就没有下文了。
文章介绍了几种主流的VLA加速方式,包括蒸馏量化(SmolVLA、RoboMamba)静态压缩与自适应推理(BitVLA、FlashVLA)异步推理(VLASH、SpecVLA)语义信息解耦(DuoCore-FS、Fast-in-Slow)。本文也属于第四种方法。
简单介绍一下第四种方法,最新研究发现,VLA中的信息,语义、图像、动作信息之中,语义信息往往是更新频率很慢的,但处理
它们却要调用transformer,总之就是很慢。但在语义信息没有更新之前,就会被重复计算很多次。那么,是不是只要把语义信息给掩码上(思路上是这样,具体实现方法还是比较复杂的),就可以连续多次不用计算语义信息,省去了很大一部分的计算量,从而达到了加速的目的。
这里的低频语义信息,大概是怎么个意思呢。
举个例子,我对VLA说:拿起苹果
在完成这个任务之前,无论我把苹果拿到哪里,对于VLA来说,只是V这个维度的变化。所以,不需要让VLA每次行动都想我究竟要干什么这件事。
2.核心方法介绍
如同上面所说的,思路就是这么个思路,具体的实现过程来介绍一下(其实我也没太看懂)。本篇论文主要是在NVIDIA的开源模型GR00T的基础上修改而成,主干框架没有什么太大变化,主要是通过修改了一部分架构、添加组件、修改训练方法这三个方面来达到目标。
a.架构方面的改进
首先,添加了一个语义缓存管理器,顾名思义,就是用来缓存低频更新的语义信息。
其次,添加了一个小的cnn网络,用来预测背景中的物体的运动信息,为VLA增添了小部分的动态追踪性能
最后,为了防止VLA抖动,添加了一个状态融合与接触门控系统,它算是一个状态开关?就是在抓住运动的物体前后的处理逻辑的开关,差不多就是这种意思。
b.算法机制方面的改进
这方面的改进比较多
首先,是从同步推理到异步推理的改进,这也是最核心最核心的改进。
这里用到了a中的语义缓存管理器。
TIDAL的推理过程大致是这样:
第一个周期,先计算一次完整的语言视觉动作信息,并且把第一次处理的语言信息存入缓存器。
第二个周期,在传统VLA中,应该再一次从头推理语言视觉动作信息,但由于语义信息没有变,所以不再计算语义信息,而是直接把刚刚缓存的语义信息拿出来使用
这就是算法方面最大的改进。比较直观。
其次,是训练过程
为了适配异步推理,论文提出了一种类似于语义对齐(反正我感觉像)的方法
具体来说
拿熟悉的pi0举例,首先是它的动作令牌。pi0将语义视觉动作信息统一化为tokens,并且进行对其,之后一股脑塞进transformer。
在TIDAL中
拿4步的推理举例,pi0的动作令牌与TIDAL的动作令牌差别:
pi0:
语义1 语义2 语义3 语义4
视觉1 视觉2 视觉3 视觉4
动作1 动作2 动作3 动作4
TIDAL:
语义1 语义1 语义1 语义1
视觉1 视觉2 视觉3 视觉4
动作1 动作2 动作3 动作4
大概就是这种意思,把语义信息复制粘贴,用遮罩把原本的信息给蒙住
这样就能够训练了
再后,是关于流匹配的优化
TIDAL采用了类似MPC的滚动窗口规划,即预测多步动作,但只使用第一步动作。
于是,流匹配的预测不能够像pi0那样均匀预测,要对前几步的预测过程进行一定优化,也就是优化t≈0处的向量场
loss = ||v_θ(ψ_t(x0,x1), t, s_t, I_t) - (x1-x0)||^2#流匹配损失函数 loss = ||v_θ(ψ_t(x0,x1), t, s_k, ℰ_0) - (x1-x0)||^2#改进后的损失函数 #优先保证前几步预测的准确
到此,大概就是TIDAL的所有的成果了
3.问题与展望
一个很明显的问题,语义信息虽然是低频更新的,但也是在更新的。
如果,在某次不用计算语义信息的周期内,语义信息发生了改变,是否会带来执行的错误?
作者在文章中明确提出了,确实,这会带来一定程度上的成功率损失。
而动态任务的成功率提升,作者也在消融实验中提出了,动态任务的成功率主要是由于门控器与动态预测的作用。
这篇论文主要的成果主要还是在计算效率上的提升,而并非效果的提升。
作者也提出了一些解决方案,如截断、语义判断之类的
(严重怀疑这是作者占坑用的)
4.小编的话
通篇读下来,除了感觉有点难以理解之外,感觉还是常规操作,也就是空间换时间这一块。顺带也看了一下NVIDIA训练GR00T的过程,几万个H100小时的计算...那确实是很有计算了

浙公网安备 33010602011771号