从 GPT Agent 到机器人智能:VLA、RL 和 World Model 是否正在构建机器人的基础模型?

从 GPT Agent 到机器人智能:VLA、RL 和 World Model 是否正在构建机器人的基础模型?

引言:为什么现在重新讨论“机器人 GPT 时刻”?

过去几十年,机器人领域一直存在一个明显矛盾:

机器人的身体越来越强,但机器人的智能提升并没有同步发生。

工业机器人可以:

  • 高精度焊接;
  • 高速搬运;
  • 长时间重复执行任务。

但是面对开放环境,机器人仍然困难:

  • 桌上的物体位置变化;
  • 用户临时修改任务;
  • 环境中出现未知物品;
  • 任务需要多个步骤连续完成。

问题并不是机器人不会运动。

机械臂可以非常精确地控制关节运动。

真正困难的是:

机器人是否理解自己为什么这样做,以及面对变化环境时如何调整行为?

过去机器人主要依靠:

  • 人工设计规则;
  • 感知模块;
  • 规划算法;
  • 控制算法。

而大语言模型的发展带来了新的思路:

如果一个模型已经能够理解语言、图片和复杂任务,那么它是否可以成为机器人的“大脑”?

这推动了近几年几个方向的融合:

  • LLM Agent;
  • Vision-Language-Action(VLA);
  • Reinforcement Learning(RL);
  • World Model。

它们共同试图解决一个问题:

如何让机器人从执行程序,走向理解任务并自主适应环境。


1. GPT Agent 带来的变化:AI 从回答问题到执行任务

1.1 从模型输出到任务闭环

传统大语言模型:


用户问题
↓
LLM
↓
文本回答

模型的任务是:

生成正确的信息。

但是现实世界中的任务不是信息问题。

例如:

帮我整理厨房。

普通 LLM 可以回答:

  • 先整理桌面;
  • 再分类物品;
  • 最后清洁。

但是一个真正执行任务的 Agent,需要:

  1. 观察环境;
  2. 理解当前状态;
  3. 制定计划;
  4. 调用工具或机器人技能;
  5. 根据结果调整。

因此 Agent 的核心变化不是:

“语言模型更聪明”。

而是:

模型开始拥有行动闭环。


1.2 Agent 和机器人的关系

机器人并不是简单连接一个 GPT。

更合理的架构:

graph TD A[用户目标] -->B[LLM Agent] B --> C[任务理解与规划] C --> D[VLA Policy] D --> E[动作生成] E --> F[机器人控制器] F --> G[真实环境] G --> H[状态反馈] H --> B

其中:

LLM Agent

负责:

  • 理解目标;
  • 分解任务;
  • 长程规划。

例如:

“整理厨房”

拆成:

  • 找杯子;
  • 清理桌面;
  • 打开柜门;
  • 放置物品。

VLA

负责:

把任务转化为机器人动作。

例如:

“拿起红色杯子”

转换为:

  • 手臂移动;
  • 调整姿态;
  • 控制夹爪;
  • 抬起杯子。

Controller

负责:

实时控制。

例如:

  • 电机角度;
  • 力反馈;
  • 稳定控制。

因此:

LLM 更像大脑,VLA 更像运动系统,Controller 更像小脑。


2. 为什么机器人过去几十年没有“大模型时刻”?

机器人没有像语言模型一样快速发展的原因,并不是算法落后。

而是机器人面对的问题不同。


2.1 规则系统:可靠,但是难泛化

早期机器人采用:

graph LR A[传感器] -->B[环境识别] -->C[任务规划] -->D[控制执行]

这种方式非常适合工业场景。

例如:

汽车工厂:

机器人固定完成:

  • 拿零件;
  • 焊接;
  • 装配。

优势:

  • 稳定;
  • 可验证;
  • 精度高。

但是问题:

环境必须提前定义。

例如:

任务:

从固定位置抓取零件。

工程师可以设计完整流程。

但是:

找到桌上的红色杯子,然后放入柜子。

就需要解决:

  • 哪个物体是杯子?
  • 哪个是红色?
  • 应该从哪里抓?
  • 如果位置变化怎么办?

传统系统需要重新设计。

机器人并没有理解任务。

它只是执行规则。


2.2 模块化 Pipeline 的瓶颈

传统机器人通常拆成:

  • perception(感知);
  • planning(规划);
  • control(控制)。

这种设计优点:

容易调试。

但是缺点:

模块之间存在信息损失。

例如:

视觉模块:

检测到一个圆柱体。

规划模块需要知道:

这是一个可以抓取的杯子。

控制模块需要知道:

应该抓杯身还是杯柄。

中间每一步都依赖人工定义。


2.3 数据成为新的瓶颈

大模型成功的重要原因:

互联网提供了巨大规模的数据。

语言模型:

文本
↓
数万亿 token
↓
训练

但是机器人:

一次抓取
↓
几秒到几十秒
↓
一条轨迹

数据获取成本完全不同。

机器人数据需要:

  • 真实硬件;
  • 人工操作;
  • 环境搭建;
  • 轨迹记录。

因此机器人领域逐渐认识到:

未来竞争不仅是算法竞争。

更是:

机器人数据规模竞争。


3. VLA 的出现:从 perception-planning-control 到 foundation policy

3.1 VLA 解决什么问题?

VLA:

Vision-Language-Action。

核心思想:

让机器人同时理解:

  • 看到了什么;
  • 人想做什么;
  • 应该如何行动。

例如:

输入:

视觉:

桌面上有多个物体,其中有一个红色杯子。

语言:

拿起红色杯子。

输出:

动作:

移动机械臂 → 调整姿态 → 闭合夹爪 → 抬起杯子。


3.2 VLA 的真正难点:语义到动作的连接

很多人认为:

VLA 只是:

视觉模型 + 语言模型 + 控制模型。

实际上核心问题是:

semantic grounding(语义落地)。

语言空间:

拿起杯子

语义空间:

找到目标物体
判断抓取位置
规划动作

控制空间:

joint trajectory
velocity
force

三个空间之间存在巨大鸿沟。

VLA 的价值:

就是学习:

一个抽象任务,如何映射到具体身体动作。

4. VLA 为什么先靠 BC(Behavior Cloning)

VLA 的早期发展,很大程度依赖一种简单有效的方法:

模仿学习(Imitation Learning)。

核心思想:

让机器人观察专家如何完成任务,然后学习类似行为。


4.1 机器人数据是什么?

语言模型训练数据:


文本 → 文本

而机器人需要:


视觉状态
+
语言目标
+
动作轨迹

例如:

人操作机械臂:

时间 状态
t0 摄像头看到杯子
t1 手臂移动到杯子附近
t2 调整抓取角度
t3 闭合夹爪
t4 抬起杯子

形成:


(observation, instruction, action)

其中:

  • observation:当前环境;
  • instruction:任务目标;
  • action:机器人动作。

模型学习:

在这种状态下,什么动作通常可以完成任务。


4.2 为什么 BC 有吸引力?

Behavior Cloning 的优势:

第一,训练稳定

不像强化学习需要探索。

只需要:


专家数据
↓
监督学习
↓
策略模型


第二,数据利用效率高

机器人真实操作成本很高。

如果一个人完成一次任务:

这条轨迹可以直接用于训练。


第三,容易结合大模型

VLM 已经拥有:

  • 视觉理解;
  • 语言理解;
  • 世界知识。

加入动作数据后,可以自然扩展为 VLA。


但是,BC 有一个根本问题。


5. Distribution Shift:为什么模仿学习无法解决所有问题?

BC 最大的问题:

训练数据来自过去,机器人面对的是未来。

例如:

训练数据:

机器人看到:

杯子在桌子中央。

动作:

从正上方抓取。

但是现实:

杯子靠近桌边。

机器人第一次动作稍微偏离:

后续状态偏离训练分布:

错误越来越大。

这叫:

Distribution Shift(分布偏移)。


可以理解为:

人教机器人:

正确路线怎么走。

但是没有告诉它:

走错以后怎么回来。


因此:

BC 更像:

“复制经验”。

而不是:

“学习解决问题”。

这引出了强化学习。


6. RL 为什么重新进入机器人?

6.1 从模仿到优化

强化学习(Reinforcement Learning)的核心:

不是学习别人怎么做。

而是:

通过环境反馈,寻找更优策略。

基本流程:

graph LR A[策略模型 Policy] -->B[生成动作] B --> C[环境执行] C --> D[获得 Reward] D --> E[更新策略] E --> A

对于机器人:

一次任务:

抓取杯子。

可能有很多方案:

方案 A:

快速抓取,但是容易碰倒。

方案 B:

慢一点,但是稳定。

RL 可以通过 reward 学习:

哪个动作长期效果更好。


6.2 为什么机器人 RL 比游戏 RL 难?

很多人会类比:

AlphaGo、Atari。

但是机器人环境完全不同。

游戏:

  • 环境可复制;
  • 模拟准确;
  • 失败成本低。

机器人:

  • 真实世界复杂;
  • 动作连续;
  • 失败可能损坏设备。

例如:

游戏:

失败:

重新开始。

机器人:

失败:

杯子摔碎。


因此机器人 RL 面临三个核心问题。


6.3 Reward Design:如何定义“好”?

游戏:

胜负明确。

机器人:

很多任务没有简单标准。

例如:

“整理桌面”。

成功是什么?

可能包括:

  • 物品位置正确;
  • 桌面整洁;
  • 时间短;
  • 动作稳定;
  • 能耗低。

reward 如果设计错误:

机器人可能学到奇怪策略。

例如:

目标:

保持桌面干净。

机器人:

直接把所有东西推到地上。

因为:

桌面确实空了。


6.4 Rollout:为什么需要大量环境交互?

RL 需要:

尝试。

流程:

生成动作

↓

环境执行

↓

评价结果

↓

更新策略

一次尝试叫:

rollout。

机器人智能提升,需要大量 rollout。

但是:

真实机器人 rollout 成本极高。

所以出现:

仿真训练。


7. 为什么需要 RoboTwin?

机器人时代需要自己的 ImageNet

视觉领域的发展,有一个重要节点:

ImageNet。

它解决了:

  • 大规模数据;
  • 标准任务;
  • 统一评价。

机器人领域也需要类似基础设施。

原因:

机器人数据太碎片化。

不同研究:

  • 不同机器人;
  • 不同任务;
  • 不同评价方式。

很难比较。


RoboTwin 这类平台尝试提供:

  • 标准化机器人环境;
  • 多任务 benchmark;
  • 自动生成轨迹;
  • 仿真数据。

它解决的问题不是:

“让机器人更聪明”。

而是:

给机器人基础模型提供规模化训练和评价环境。


但是仿真不是现实

这里存在:

Sim2Real Gap。

例如:

仿真:

杯子摩擦系数固定。

现实:

杯子材质不同。

仿真:

光照稳定。

现实:

环境变化。

因此:

仿真可以扩大数据规模。

但不能完全替代真实世界。


8. RLinf:当机器人进入大模型训练时代

当 VLA 规模扩大后,机器人 RL 遇到新的工程问题。

传统 RL:

训练小规模 policy。

但是 VLA:

可能包含:

  • 视觉 backbone;
  • 语言模型;
  • action model。

训练成本大幅增加。


因此需要新的训练基础设施。

类似:

语言模型时代:

DeepSpeed、Megatron。

机器人时代:

需要:

  • 大规模 rollout;
  • 多环境并行;
  • 分布式训练;
  • RL 算法支持。

RLinf 的定位:

不是新的机器人模型。

而是:

让机器人基础模型能够进行 RL 后训练的基础设施。

整体流程:

graph TD A[VLA模型] A --> B[仿真环境] B --> C[大量Rollout] C --> D[Reward计算] D --> E[RL更新] E --> A

9. π0.5、LingBot-VLA、DM0.5:机器人基础模型的不同假设

目前没有一个路线被证明已经解决通用机器人。

不同模型代表不同假设。


路线 核心假设 试图解决的问题 主要挑战
π 系列 大规模数据 + 更好的动作生成可以提升泛化 动作生成质量 机器人数据规模不足
LingBot-VLA 不同机器人可以共享经验 跨 embodiment 泛化 身体差异巨大
DM 类路线 机器人需要更强记忆和长任务能力 复杂任务规划 长期误差累积

9.1 π0.5:动作生成路线

机器人动作不是文本。

例如:

“拿杯子”。

最终需要:

几十个连续控制步骤。

因此关键问题:

如何生成:

  • 平滑;
  • 稳定;
  • 连续;

的动作轨迹。

π 系路线关注:

action generation。

例如:

diffusion / flow matching。

思想:

不是直接预测一个动作。

而是:

从噪声逐渐生成合理轨迹。


9.2 LingBot-VLA:为什么需要跨 embodiment?

机器人最大的特殊性:

身体不同。

人类经验可以迁移:

拿杯子的经验。

但是机器人:

机械臂:

7 DoF。

人形机器人:

几十 DoF。

动作空间完全不同。

所以问题不是:

训练更多机器人。

而是:

如何学习与具体身体无关的机器人能力表示?

这就是:

embodiment generalization。


9.3 DM0.5:为什么长任务成为新挑战?

短任务:

拿杯子

已经比较成熟。

但是现实任务:

整理厨房

↓

找到物品

↓

打开柜子

↓

移动多个物体

↓

完成整理

需要:

  • 记忆;
  • 状态跟踪;
  • 长期规划。

因此另一条路线关注:

robot reasoning。


10. World Model:从试错学习到想象学习

强化学习最大问题:

真实世界试错太贵。

人类不会通过摔坏一万个杯子学会拿杯子。

因为大脑可以预测。

World Model 的思想:

学习一个环境模型。

让机器人:

先想象。

再行动。


例如:

当前状态:

桌上有杯子。

候选动作:

A:

直接抓。

预测:

杯子可能掉落。

B:

调整角度。

预测:

成功概率更高。

选择 B。


流程:

graph TD A[当前环境状态] -->B[World Model] B --> C[预测未来] C --> D[评价动作] D --> E[选择策略] E --> F[机器人执行]

但是 World Model 也有巨大挑战:

真实世界太复杂。

预测:

  • 物理变化;
  • 长期状态;
  • 人类行为;

非常困难。

所以目前更可能:

不是替代 VLA。

而是:

LLM Agent
+
World Model
+
VLA
+
RL

融合。


11. 当前最大问题:机器人是否存在类似 LLM 的 Scaling Law?

这是整个领域最大的未知问题。

语言模型:

更多数据。

更大模型。

能力提升。

机器人是否一样?

目前还没有明确答案。

原因:

数据不像文本容易获得

机器人数据昂贵。


身体差异巨大

不同机器人不能直接共享。


长任务误差累积

短动作成功。

不代表长任务成功。


因此:

机器人是否会出现 GPT-4 这样的能力跃迁,目前仍然是开放问题。


12. 未来机器人系统:Agent + World Model + VLA + Controller

更可能的系统不是:

一个万能模型。

而是多个能力组合:

graph TD A[Human Goal] A --> B[LLM Agent] B --> C[Task Planning] C --> D[World Model] D --> E[VLA Policy] E --> F[Controller] F --> G[Robot] G --> H[Environment Feedback] H --> B

不同模块承担不同职责:

模块 作用
LLM Agent 理解目标、规划任务
World Model 预测未来
VLA 生成机器人行为
Controller 实时控制

结语:机器人智能真正的竞争是什么?

具身智能并不是简单地:

“给机器人接一个 GPT”。

真正的挑战是:

如何建立:

感知
 ↓
理解
 ↓
行动
 ↓
反馈
 ↓
学习

的完整闭环。

VLA 解决:

机器人如何把语言和视觉理解转化为动作。

RL 解决:

机器人如何通过反馈优化。

World Model 尝试解决:

机器人如何低成本预测未来。

未来机器人基础模型是否能够像语言模型一样规模化,目前仍需要时间验证。

但可以确定的是:

机器人正在从“程序控制机器”,逐渐走向“能够理解任务并持续学习的智能体”。

posted @ 2026-09-18 11:27  yong_2333  阅读(7)  评论(0)    收藏  举报