从 GPT Agent 到机器人智能:VLA、RL 和 World Model 是否正在构建机器人的基础模型?
从 GPT Agent 到机器人智能:VLA、RL 和 World Model 是否正在构建机器人的基础模型?
引言:为什么现在重新讨论“机器人 GPT 时刻”?
过去几十年,机器人领域一直存在一个明显矛盾:
机器人的身体越来越强,但机器人的智能提升并没有同步发生。
工业机器人可以:
- 高精度焊接;
- 高速搬运;
- 长时间重复执行任务。
但是面对开放环境,机器人仍然困难:
- 桌上的物体位置变化;
- 用户临时修改任务;
- 环境中出现未知物品;
- 任务需要多个步骤连续完成。
问题并不是机器人不会运动。
机械臂可以非常精确地控制关节运动。
真正困难的是:
机器人是否理解自己为什么这样做,以及面对变化环境时如何调整行为?
过去机器人主要依靠:
- 人工设计规则;
- 感知模块;
- 规划算法;
- 控制算法。
而大语言模型的发展带来了新的思路:
如果一个模型已经能够理解语言、图片和复杂任务,那么它是否可以成为机器人的“大脑”?
这推动了近几年几个方向的融合:
- LLM Agent;
- Vision-Language-Action(VLA);
- Reinforcement Learning(RL);
- World Model。
它们共同试图解决一个问题:
如何让机器人从执行程序,走向理解任务并自主适应环境。
1. GPT Agent 带来的变化:AI 从回答问题到执行任务
1.1 从模型输出到任务闭环
传统大语言模型:
用户问题
↓
LLM
↓
文本回答
模型的任务是:
生成正确的信息。
但是现实世界中的任务不是信息问题。
例如:
帮我整理厨房。
普通 LLM 可以回答:
- 先整理桌面;
- 再分类物品;
- 最后清洁。
但是一个真正执行任务的 Agent,需要:
- 观察环境;
- 理解当前状态;
- 制定计划;
- 调用工具或机器人技能;
- 根据结果调整。
因此 Agent 的核心变化不是:
“语言模型更聪明”。
而是:
模型开始拥有行动闭环。
1.2 Agent 和机器人的关系
机器人并不是简单连接一个 GPT。
更合理的架构:
其中:
LLM Agent
负责:
- 理解目标;
- 分解任务;
- 长程规划。
例如:
“整理厨房”
拆成:
- 找杯子;
- 清理桌面;
- 打开柜门;
- 放置物品。
VLA
负责:
把任务转化为机器人动作。
例如:
“拿起红色杯子”
转换为:
- 手臂移动;
- 调整姿态;
- 控制夹爪;
- 抬起杯子。
Controller
负责:
实时控制。
例如:
- 电机角度;
- 力反馈;
- 稳定控制。
因此:
LLM 更像大脑,VLA 更像运动系统,Controller 更像小脑。
2. 为什么机器人过去几十年没有“大模型时刻”?
机器人没有像语言模型一样快速发展的原因,并不是算法落后。
而是机器人面对的问题不同。
2.1 规则系统:可靠,但是难泛化
早期机器人采用:
这种方式非常适合工业场景。
例如:
汽车工厂:
机器人固定完成:
- 拿零件;
- 焊接;
- 装配。
优势:
- 稳定;
- 可验证;
- 精度高。
但是问题:
环境必须提前定义。
例如:
任务:
从固定位置抓取零件。
工程师可以设计完整流程。
但是:
找到桌上的红色杯子,然后放入柜子。
就需要解决:
- 哪个物体是杯子?
- 哪个是红色?
- 应该从哪里抓?
- 如果位置变化怎么办?
传统系统需要重新设计。
机器人并没有理解任务。
它只是执行规则。
2.2 模块化 Pipeline 的瓶颈
传统机器人通常拆成:
- perception(感知);
- planning(规划);
- control(控制)。
这种设计优点:
容易调试。
但是缺点:
模块之间存在信息损失。
例如:
视觉模块:
检测到一个圆柱体。
规划模块需要知道:
这是一个可以抓取的杯子。
控制模块需要知道:
应该抓杯身还是杯柄。
中间每一步都依赖人工定义。
2.3 数据成为新的瓶颈
大模型成功的重要原因:
互联网提供了巨大规模的数据。
语言模型:
文本
↓
数万亿 token
↓
训练
但是机器人:
一次抓取
↓
几秒到几十秒
↓
一条轨迹
数据获取成本完全不同。
机器人数据需要:
- 真实硬件;
- 人工操作;
- 环境搭建;
- 轨迹记录。
因此机器人领域逐渐认识到:
未来竞争不仅是算法竞争。
更是:
机器人数据规模竞争。
3. VLA 的出现:从 perception-planning-control 到 foundation policy
3.1 VLA 解决什么问题?
VLA:
Vision-Language-Action。
核心思想:
让机器人同时理解:
- 看到了什么;
- 人想做什么;
- 应该如何行动。
例如:
输入:
视觉:
桌面上有多个物体,其中有一个红色杯子。
语言:
拿起红色杯子。
输出:
动作:
移动机械臂 → 调整姿态 → 闭合夹爪 → 抬起杯子。
3.2 VLA 的真正难点:语义到动作的连接
很多人认为:
VLA 只是:
视觉模型 + 语言模型 + 控制模型。
实际上核心问题是:
semantic grounding(语义落地)。
语言空间:
拿起杯子
语义空间:
找到目标物体
判断抓取位置
规划动作
控制空间:
joint trajectory
velocity
force
三个空间之间存在巨大鸿沟。
VLA 的价值:
就是学习:
一个抽象任务,如何映射到具体身体动作。
4. VLA 为什么先靠 BC(Behavior Cloning)
VLA 的早期发展,很大程度依赖一种简单有效的方法:
模仿学习(Imitation Learning)。
核心思想:
让机器人观察专家如何完成任务,然后学习类似行为。
4.1 机器人数据是什么?
语言模型训练数据:
文本 → 文本
而机器人需要:
视觉状态
+
语言目标
+
动作轨迹
例如:
人操作机械臂:
| 时间 | 状态 |
|---|---|
| t0 | 摄像头看到杯子 |
| t1 | 手臂移动到杯子附近 |
| t2 | 调整抓取角度 |
| t3 | 闭合夹爪 |
| t4 | 抬起杯子 |
形成:
(observation, instruction, action)
其中:
- observation:当前环境;
- instruction:任务目标;
- action:机器人动作。
模型学习:
在这种状态下,什么动作通常可以完成任务。
4.2 为什么 BC 有吸引力?
Behavior Cloning 的优势:
第一,训练稳定
不像强化学习需要探索。
只需要:
专家数据
↓
监督学习
↓
策略模型
第二,数据利用效率高
机器人真实操作成本很高。
如果一个人完成一次任务:
这条轨迹可以直接用于训练。
第三,容易结合大模型
VLM 已经拥有:
- 视觉理解;
- 语言理解;
- 世界知识。
加入动作数据后,可以自然扩展为 VLA。
但是,BC 有一个根本问题。
5. Distribution Shift:为什么模仿学习无法解决所有问题?
BC 最大的问题:
训练数据来自过去,机器人面对的是未来。
例如:
训练数据:
机器人看到:
杯子在桌子中央。
动作:
从正上方抓取。
但是现实:
杯子靠近桌边。
机器人第一次动作稍微偏离:
↓
后续状态偏离训练分布:
↓
错误越来越大。
这叫:
Distribution Shift(分布偏移)。
可以理解为:
人教机器人:
正确路线怎么走。
但是没有告诉它:
走错以后怎么回来。
因此:
BC 更像:
“复制经验”。
而不是:
“学习解决问题”。
这引出了强化学习。
6. RL 为什么重新进入机器人?
6.1 从模仿到优化
强化学习(Reinforcement Learning)的核心:
不是学习别人怎么做。
而是:
通过环境反馈,寻找更优策略。
基本流程:
对于机器人:
一次任务:
抓取杯子。
可能有很多方案:
方案 A:
快速抓取,但是容易碰倒。
方案 B:
慢一点,但是稳定。
RL 可以通过 reward 学习:
哪个动作长期效果更好。
6.2 为什么机器人 RL 比游戏 RL 难?
很多人会类比:
AlphaGo、Atari。
但是机器人环境完全不同。
游戏:
- 环境可复制;
- 模拟准确;
- 失败成本低。
机器人:
- 真实世界复杂;
- 动作连续;
- 失败可能损坏设备。
例如:
游戏:
失败:
重新开始。
机器人:
失败:
杯子摔碎。
因此机器人 RL 面临三个核心问题。
6.3 Reward Design:如何定义“好”?
游戏:
胜负明确。
机器人:
很多任务没有简单标准。
例如:
“整理桌面”。
成功是什么?
可能包括:
- 物品位置正确;
- 桌面整洁;
- 时间短;
- 动作稳定;
- 能耗低。
reward 如果设计错误:
机器人可能学到奇怪策略。
例如:
目标:
保持桌面干净。
机器人:
直接把所有东西推到地上。
因为:
桌面确实空了。
6.4 Rollout:为什么需要大量环境交互?
RL 需要:
尝试。
流程:
生成动作
↓
环境执行
↓
评价结果
↓
更新策略
一次尝试叫:
rollout。
机器人智能提升,需要大量 rollout。
但是:
真实机器人 rollout 成本极高。
所以出现:
仿真训练。
7. 为什么需要 RoboTwin?
机器人时代需要自己的 ImageNet
视觉领域的发展,有一个重要节点:
ImageNet。
它解决了:
- 大规模数据;
- 标准任务;
- 统一评价。
机器人领域也需要类似基础设施。
原因:
机器人数据太碎片化。
不同研究:
- 不同机器人;
- 不同任务;
- 不同评价方式。
很难比较。
RoboTwin 这类平台尝试提供:
- 标准化机器人环境;
- 多任务 benchmark;
- 自动生成轨迹;
- 仿真数据。
它解决的问题不是:
“让机器人更聪明”。
而是:
给机器人基础模型提供规模化训练和评价环境。
但是仿真不是现实
这里存在:
Sim2Real Gap。
例如:
仿真:
杯子摩擦系数固定。
现实:
杯子材质不同。
仿真:
光照稳定。
现实:
环境变化。
因此:
仿真可以扩大数据规模。
但不能完全替代真实世界。
8. RLinf:当机器人进入大模型训练时代
当 VLA 规模扩大后,机器人 RL 遇到新的工程问题。
传统 RL:
训练小规模 policy。
但是 VLA:
可能包含:
- 视觉 backbone;
- 语言模型;
- action model。
训练成本大幅增加。
因此需要新的训练基础设施。
类似:
语言模型时代:
DeepSpeed、Megatron。
机器人时代:
需要:
- 大规模 rollout;
- 多环境并行;
- 分布式训练;
- RL 算法支持。
RLinf 的定位:
不是新的机器人模型。
而是:
让机器人基础模型能够进行 RL 后训练的基础设施。
整体流程:
9. π0.5、LingBot-VLA、DM0.5:机器人基础模型的不同假设
目前没有一个路线被证明已经解决通用机器人。
不同模型代表不同假设。
| 路线 | 核心假设 | 试图解决的问题 | 主要挑战 |
|---|---|---|---|
| π 系列 | 大规模数据 + 更好的动作生成可以提升泛化 | 动作生成质量 | 机器人数据规模不足 |
| LingBot-VLA | 不同机器人可以共享经验 | 跨 embodiment 泛化 | 身体差异巨大 |
| DM 类路线 | 机器人需要更强记忆和长任务能力 | 复杂任务规划 | 长期误差累积 |
9.1 π0.5:动作生成路线
机器人动作不是文本。
例如:
“拿杯子”。
最终需要:
几十个连续控制步骤。
因此关键问题:
如何生成:
- 平滑;
- 稳定;
- 连续;
的动作轨迹。
π 系路线关注:
action generation。
例如:
diffusion / flow matching。
思想:
不是直接预测一个动作。
而是:
从噪声逐渐生成合理轨迹。
9.2 LingBot-VLA:为什么需要跨 embodiment?
机器人最大的特殊性:
身体不同。
人类经验可以迁移:
拿杯子的经验。
但是机器人:
机械臂:
7 DoF。
人形机器人:
几十 DoF。
动作空间完全不同。
所以问题不是:
训练更多机器人。
而是:
如何学习与具体身体无关的机器人能力表示?
这就是:
embodiment generalization。
9.3 DM0.5:为什么长任务成为新挑战?
短任务:
拿杯子
已经比较成熟。
但是现实任务:
整理厨房
↓
找到物品
↓
打开柜子
↓
移动多个物体
↓
完成整理
需要:
- 记忆;
- 状态跟踪;
- 长期规划。
因此另一条路线关注:
robot reasoning。
10. World Model:从试错学习到想象学习
强化学习最大问题:
真实世界试错太贵。
人类不会通过摔坏一万个杯子学会拿杯子。
因为大脑可以预测。
World Model 的思想:
学习一个环境模型。
让机器人:
先想象。
再行动。
例如:
当前状态:
桌上有杯子。
候选动作:
A:
直接抓。
预测:
杯子可能掉落。
B:
调整角度。
预测:
成功概率更高。
选择 B。
流程:
但是 World Model 也有巨大挑战:
真实世界太复杂。
预测:
- 物理变化;
- 长期状态;
- 人类行为;
非常困难。
所以目前更可能:
不是替代 VLA。
而是:
LLM Agent
+
World Model
+
VLA
+
RL
融合。
11. 当前最大问题:机器人是否存在类似 LLM 的 Scaling Law?
这是整个领域最大的未知问题。
语言模型:
更多数据。
更大模型。
能力提升。
机器人是否一样?
目前还没有明确答案。
原因:
数据不像文本容易获得
机器人数据昂贵。
身体差异巨大
不同机器人不能直接共享。
长任务误差累积
短动作成功。
不代表长任务成功。
因此:
机器人是否会出现 GPT-4 这样的能力跃迁,目前仍然是开放问题。
12. 未来机器人系统:Agent + World Model + VLA + Controller
更可能的系统不是:
一个万能模型。
而是多个能力组合:
不同模块承担不同职责:
| 模块 | 作用 |
|---|---|
| LLM Agent | 理解目标、规划任务 |
| World Model | 预测未来 |
| VLA | 生成机器人行为 |
| Controller | 实时控制 |
结语:机器人智能真正的竞争是什么?
具身智能并不是简单地:
“给机器人接一个 GPT”。
真正的挑战是:
如何建立:
感知
↓
理解
↓
行动
↓
反馈
↓
学习
的完整闭环。
VLA 解决:
机器人如何把语言和视觉理解转化为动作。
RL 解决:
机器人如何通过反馈优化。
World Model 尝试解决:
机器人如何低成本预测未来。
未来机器人基础模型是否能够像语言模型一样规模化,目前仍需要时间验证。
但可以确定的是:
机器人正在从“程序控制机器”,逐渐走向“能够理解任务并持续学习的智能体”。
浙公网安备 33010602011771号