Fork me on GitHub

从视觉—语言—动作模型到全身自主系统:研究进展、产业格局与 2026—2030 路线判断

 

具身智能 / 人形机器人
技术与产业前沿报告

从视觉语言动作模型到全身自主系统:研究进展、产业格局与 2026—2030 路线判断

国际论文、顶会、标准与企业一手资料综合研究

资料截止:2026821
版本:V1.0

 

阅读说明与研究方法

本报告面向技术决策、产业研究与战略规划。研究对象包括具身智能的通用方法论,以及以双足人形、轮式人形和双臂移动操作平台为代表的物理载体。检索优先级依次为:同行评审论文与会议正式论文、国际标准和政府文件、机构技术报告与开源项目、企业官方披露。对尚未同行评审的预印本和企业演示,均按较低证据等级处理。

证据等级

来源类型

报告中的使用方式

A

同行评审顶会/期刊、国际标准、官方统计

用于确认可复现方法、基准结果和合规要求

B

权威机构技术报告、开源模型/数据集项目页

用于追踪尚在快速演化的技术路线

C

企业官方产品、客户合作与部署披露

用于判断工程方向;不等同于独立验证

D

预印本、实验室演示与前瞻判断

仅作为弱信号,明确标注不确定性

 

检索窗口以 2023—2026 年为主,并回溯 RT-2Diffusion Policy 等关键奠基工作。对成功率”“吞吐”“量产”“订单等口径,只有在原始来源明确说明测试任务、时间范围或商业合同性质时才引用;跨平台成功率通常不可直接横向比较。

一句话结论|具身智能正在形成语义推理层视觉运动策略层高频稳定控制层的分层栈;人形机器人已越过纯运动展示期,进入制造与物流的窄任务商业验证期,但离无需人工看护、可跨场景迁移的通用劳动力仍有数量级差距。

 

目录

  • · 执行摘要
  • · 1. 范畴、技术栈与产业坐标
  • · 2. 2024—2026 技术前沿
  • · 3. 人形机器人硬件与系统工程
  • · 4. 产业格局与商业化进展
  • · 5. 核心瓶颈、风险与标准
  • · 6. 2026—2030 趋势情景与行动建议
  • · 附录:关键论文/项目导读与参考文献

 

执行摘要

核心判断

  • · 范式已经改变:机器人软件从感知模块 + 任务规划 + 手工控制器的串联系统,快速转向由视觉、语言、状态和动作统一建模的 VLA/通用策略;但产品级系统并未抛弃传统控制,而是把学习策略置于有安全边界的分层控制栈中。
  • · 全身自主是 2026 年最重要的前沿分水岭。Helix 02Gemini Robotics 2 以及 WholeBodyVLAOpenHLM 等研究信号,都在把移动、双臂操作、平衡与触觉从多个独立策略收敛为统一的 loco-manipulation(移动操作)问题。[16][17][31][32]
  • · 数据而非参数量,是当前最硬的约束。Open X-Embodiment 100 +轨迹、DROID 7.6 万条示范、π0 的约 1 万小时灵巧数据、Humanoid Everyday 1.03 万条轨迹,仍远小于互联网模型的数据规模,而且动作空间、传感器和机器人形态高度异构。[2][5][8][29]
  • · 人类视频 机器人动作是潜在的数据规模突破口,但形态差异、接触力不可观测、失败数据缺失和安全约束意味着视频不能直接替代机器人交互数据。近年的 H2OHumanPlusHuman2LocoManFigure Go-Big 等工作说明跨具身迁移正在从表征预训练迈向动作迁移。[20][21][25][34]
  • · 硬件竞争从能走转向可维护地干活。关键指标不再只是自由度和峰值扭矩,而是抓取覆盖率、触觉与掌内视觉、跌倒管理、热设计、电池换装、平均无故障时间、远程介入率、现场恢复时间和安全认证。
  • · 商业化最先发生在棕地制造和物流。固定物料、标准料箱、可封闭区域和可计算节拍,使投资回报更可验证。Agility Digit GXO 的多年 RaaSApptronik 与梅赛德斯-奔驰的试点、Boston Dynamics Atlas 在现代汽车体系内的部署,代表单任务 多任务 同一硬件的软件复用路径。[40][41][42]
  • · 行业仍处在受控场景可用、开放世界不稳的阶段。实验室成功率经常掩盖了恢复时间、异常工况、人员靠近、物体破损、网络中断和长期漂移。VLA-ArenaSafeVLASentinel 等工作显示,记忆化、长时序失败和安全盲区仍很普遍。[35][36][37]
  • · 中国的竞争优势更偏向供应链、成本下降速度和场景密度;美国优势更偏向基础模型、资本、芯片/仿真平台和头部软件团队;欧洲与日本在工业客户、精密机电、安全标准与系统集成上更强。最终胜负不会由单一整机参数决定,而由数据闭环 × 可靠性工程 × 制造良率 × 客户集成共同决定。

成熟度判断(截至 2026-08

能力域

研究成熟度

产品成熟度

关键缺口

平地双足运动

中高

长周期可靠性、跌倒安全、复杂地面

受控场景料箱搬运

中高

节拍、人工介入率、与 WMS/MES 集成

桌面双臂操作

中高

中低

长尾物体、遮挡、力控与失败恢复

灵巧手精细操作

耐久、标定、触觉数据、成本

全身移动操作

高维耦合、碰撞、安全与长时序

开放世界家庭任务

中低

很低

环境长尾、成本、隐私、安全与服务网络

跨机器人通用策略

动作空间统一、形态迁移、标准化评测

 

决策含义|未来 24 个月不宜把通用人形作为单一采购品类,而应把项目拆成任务可行性、现场工程、安全认证、数据闭环和单位经济性五个并行门槛。可复制部署的领先指标是:连续自主运行小时、每千次动作人工介入、任务切换成本与全生命周期每有效工时成本。

 

 

1. 范畴、技术栈与产业坐标

1.1 什么是具身智能

具身智能不是给机器人接入一个大语言模型。其核心是智能体通过身体与环境闭环交互,把视觉、触觉、本体感觉、语言和历史状态转化为可执行动作,并利用动作后果继续更新状态估计与策略。身体形态、执行器带宽、传感器位置、接触动力学和安全约束都会改变可学习的策略空间。因此,同一模型在机械臂、轮式双臂和双足人形上的能力并不等价。

人形形态的产业价值来自兼容以人为尺度设计的棕地环境:门、楼梯、货架、工具和工位无需整体重建。但这是一种系统适配优势,不是所有任务的机械效率最优解。对于平整地面上的高吞吐搬运,AMR 加机械臂往往更稳定;对于单一高节拍工序,专机和工业机械臂通常更便宜。人形的经济性建立在同一平台能跨任务复用、减少改造、覆盖用工缺口,而不是在单任务上战胜专机。

1.2 现代具身系统的五层栈

层级

主要输入/输出

主流技术

工程要求

语义与任务层

语言、场景、目标 子任务/潜变量

VLM/LLM、具身推理、检索、规划

可解释、拒绝危险指令、长时记忆

视觉运动策略层

图像/状态/指令 动作块

VLA、行为克隆、扩散/流匹配策略

低延迟、闭环纠偏、跨对象泛化

技能与全身层

目标位姿/潜变量 全身参考

分层RL、运动模仿、MPC、技能库

步态双臂躯干协同

实时控制层

参考轨迹 力矩/电流

WBC、阻抗控制、CBF、安全滤波

200 Hz—1 kHz、确定性、硬约束

机电与运维层

电机/传感/电池/网络

关节模组、触觉、BMS、诊断

可靠性、热管理、可维修、安全认证

 

注:该分层为本报告综合框架。Figure Helix 02 披露的 S2/S1/S0(语义视觉运动—1 kHz 稳定控制)与此高度同构,但属企业自报架构。[16]

1.3 为什么 2024—2026 成为拐点

  • · 多模态基础模型提供语义与空间先验,使机器人能理解开放词汇指令和陌生物体;
  • · 扩散策略、流匹配与动作分块改善连续控制的多峰分布建模和长动作预测;
  • · Open X-EmbodimentDROIDLeRobot 等将数据格式和开源训练栈逐步公共化;
  • · Isaac LabMuJoCoGenesisCosmos 等仿真/世界模型工具提高并行训练和合成数据效率;
  • · 低成本双臂遥操作、动作捕捉、外骨骼和人类视频迁移降低示范数据成本;
  • · 电驱关节、谐波/行星减速、力矩感知、轻量材料和供应链规模化使整机成本快速下降。

2. 2024—2026 技术前沿

2.1 VLA:从动作 token 到连续动作专家

RT-2 把机器人动作表示为语言 token,证明互联网视觉语言知识可以迁移到机器人控制;Open X-Embodiment/RT-X 进一步证明跨 22 种具身、100 +真实轨迹的联合训练能够产生正迁移。[1][2] 随后路线分化:OpenVLA 7B 开源 VLM 为骨干,Octo 93M 扩散策略强调跨输入和动作空间适配,π0 使用流匹配动作专家输出高频连续动作,SmolVLA 则将模型压缩到约 4.5 亿参数并强调异步推理和消费级硬件。[3][4][5][6]

代表系统

时间/出处

动作建模

数据规模/特点

关键意义与限制

RT-2 / RT-X

2023–24

离散动作 token

OXE100+轨迹、22种具身

证明跨具身与网络知识迁移;高频精细控制受限

Octo

RSS 2024

Transformer + 扩散

80万轨迹;25个数据集

93M 开源、易微调;主要仍是机械臂

OpenVLA

CoRL 2024

7B VLM + 动作 token

OXE 混合数据

开放权重与训练;算力/延迟较大

π0

2024 技术报告

VLM + flow matching

1万小时、7种配置、68任务

连续动作与灵巧长任务强;私有数据占主导

SmolVLA

2025 开源报告

小型VLM + 流匹配

少于3episodes

450M、异步执行;平台和任务范围较窄

Gemini Robotics 1.5/2

2025–26 技术报告

具身推理 + VLA + 全身

未完整公开

强语义/跨具身/全身;核心数据与权重封闭

Helix 02

2026 企业披露

S2/S1/S0 分层 VLA

未公开

端到端全身移动操作;需独立基准验证

 

当前共识不是模型越大越好,而是语义模型与动作专家解耦。语义层可低频运行,动作层以 10—200 Hz 预测动作块,稳定层以数百 Hz 1 kHz 处理平衡、接触和安全。这既符合不同信息的自然时间尺度,也有利于边缘部署、故障隔离与认证。

2.2 数据工程:从机器人孤岛到混合数据飞轮

机器人数据昂贵的根源在于每个样本包含真实时间成本、硬件磨损和安全风险。数据还具有强具身依赖:关节数、相机、坐标系、控制频率与末端执行器不同。Open X-Embodiment 使用 RLDS 对异构数据做统一封装;DROID 通过 50 名采集者、564 个场景与 84 个任务获得 7.6 万条示范;LeRobot 把数据、策略和低成本硬件放到同一开源生态。[2][8][9]

数据来源

优势

结构性偏差

适合用途

真实遥操作

动作标签准确、接触真实

昂贵、成功示范偏置、操作者风格偏差

精细操作、后训练、评测

人类第一视角视频

规模巨大、场景多样

无机器人动作/力、身体差异

视觉表征、任务分解、跨具身预训练

仿真/合成数据

可并行、可覆盖失败和危险态

sim-to-real、视觉与接触误差

运动控制、长尾、预训练、安全测试

自主执行日志

直接对应部署分布

早期能力弱、数据污染风险

在线迭代、故障挖掘、运维优化

网络图文/视频

语义知识广

缺少可执行性与物理因果

物体/语言理解、先验与规划

 

前沿判断|真正可持续的数据飞轮不是采更多成功视频,而是自动识别失败/低置信片段 人类纠正或远程接管 重新标注动作与结果 离线评估 小流量部署。数据价值应按覆盖稀有状态和降低介入率计量,而非只按小时数。

 

2025—2026 年的显著趋势是混合训练:RSS 2025 Sim-and-Real Co-Training 报告在机械臂与人形任务上,仿真数据使真实任务表现平均提高 38%HumanoidMimicGen 通过少量源示范与全身规划自动生成移动操作数据,在其基准上较仅真实数据训练提高 20%。这些结果支持真实数据校准 + 仿真扩大覆盖,但仍需在每一具体硬件上验证。[26][30]

2.3 全身运动:从步态控制到语言驱动的移动操作

2024 HumanoidBench 显示,主流强化学习算法在高维全身操作任务上普遍困难,而有稳健底层行走/伸手策略的分层基线明显更强。[18] 这解释了产业系统为何采用层级结构:直接从语言到电机力矩在数据效率、安全和实时性上都不现实。

研究前沿主要沿三条路线推进。第一,运动模仿与强化学习结合:H2OHumanPlus 把人类动作重定向到人形,并用 RL 解决可行性与平衡;第二,sim-to-real 动力学对齐:ASAP 以两阶段方法学习现实与仿真的残差动作,在 Unitree G1 上验证敏捷技能;第三,语言或视觉语义条件化:LangWBC 用语言直接驱动全身行为,WholeBodyVLA/OpenHLM 则尝试把视觉、语言与全部自由度统一起来。[19][20][21][22][31][32]

难点

为什么难

前沿解法

仍未解决

高维耦合

手臂动作改变质心与足底受力

分层策略、全身参考、残差RL

统一策略的稳定性与样本效率

接触切换

脚、手、物体接触非光滑

接触随机化、力控、MPC/CBF

软物体与多点接触建模

仿真差异

摩擦、背隙、柔性、延迟难建模

系统辨识、域随机化、残差动力学

长期磨损和温度漂移

长时序

放需持续状态记忆

层级潜变量、视觉记忆、动作块

错误累积、恢复策略、任务终止判断

 

2.4 灵巧操作:触觉和物理顺应性回归中心

纯视觉策略在遮挡、反光、透明、柔性和微小接触任务上存在天然盲区。2025 Communications Engineering 的研究表明,仿生分布式柔顺性本身可以提高人形手开放环操作的鲁棒性,提示物理智能能减轻算法负担。[27] 产业硬件也在加入指尖触觉、掌内摄像头和力矩估计:Figure 03/Helix 02 披露其指尖可感知克级力并利用掌内视觉处理头部相机遮挡,但这些指标仍属企业披露。[16]

灵巧手的关键矛盾是自由度、负载、速度、耐久、成本与可维护性。五指手有利于复用人类工具和视频,但多电机、线缆和传感器显著增加故障点;三指夹爪通常更稳健。预计工业首批部署将以可快速更换的任务型手爪为主,家庭/通用场景才会逐步采用高自由度手。

2.5 世界模型、具身推理与在线纠错

具身推理的目标是预测动作后果、理解三维空间、识别任务进度并在异常时重规划。Gemini Robotics-ER 将空间推理和具身规划与动作模型分开;2025 NeurIPS RoboScape 等工作探索物理信息世界模型;Robot-R1 用强化学习提升低层空间和运动推理。[12][13][33] 产业价值不在于生成漂亮视频,而在于用于数据合成、策略预检、反事实失败搜索和部署前数字验收。

但世界模型若缺少可校准的不确定性,可能把视觉合理性误当成动力学正确性。对接触密集任务,应将世界模型用于候选动作排序和风险预警,而不是独立替代实时力控。

2.6 边缘推理与开放生态

机器人不能完全依赖云端:网络抖动、隐私与安全要求决定运动控制必须本地闭环。SmolVLA 的异步推理将感知计算与动作执行解耦;Gemini Robotics On-Device 强调本地运行;NVIDIA GR00T/Isaac/Cosmos 试图提供从合成数据、训练到边缘部署的一体化平台。[6][14][15] 开源生态的竞争焦点已从单一模型权重扩展到数据格式、仿真资产、标定工具、遥操作硬件和基准。

3. 人形机器人硬件与系统工程

3.1 机电架构的关键选择

子系统

主流路线

主要权衡

选型指标

关节执行器

无框电机 + 减速器 + 编码器/力矩估计

扭矩密度 vs. 背隙、热与成本

连续扭矩、峰值时间、效率、寿命

减速器

谐波、行星、摆线、准直驱

精度/体积 vs. 冲击与可维护性

回差、效率、抗冲击、国产化

手部

夹爪、三指、五指腱驱/直驱

通用性 vs. 可靠性

抓取覆盖、指尖力、循环寿命

感知

头部/腕部/掌内视觉、LiDAR、触觉、IMU

冗余 vs. 带宽、标定与成本

遮挡恢复、时间同步、漂移

能源

可换电锂电、BMS、站内充电

续航 vs. 重量与安全

有效工时、换电时间、热失控保护

计算

x86/ARM + GPU/NPU + 实时MCU

算力 vs. 功耗和散热

端到端延迟、确定性、降级模式

 

公开规格只能说明硬件上限,不能代表可持续能力。例如 Unitree G1 官方标称约 35 kg23—43 个关节电机、约 2 小时续航、标准版起价 1.35 万美元,并明确提醒行业仍处早期探索、部分功能仍在开发。[43] 对采购而言,连续负载、热降额、摔倒次数、维修件交期与软件开放度比峰值视频更重要。

3.2 可靠性工程:从 Demo 10 万次循环

商业机器人必须把概率性 AI 行为转化为可管理的运营风险。Agility 披露 Digit GXO 现场已搬运超过 10 万个料箱,这类长周期、重复流程指标比单次复杂演示更接近可部署性证据;但仍需客户侧独立披露利用率、介入率和全成本。[40]

  • · 硬件:关节寿命、线缆磨损、手指耐久、跌倒冲击、电池循环与热降额;
  • · 软件:模型版本回滚、行为回归测试、传感器失效检测、日志可追溯;
  • · 现场:自动充/换电、远程运维、备件、故障隔离、人工安全接管;
  • · 流程:与 MES/WMS/PLC 的任务握手、工位状态同步、异常工单与责任边界。

3.3 人形并非唯一最优载体

形态

优势

劣势

优先场景

双足人形

楼梯/跨障、兼容人类空间、工具复用

控制复杂、能效低、跌倒风险

多楼层棕地、任务需全身高度变化

轮式双臂

稳定、续航长、载荷高

楼梯与门槛受限

平整厂房、医院、仓库、家庭主层

移动底盘+机械臂

生态成熟、模块化、ROI清晰

人类工具适配有限

搬运、拣选、巡检、机台上下料

固定工业臂/专机

节拍与精度最高、安全边界清晰

柔性低、改造成本高

高产量稳定工序

 

采购原则|先定义任务,再选择身体。只有当任务需要跨工位移动、双臂协作、高低位覆盖或人类工具兼容,并且场地改造成本较高时,人形溢价才可能成立。

 

4. 产业格局与商业化进展

4.1 市场底座:工业自动化仍是主战场

IFRWorld Robotics 2025》显示,2024 年全球新安装工业机器人 54.2 万台,连续第四年超过 50 万台;在役存量约 466.4 万台。亚洲占新增部署 74%,中国单年安装 29.5 万台、占全球 54%,且中国厂商在本土市场份额首次升至 57%。这些数字不是人形机器人销量,但说明自动化客户、集成商、零部件和运维体系已经形成,为人形的工业验证提供了场景底座。[38]

区域/国家

2024 年工业机器人安装

结构特征

对人形产业的含义

全球

542,000

连续四年 >50万台

成熟客户体系,但专机竞争强

中国

295,00054%

本土厂商份额 57%

场景密度、成本与供应链优势

日本

44,500

机器人制造与精密机电强

零部件、客户与质量体系优势

美国

34,200

集成商多、AI/资本强

软件、模型与高价值场景领先

韩国

30,600

制造自动化密度高

电子/汽车场景与大企业导入

欧洲

85,000

安全标准、汽车与机械强

系统集成与合规能力突出

 

来源:IFR World Robotics 2025;口径为工业机器人,不含对人形的单独统计。[38]

4.2 全球代表性路线

企业/平台

形态与路线

已披露进展

证据判断

Agility Digit

双足 + 任务型手;RaaS/物流

GXO 多年协议;自报搬运10+料箱

商业现场较强,但任务窄、客户成本未公开

Boston Dynamics Atlas

全电双足;工业全身操作

2026 产品版,现代汽车与 DeepMind 部署计划

工程积累深;规模数据待观察

Figure 03 / Helix 02

五指人形;分层全身VLA

4分钟洗碗机、触觉精操、多机协作演示

前沿强;主要为公司自测

Apptronik Apollo

模块化电驱;工业多用途

奔驰/Jabil合作;Google DeepMind伙伴

产业伙伴强;现场量化数据有限

1X NEO

软包覆家用人形;数据优先

NEO Gamma 开始内部家庭测试

家庭定位明确;安全与自主度待验证

Unitree G1/H1

高性价比通用硬件平台

G1 起价低、开发者生态活跃

硬件普及快;应用软件需二次开发

优必选 Walker S

工业人形;汽车厂场景

多家车企训练/示范工厂披露

中国工业场景先发;财务披露可跟踪

NVIDIA GR00T生态

模型+仿真+算力平台

GR00T N1.xIsaacCosmos

可能成为中立底座;依赖伙伴真实落地

 

说明:企业披露均为 C 级证据;演示”“试点”“商业部署”“批量交付在本报告中严格区分。[15][16][39][40][41][42][43][44][45]

4.3 商业化的四阶段门槛

1. 阶段 0|实验室演示:单机、受控物体、视频剪辑可接受;目标是证明能力存在。

2. 阶段 1|客户 PoC:限定区域和任务,人工看护;目标是验证安全、节拍和集成。

3. 阶段 2|付费部署:持续运行、SLA/服务、明确责任;目标是证明客户愿意长期付费。

4. 阶段 3|可复制扩张:跨站点、跨班次、软件复用;目标是让部署边际成本下降。

当前行业整体位于阶段 1 与阶段 2 之间。Digit/GXO 是少数公开进入多年 RaaS 的案例;多数厂商仍以联合开发、试点和意向订单为主。FigureGoogle DeepMind 等的能力演示更能代表技术上限,而非当前商业平均水平。

4.4 单位经济性:应以有效自主工时计价

硬件售价不是核心经济口径。真正的每有效工时成本应包含折旧/租赁、现场集成、能源、维护备件、远程操作员、停机损失、安全设施和软件服务,再除以实际完成且无需人工返工的工时。

建议公式|每有效自主工时成本 =(年化设备与软件 + 集成摊销 + 运维 + 远程介入 + 停机损失)÷(计划工时 × 利用率 × 自主完成率 × 质量合格率)。

 

当任务种类少、节拍高且环境稳定时,专机通常更优;人形的经济价值来自减少工位改造、覆盖跨区域任务、以软件复用新增技能,以及在夜班/危险/难招聘岗位提高有效产能。

4.5 中美欧日的结构性差异

维度

中国

美国

欧洲/日本

优势

制造链完整、成本迭代快、场景和政策密度高

AI基础模型、芯片/云、资本与创业人才

精密机电、工业客户、安全标准、集成与质量

短板

高端传感/软件生态、原创基准、全球服务

制造成本、供应链本土化、工业部署人才

大模型平台和风险资本相对分散

典型策略

整机降本 + 场景示范 + 集群

模型/平台牵引 + 龙头客户联合开发

从工业可靠性和合规切入

胜负手

良率、核心部件、数据共享机制

通用模型、开发平台、生态锁定

认证、系统集成、长期运维

 

中国工信部《人形机器人创新发展指导意见》提出到 2025 年创新体系初步建立、整机实现批量生产,到 2027 年产业加速规模化,并明确大脑、小脑、肢体、数据、仿真、核心部件、场景和安全治理任务。[46] 政策能够加速供给和场景开放,但也可能造成同质化、重复投资与以出货代替有效部署,应以真实利用率和客户续约校验。

5. 核心瓶颈、风险与标准

5.1 七个尚未解决的技术瓶颈

  • · 开放世界泛化:对未见物体有语义认识,不等于知道正确抓取点、力和失败恢复。
  • · 长时序可靠性:若单步成功率为 99%,连续 100 个关键步骤全部成功的理想化概率也仅约 36.6%
  • · 安全与能力冲突:过度保守的安全滤波降低节拍,纯学习策略又缺少可证明边界。
  • · 全身接触建模:足底、手掌、物体和环境多点接触导致非光滑高维动力学。
  • · 数据质量:成功示范占比过高、失败/恢复数据稀缺、标注不一致、跨具身偏差。
  • · 评测碎片化:不同硬件、任务、提示、物体和人工介入规则使成功率不可比。
  • · 长期机电漂移:磨损、温度、电池、标定和地面摩擦变化会让离线策略逐渐失配。

5.2 安全:必须是独立于能力模型的系统属性

ISO 10218-1/2:2025 覆盖工业机器人及系统集成的安全要求,但 ISO 10218-1 明确不适用于公众可接触的服务机器人和消费品;个人护理机器人仍参考 ISO 13482,服务机器人安全标准也在演进。[47][48] 这意味着工业封闭区的人形部署与家庭/公共空间部署面临不同合规路径。欧盟《机械法规》还将与高风险 AI 安全组件要求衔接。[49]

安全层

控制措施

验证指标

机械本体

限力/限速、圆角软包覆、制动、跌倒管理

最大接触力、停止距离、跌倒包络

实时控制

关节限位、CBF/安全滤波、碰撞避免

最坏时延、约束违反率、降级可用性

任务与语义

危险指令拒绝、区域/对象权限、双重确认

越权率、误拒率、提示攻击测试

运行监控

异常检测、进度监测、不确定性、自动停机

故障提前量、漏报/误报、恢复时间

运营治理

风险评估、版本控制、日志、培训、保险

审计覆盖、变更追踪、事故闭环

网络与数据

身份、加密、更新签名、隐私最小化

渗透测试、供应链SBOM、数据留存

 

研究上,SafeVLA 通过约束学习探索安全任务性能权衡,VLSA/AEGIS 将控制障碍函数作为可插拔安全层,Sentinel 结合动作一致性与 VLM 任务进度监控识别失败。[35][36][37] 共同方向是:生成式策略负责提出动作,独立安全层保留否决权。

5.3 评测应该从成功率升级为运营指标组

指标组

核心指标

为何重要

任务能力

成功率、质量合格率、周期时间

衡量任务价值

自主性

每千动作介入数、远程操作分钟/小时

识别隐藏的人力

可靠性

MTBFMTTR、连续自主小时

判断是否能跨班次

泛化

新物体/新布局/新指令/新站点性能

区分记忆与迁移

安全

近失、接触力、停止距离、危险指令通过率

进入人机共域的门槛

经济性

每有效工时成本、部署周期、技能切换成本

验证规模化 ROI

 

VLA-Arena 的结果提示现有模型容易记忆训练分布、对视觉/结构变化不对称地脆弱,并在安全和长时序组合上表现不足。[36] 未来基准必须报告失败类型、人工介入规则和置信区间,而不只是平均成功率。

6. 2026—2030 趋势情景与行动建议

6.1 基准情景:工业多用途先行,家庭通用延后

阶段

技术形态

商业特征

主要不确定性

2026–27

分层全身策略;触觉/掌内视觉普及;仿真+真实共训

汽车/3PL/电子制造扩大付费试点

安全认证、连续运行、交付能力

2028–29

跨站点技能迁移改善;远程介入平台成熟

RaaS 与按有效工时计费增加

ROI、责任与保险、数据权属

2030 左右

少数平台实现多任务同机复用

工业规模部署形成;家庭仍为高价早期产品

开放世界可靠性、成本和社会接受

 

乐观情景下,人类视频迁移、合成数据和自动纠错显著降低数据成本,全身 VLA 在多个硬件上形成正迁移,工业部署在 2028 年前进入快速扩张。保守情景下,可靠性与安全认证进展慢、远程介入成本居高不下,人形被轮式移动操作和专机持续压制,行业经历并购与路线收缩。

6.2 技术研发路线建议

5. 架构:采用慢推理快策略实时安全三层解耦,明确每层频率、接口和可降级行为。

6. 数据:建立统一 episode 规范,记录成功、失败、接管、力/触觉、环境变化和版本元数据。

7. 评测:从单任务成功率转向连续 8—24 小时压力测试、跨站点复现与故障注入。

8. 安全:把 CBF/碰撞约束、动作监控、语义权限和物理急停做成独立安全内核

9. 硬件:优先提高连续性能、手部寿命、标定自动化和现场可换模块,不追逐峰值自由度。

10. 开放性:支持 ROS 2/标准数据格式、模型回滚、日志导出与第三方安全审计,降低供应商锁定。

6.3 企业导入的 90 天验证框架

周期

关键活动

退出门槛

0–30

任务分解、危险分析、基线人工成本、场地和接口勘测

任务边界、数据口径、安全负责人明确

31–60

沙盒 PoC、失败注入、节拍/介入/能耗测试

达到最低成功率且无不可控危险模式

61–90

真实班次影子运行、WMS/MES 对接、维修演练

连续运行、介入率与单位经济性达标

扩展前

第二站点复现、版本回归、合同/SLA/数据条款

跨站点部署边际成本显著下降

 

6.4 投资与产业研究的领先指标

  • · 客户从签署合作转为付费续约/扩站点,以及按有效工作量计费;
  • · 真实现场连续运行小时、每千次介入、MTBF/MTTR,而非演示数量;
  • · 同一硬件新增技能所需的数据小时、工程师周数和现场停机时间;
  • · 关节/手部良率、供应商集中度、关键部件成本曲线与售后备件周转;
  • · 训练数据中失败与恢复片段占比、自动发现高价值数据的能力;
  • · 安全认证、保险承保、事故披露和第三方测试进展。

最终判断|2026 年的真正前沿不是机器人做到了某件新奇任务,而是同一模型、同一硬件能否在陌生变化下持续完成任务,并在失败前知道自己不确定、触发安全降级、快速恢复。产业价值将从能力展示转向可验证的自主性、可靠性和单位经济性。

 

附录 A|关键论文与项目导读

论文/项目

为什么重要

索引

RT-2

将动作离散为 token,验证网络知识向机器人控制迁移;VLA 范式起点。

[1]

Open X-Embodiment / RT-X

22 种具身、100 +真实轨迹的公共数据与正迁移证据。

[2]

Octo

RSS 202493M 开源扩散策略,强调跨观察/动作空间微调。

[3]

OpenVLA

7B 开源 VLA,建立可复现实验基线,同时暴露推理成本问题。

[4]

π0

流匹配连续动作专家,面向高频灵巧和长时序操作。

[5]

DROID

大规模野外机械臂数据集,突出场景与采集者多样性。

[8]

HumanoidBench

RSS 2024;揭示通用 RL 在全身任务上的明显短板。

[18]

H2O / HumanPlus

以人类动作驱动全身遥操作和数据采集,连接人类视频与人形策略。

[20][21]

ASAP

RSS 2025;通过动力学残差对齐改善敏捷技能 sim-to-real

[22]

LangWBC

RSS 2025;语言直接条件化全身控制与组合动作。

[19]

HOMIE

RSS 2025;低成本外骨骼/手套/踏板方案建立全身数据闭环。

[24]

Sim-and-Real Co-Training

RSS 2025;系统化验证仿真与真实共训的收益。

[26]

Sentinel

CoRL 2024;运行时检测动作异常与任务无进展。

[37]

VLA-Arena / SafeVLA

把安全、干扰、外推与长时序纳入系统评测。

[35][36]

OpenHLM / HumanoidMimicGen

2026 预印本;分别代表全身原生 VLA 与自动数据生成前沿。

[30][32]

 

附录 B|参考文献与一手资料

[1] Brohan et al. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control, 2023. 链接

[2] Open X-Embodiment Collaboration. Open X-Embodiment: Robotic Learning Datasets and RT-X Models, ICRA 2024. 链接

[3] Octo Model Team. Octo: An Open-Source Generalist Robot Policy, RSS 2024. 链接

[4] Kim et al. OpenVLA: An Open-Source Vision-Language-Action Model, CoRL 2024. 链接

[5] Black et al. π0: A Vision-Language-Action Flow Model for General Robot Control, 2024. 链接

[6] Hugging Face. SmolVLA: Efficient Vision-Language-Action Model, 2025. 链接

[7] Chi et al. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion, RSS 2023. 链接

[8] Khazatsky et al. DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset, 2024. 链接

[9] Hugging Face. LeRobot documentation and dataset standard. 链接

[10] Li et al. Survey of Vision-Language-Action Models for Embodied Manipulation, 2025. 链接

[11] Mon-Williams et al. Embodied large language models enable robots to complete complex tasks, Nature Machine Intelligence, 2025. 链接

[12] Google DeepMind. Gemini Robotics technical report / launch, 2025. 链接

[13] Google DeepMind. Gemini Robotics 1.5, 2025. 链接

[14] Google DeepMind. Gemini Robotics On-Device, 2025. 链接

[15] NVIDIA. Isaac GR00T N1 and Physical AI platform, 2025. 链接

[16] Figure. Introducing Helix 02: Full-Body Autonomy, 2026. 链接

[17] Google DeepMind. Gemini Robotics 2 brings whole body intelligence, 2026. 链接

[18] Sferrazza et al. HumanoidBench, RSS 2024. 链接

[19] Shao et al. LangWBC, RSS 2025. 链接

[20] He et al. Learning Human-to-Humanoid Real-Time Whole-Body Teleoperation (H2O), 2024. 链接

[21] Fu et al. HumanPlus: Humanoid Shadowing and Imitation from Humans, 2024. 链接

[22] He et al. ASAP: Aligning Simulation and Real-World Physics, RSS 2025. 链接

[23] Huang et al. Learning Humanoid Standing-up Control, RSS 2025. 链接

[24] Ben et al. HOMIE: Humanoid Loco-Manipulation with Isomorphic Exoskeleton Cockpit, RSS 2025. 链接

[25] Niu et al. Human2LocoMan, RSS 2025. 链接

[26] Maddukuri et al. Sim-and-Real Co-Training, RSS 2025. 链接

[27] Junge & Hughes. Spatially distributed biomimetic compliance, Communications Engineering, 2025. 链接

[28] Fu et al. Mobile ALOHA, CoRL 2024 proceedings. 链接

[29] Zhao et al. Humanoid Everyday dataset, 2025. 链接

[30] Lin et al. HumanoidMimicGen, 2026 preprint. 链接

[31] WholeBodyVLA: Unified Latent VLA for Whole-Body Loco-Manipulation, 2025. 链接

[32] OpenHLM: An Empirical Recipe for Whole-Body Humanoid Loco-Manipulation, 2026. 链接

[33] RoboScape: Physics-informed Embodied World Model, NeurIPS 2025. 链接

[34] Figure. Project Go-Big: Internet-Scale Humanoid Pretraining, 2025. 链接

[35] Zhang et al. SafeVLA: Safety Alignment via Constrained Learning, 2025. 链接

[36] Zhang et al. VLA-Arena: Benchmarking VLA Models, 2025. 链接

[37] Agia et al. Unpacking Failure Modes of Generative Policies (Sentinel), CoRL 2024. 链接

[38] International Federation of Robotics. World Robotics 2025. 链接

[39] Agility Robotics & GXO. Multi-year Digit RaaS agreement, 2024. 链接

[40] Agility Robotics. Digit moves over 100,000 totes, 2025. 链接

[41] Apptronik & Mercedes-Benz. Apollo commercial agreement, 2024. 链接

[42] Boston Dynamics. Atlas evolution from research to industrial humanoid, 2026. 链接

[43] Unitree. G1 official specifications. 链接

[44] 1X. Introducing NEO Gamma, 2025. 链接

[45] UBTECH. 2024 annual report / Walker S industrial deployment disclosure. 链接

[46] 工业和信息化部:《人形机器人创新发展指导意见》,2023链接

[47] ISO 10218-1:2025, Robotics — Safety requirements — Part 1. 链接

[48] ISO/TC 299 Robotics standards catalogue. 链接

[49] EU Regulation 2023/1230 on machinery; consolidated text. 链接

[50] NIST AI Risk Management Framework 1.0. 链接

附录 C|术语表

术语

释义

VLA

Vision-Language-Action,视觉语言动作模型。

VLM

视觉语言模型,负责语义、对象和空间理解。

WBC

Whole-Body Control,全身控制。

Loco-manipulation

移动与操作耦合的全身任务。

Action chunk

一次预测未来一段动作序列,以降低自回归延迟。

Flow matching

学习从噪声到连续动作分布的向量场。

Sim-to-real

从仿真训练迁移到真实机器人。

RaaS

Robotics-as-a-Service,机器人即服务。

MTBF / MTTR

平均故障间隔 / 平均修复时间。

CBF

Control Barrier Function,控制障碍函数,用于约束安全集。

posted @ 2026-08-21 11:13  stardsd  阅读(17)  评论(0)    收藏  举报