从视觉—语言—动作模型到全身自主系统:研究进展、产业格局与 2026—2030 路线判断
具身智能 / 人形机器人
技术与产业前沿报告
从视觉—语言—动作模型到全身自主系统:研究进展、产业格局与 2026—2030 路线判断
国际论文、顶会、标准与企业一手资料综合研究
资料截止:2026年8月21日
版本:V1.0
阅读说明与研究方法
本报告面向技术决策、产业研究与战略规划。研究对象包括具身智能的通用方法论,以及以双足人形、轮式人形和双臂移动操作平台为代表的物理载体。检索优先级依次为:同行评审论文与会议正式论文、国际标准和政府文件、机构技术报告与开源项目、企业官方披露。对尚未同行评审的预印本和企业演示,均按较低证据等级处理。
|
证据等级 |
来源类型 |
报告中的使用方式 |
|
A |
同行评审顶会/期刊、国际标准、官方统计 |
用于确认可复现方法、基准结果和合规要求 |
|
B |
权威机构技术报告、开源模型/数据集项目页 |
用于追踪尚在快速演化的技术路线 |
|
C |
企业官方产品、客户合作与部署披露 |
用于判断工程方向;不等同于独立验证 |
|
D |
预印本、实验室演示与前瞻判断 |
仅作为弱信号,明确标注不确定性 |
检索窗口以 2023—2026 年为主,并回溯 RT-2、Diffusion Policy 等关键奠基工作。对“成功率”“吞吐”“量产”“订单”等口径,只有在原始来源明确说明测试任务、时间范围或商业合同性质时才引用;跨平台成功率通常不可直接横向比较。
|
一句话结论|具身智能正在形成“语义推理层—视觉运动策略层—高频稳定控制层”的分层栈;人形机器人已越过纯运动展示期,进入制造与物流的窄任务商业验证期,但离无需人工看护、可跨场景迁移的通用劳动力仍有数量级差距。 |
目录
- · 执行摘要
- · 1. 范畴、技术栈与产业坐标
- · 2. 2024—2026 技术前沿
- · 3. 人形机器人硬件与系统工程
- · 4. 产业格局与商业化进展
- · 5. 核心瓶颈、风险与标准
- · 6. 2026—2030 趋势情景与行动建议
- · 附录:关键论文/项目导读与参考文献
执行摘要
核心判断
- · 范式已经改变:机器人软件从“感知模块 + 任务规划 + 手工控制器”的串联系统,快速转向由视觉、语言、状态和动作统一建模的 VLA/通用策略;但产品级系统并未抛弃传统控制,而是把学习策略置于有安全边界的分层控制栈中。
- · 全身自主是 2026 年最重要的前沿分水岭。Helix 02、Gemini Robotics 2 以及 WholeBodyVLA、OpenHLM 等研究信号,都在把移动、双臂操作、平衡与触觉从多个独立策略收敛为统一的 loco-manipulation(移动操作)问题。[16][17][31][32]
- · 数据而非参数量,是当前最硬的约束。Open X-Embodiment 的 100 万+轨迹、DROID 的 7.6 万条示范、π0 的约 1 万小时灵巧数据、Humanoid Everyday 的 1.03 万条轨迹,仍远小于互联网模型的数据规模,而且动作空间、传感器和机器人形态高度异构。[2][5][8][29]
- · “人类视频 → 机器人动作”是潜在的数据规模突破口,但形态差异、接触力不可观测、失败数据缺失和安全约束意味着视频不能直接替代机器人交互数据。近年的 H2O、HumanPlus、Human2LocoMan、Figure Go-Big 等工作说明跨具身迁移正在从表征预训练迈向动作迁移。[20][21][25][34]
- · 硬件竞争从“能走”转向“可维护地干活”。关键指标不再只是自由度和峰值扭矩,而是抓取覆盖率、触觉与掌内视觉、跌倒管理、热设计、电池换装、平均无故障时间、远程介入率、现场恢复时间和安全认证。
- · 商业化最先发生在棕地制造和物流。固定物料、标准料箱、可封闭区域和可计算节拍,使投资回报更可验证。Agility Digit 与 GXO 的多年 RaaS、Apptronik 与梅赛德斯-奔驰的试点、Boston Dynamics Atlas 在现代汽车体系内的部署,代表“单任务 → 多任务 → 同一硬件的软件复用”路径。[40][41][42]
- · 行业仍处在“受控场景可用、开放世界不稳”的阶段。实验室成功率经常掩盖了恢复时间、异常工况、人员靠近、物体破损、网络中断和长期漂移。VLA-Arena、SafeVLA、Sentinel 等工作显示,记忆化、长时序失败和安全盲区仍很普遍。[35][36][37]
- · 中国的竞争优势更偏向供应链、成本下降速度和场景密度;美国优势更偏向基础模型、资本、芯片/仿真平台和头部软件团队;欧洲与日本在工业客户、精密机电、安全标准与系统集成上更强。最终胜负不会由单一整机参数决定,而由“数据闭环 × 可靠性工程 × 制造良率 × 客户集成”共同决定。
成熟度判断(截至 2026-08)
|
能力域 |
研究成熟度 |
产品成熟度 |
关键缺口 |
|
平地双足运动 |
高 |
中高 |
长周期可靠性、跌倒安全、复杂地面 |
|
受控场景料箱搬运 |
中高 |
中 |
节拍、人工介入率、与 WMS/MES 集成 |
|
桌面双臂操作 |
中高 |
中低 |
长尾物体、遮挡、力控与失败恢复 |
|
灵巧手精细操作 |
中 |
低 |
耐久、标定、触觉数据、成本 |
|
全身移动操作 |
中 |
低 |
高维耦合、碰撞、安全与长时序 |
|
开放世界家庭任务 |
中低 |
很低 |
环境长尾、成本、隐私、安全与服务网络 |
|
跨机器人通用策略 |
中 |
低 |
动作空间统一、形态迁移、标准化评测 |
|
决策含义|未来 24 个月不宜把“通用人形”作为单一采购品类,而应把项目拆成任务可行性、现场工程、安全认证、数据闭环和单位经济性五个并行门槛。可复制部署的领先指标是:连续自主运行小时、每千次动作人工介入、任务切换成本与全生命周期每有效工时成本。 |
1. 范畴、技术栈与产业坐标
1.1 什么是具身智能
具身智能不是“给机器人接入一个大语言模型”。其核心是智能体通过身体与环境闭环交互,把视觉、触觉、本体感觉、语言和历史状态转化为可执行动作,并利用动作后果继续更新状态估计与策略。身体形态、执行器带宽、传感器位置、接触动力学和安全约束都会改变可学习的策略空间。因此,同一模型在机械臂、轮式双臂和双足人形上的能力并不等价。
人形形态的产业价值来自兼容以人为尺度设计的棕地环境:门、楼梯、货架、工具和工位无需整体重建。但这是一种“系统适配优势”,不是所有任务的机械效率最优解。对于平整地面上的高吞吐搬运,AMR 加机械臂往往更稳定;对于单一高节拍工序,专机和工业机械臂通常更便宜。人形的经济性建立在同一平台能跨任务复用、减少改造、覆盖用工缺口,而不是在单任务上战胜专机。
1.2 现代具身系统的五层栈
|
层级 |
主要输入/输出 |
主流技术 |
工程要求 |
|
语义与任务层 |
语言、场景、目标 → 子任务/潜变量 |
VLM/LLM、具身推理、检索、规划 |
可解释、拒绝危险指令、长时记忆 |
|
视觉运动策略层 |
图像/状态/指令 → 动作块 |
VLA、行为克隆、扩散/流匹配策略 |
低延迟、闭环纠偏、跨对象泛化 |
|
技能与全身层 |
目标位姿/潜变量 → 全身参考 |
分层RL、运动模仿、MPC、技能库 |
步态—双臂—躯干协同 |
|
实时控制层 |
参考轨迹 → 力矩/电流 |
WBC、阻抗控制、CBF、安全滤波 |
200 Hz—1 kHz、确定性、硬约束 |
|
机电与运维层 |
电机/传感/电池/网络 |
关节模组、触觉、BMS、诊断 |
可靠性、热管理、可维修、安全认证 |
注:该分层为本报告综合框架。Figure Helix 02 披露的 S2/S1/S0(语义—视觉运动—1 kHz 稳定控制)与此高度同构,但属企业自报架构。[16]
1.3 为什么 2024—2026 成为拐点
- · 多模态基础模型提供语义与空间先验,使机器人能理解开放词汇指令和陌生物体;
- · 扩散策略、流匹配与动作分块改善连续控制的多峰分布建模和长动作预测;
- · Open X-Embodiment、DROID、LeRobot 等将数据格式和开源训练栈逐步公共化;
- · Isaac Lab、MuJoCo、Genesis、Cosmos 等仿真/世界模型工具提高并行训练和合成数据效率;
- · 低成本双臂遥操作、动作捕捉、外骨骼和人类视频迁移降低示范数据成本;
- · 电驱关节、谐波/行星减速、力矩感知、轻量材料和供应链规模化使整机成本快速下降。
2. 2024—2026 技术前沿
2.1 VLA:从动作 token 到连续动作专家
RT-2 把机器人动作表示为语言 token,证明互联网视觉—语言知识可以迁移到机器人控制;Open X-Embodiment/RT-X 进一步证明跨 22 种具身、100 万+真实轨迹的联合训练能够产生正迁移。[1][2] 随后路线分化:OpenVLA 以 7B 开源 VLM 为骨干,Octo 以 93M 扩散策略强调跨输入和动作空间适配,π0 使用流匹配动作专家输出高频连续动作,SmolVLA 则将模型压缩到约 4.5 亿参数并强调异步推理和消费级硬件。[3][4][5][6]
|
代表系统 |
时间/出处 |
动作建模 |
数据规模/特点 |
关键意义与限制 |
|
RT-2 / RT-X |
2023–24 |
离散动作 token |
OXE:100万+轨迹、22种具身 |
证明跨具身与网络知识迁移;高频精细控制受限 |
|
Octo |
RSS 2024 |
Transformer + 扩散 |
80万轨迹;25个数据集 |
93M 开源、易微调;主要仍是机械臂 |
|
OpenVLA |
CoRL 2024 |
7B VLM + 动作 token |
OXE 混合数据 |
开放权重与训练;算力/延迟较大 |
|
π0 |
2024 技术报告 |
VLM + flow matching |
约1万小时、7种配置、68任务 |
连续动作与灵巧长任务强;私有数据占主导 |
|
SmolVLA |
2025 开源报告 |
小型VLM + 流匹配 |
少于3万 episodes |
450M、异步执行;平台和任务范围较窄 |
|
Gemini Robotics 1.5/2 |
2025–26 技术报告 |
具身推理 + VLA + 全身 |
未完整公开 |
强语义/跨具身/全身;核心数据与权重封闭 |
|
Helix 02 |
2026 企业披露 |
S2/S1/S0 分层 VLA |
未公开 |
端到端全身移动操作;需独立基准验证 |
当前共识不是“模型越大越好”,而是语义模型与动作专家解耦。语义层可低频运行,动作层以 10—200 Hz 预测动作块,稳定层以数百 Hz 至 1 kHz 处理平衡、接触和安全。这既符合不同信息的自然时间尺度,也有利于边缘部署、故障隔离与认证。
2.2 数据工程:从机器人孤岛到混合数据飞轮
机器人数据昂贵的根源在于每个样本包含真实时间成本、硬件磨损和安全风险。数据还具有强具身依赖:关节数、相机、坐标系、控制频率与末端执行器不同。Open X-Embodiment 使用 RLDS 对异构数据做统一封装;DROID 通过 50 名采集者、564 个场景与 84 个任务获得 7.6 万条示范;LeRobot 把数据、策略和低成本硬件放到同一开源生态。[2][8][9]
|
数据来源 |
优势 |
结构性偏差 |
适合用途 |
|
真实遥操作 |
动作标签准确、接触真实 |
昂贵、成功示范偏置、操作者风格偏差 |
精细操作、后训练、评测 |
|
人类第一视角视频 |
规模巨大、场景多样 |
无机器人动作/力、身体差异 |
视觉表征、任务分解、跨具身预训练 |
|
仿真/合成数据 |
可并行、可覆盖失败和危险态 |
sim-to-real、视觉与接触误差 |
运动控制、长尾、预训练、安全测试 |
|
自主执行日志 |
直接对应部署分布 |
早期能力弱、数据污染风险 |
在线迭代、故障挖掘、运维优化 |
|
网络图文/视频 |
语义知识广 |
缺少可执行性与物理因果 |
物体/语言理解、先验与规划 |
|
前沿判断|真正可持续的数据飞轮不是“采更多成功视频”,而是自动识别失败/低置信片段 → 人类纠正或远程接管 → 重新标注动作与结果 → 离线评估 → 小流量部署。数据价值应按覆盖稀有状态和降低介入率计量,而非只按小时数。 |
2025—2026 年的显著趋势是混合训练:RSS 2025 的 Sim-and-Real Co-Training 报告在机械臂与人形任务上,仿真数据使真实任务表现平均提高 38%;HumanoidMimicGen 通过少量源示范与全身规划自动生成移动操作数据,在其基准上较仅真实数据训练提高 20%。这些结果支持“真实数据校准 + 仿真扩大覆盖”,但仍需在每一具体硬件上验证。[26][30]
2.3 全身运动:从步态控制到语言驱动的移动操作
2024 年 HumanoidBench 显示,主流强化学习算法在高维全身操作任务上普遍困难,而有稳健底层行走/伸手策略的分层基线明显更强。[18] 这解释了产业系统为何采用层级结构:直接从语言到电机力矩在数据效率、安全和实时性上都不现实。
研究前沿主要沿三条路线推进。第一,运动模仿与强化学习结合:H2O、HumanPlus 把人类动作重定向到人形,并用 RL 解决可行性与平衡;第二,sim-to-real 动力学对齐:ASAP 以两阶段方法学习现实与仿真的残差动作,在 Unitree G1 上验证敏捷技能;第三,语言或视觉语义条件化:LangWBC 用语言直接驱动全身行为,WholeBodyVLA/OpenHLM 则尝试把视觉、语言与全部自由度统一起来。[19][20][21][22][31][32]
|
难点 |
为什么难 |
前沿解法 |
仍未解决 |
|
高维耦合 |
手臂动作改变质心与足底受力 |
分层策略、全身参考、残差RL |
统一策略的稳定性与样本效率 |
|
接触切换 |
脚、手、物体接触非光滑 |
接触随机化、力控、MPC/CBF |
软物体与多点接触建模 |
|
仿真差异 |
摩擦、背隙、柔性、延迟难建模 |
系统辨识、域随机化、残差动力学 |
长期磨损和温度漂移 |
|
长时序 |
走—抓—搬—放需持续状态记忆 |
层级潜变量、视觉记忆、动作块 |
错误累积、恢复策略、任务终止判断 |
2.4 灵巧操作:触觉和“物理顺应性”回归中心
纯视觉策略在遮挡、反光、透明、柔性和微小接触任务上存在天然盲区。2025 年 Communications Engineering 的研究表明,仿生分布式柔顺性本身可以提高人形手开放环操作的鲁棒性,提示“物理智能”能减轻算法负担。[27] 产业硬件也在加入指尖触觉、掌内摄像头和力矩估计:Figure 03/Helix 02 披露其指尖可感知克级力并利用掌内视觉处理头部相机遮挡,但这些指标仍属企业披露。[16]
灵巧手的关键矛盾是自由度、负载、速度、耐久、成本与可维护性。五指手有利于复用人类工具和视频,但多电机、线缆和传感器显著增加故障点;三指夹爪通常更稳健。预计工业首批部署将以可快速更换的任务型手爪为主,家庭/通用场景才会逐步采用高自由度手。
2.5 世界模型、具身推理与在线纠错
具身推理的目标是预测动作后果、理解三维空间、识别任务进度并在异常时重规划。Gemini Robotics-ER 将空间推理和具身规划与动作模型分开;2025 年 NeurIPS 的 RoboScape 等工作探索物理信息世界模型;Robot-R1 用强化学习提升低层空间和运动推理。[12][13][33] 产业价值不在于生成“漂亮视频”,而在于用于数据合成、策略预检、反事实失败搜索和部署前数字验收。
但世界模型若缺少可校准的不确定性,可能把视觉合理性误当成动力学正确性。对接触密集任务,应将世界模型用于候选动作排序和风险预警,而不是独立替代实时力控。
2.6 边缘推理与开放生态
机器人不能完全依赖云端:网络抖动、隐私与安全要求决定运动控制必须本地闭环。SmolVLA 的异步推理将感知计算与动作执行解耦;Gemini Robotics On-Device 强调本地运行;NVIDIA GR00T/Isaac/Cosmos 试图提供从合成数据、训练到边缘部署的一体化平台。[6][14][15] 开源生态的竞争焦点已从单一模型权重扩展到数据格式、仿真资产、标定工具、遥操作硬件和基准。
3. 人形机器人硬件与系统工程
3.1 机电架构的关键选择
|
子系统 |
主流路线 |
主要权衡 |
选型指标 |
|
关节执行器 |
无框电机 + 减速器 + 编码器/力矩估计 |
扭矩密度 vs. 背隙、热与成本 |
连续扭矩、峰值时间、效率、寿命 |
|
减速器 |
谐波、行星、摆线、准直驱 |
精度/体积 vs. 冲击与可维护性 |
回差、效率、抗冲击、国产化 |
|
手部 |
夹爪、三指、五指腱驱/直驱 |
通用性 vs. 可靠性 |
抓取覆盖、指尖力、循环寿命 |
|
感知 |
头部/腕部/掌内视觉、LiDAR、触觉、IMU |
冗余 vs. 带宽、标定与成本 |
遮挡恢复、时间同步、漂移 |
|
能源 |
可换电锂电、BMS、站内充电 |
续航 vs. 重量与安全 |
有效工时、换电时间、热失控保护 |
|
计算 |
x86/ARM + GPU/NPU + 实时MCU |
算力 vs. 功耗和散热 |
端到端延迟、确定性、降级模式 |
公开规格只能说明硬件上限,不能代表可持续能力。例如 Unitree G1 官方标称约 35 kg、23—43 个关节电机、约 2 小时续航、标准版起价 1.35 万美元,并明确提醒行业仍处早期探索、部分功能仍在开发。[43] 对采购而言,连续负载、热降额、摔倒次数、维修件交期与软件开放度比峰值视频更重要。
3.2 可靠性工程:从 Demo 到 10 万次循环
商业机器人必须把概率性 AI 行为转化为可管理的运营风险。Agility 披露 Digit 在 GXO 现场已搬运超过 10 万个料箱,这类长周期、重复流程指标比单次复杂演示更接近可部署性证据;但仍需客户侧独立披露利用率、介入率和全成本。[40]
- · 硬件:关节寿命、线缆磨损、手指耐久、跌倒冲击、电池循环与热降额;
- · 软件:模型版本回滚、行为回归测试、传感器失效检测、日志可追溯;
- · 现场:自动充/换电、远程运维、备件、故障隔离、人工安全接管;
- · 流程:与 MES/WMS/PLC 的任务握手、工位状态同步、异常工单与责任边界。
3.3 人形并非唯一最优载体
|
形态 |
优势 |
劣势 |
优先场景 |
|
双足人形 |
楼梯/跨障、兼容人类空间、工具复用 |
控制复杂、能效低、跌倒风险 |
多楼层棕地、任务需全身高度变化 |
|
轮式双臂 |
稳定、续航长、载荷高 |
楼梯与门槛受限 |
平整厂房、医院、仓库、家庭主层 |
|
移动底盘+机械臂 |
生态成熟、模块化、ROI清晰 |
人类工具适配有限 |
搬运、拣选、巡检、机台上下料 |
|
固定工业臂/专机 |
节拍与精度最高、安全边界清晰 |
柔性低、改造成本高 |
高产量稳定工序 |
|
采购原则|先定义任务,再选择身体。只有当任务需要跨工位移动、双臂协作、高低位覆盖或人类工具兼容,并且场地改造成本较高时,人形溢价才可能成立。 |
4. 产业格局与商业化进展
4.1 市场底座:工业自动化仍是主战场
IFR《World Robotics 2025》显示,2024 年全球新安装工业机器人 54.2 万台,连续第四年超过 50 万台;在役存量约 466.4 万台。亚洲占新增部署 74%,中国单年安装 29.5 万台、占全球 54%,且中国厂商在本土市场份额首次升至 57%。这些数字不是人形机器人销量,但说明自动化客户、集成商、零部件和运维体系已经形成,为人形的工业验证提供了场景底座。[38]
|
区域/国家 |
2024 年工业机器人安装 |
结构特征 |
对人形产业的含义 |
|
全球 |
542,000 |
连续四年 >50万台 |
成熟客户体系,但专机竞争强 |
|
中国 |
295,000(54%) |
本土厂商份额 57% |
场景密度、成本与供应链优势 |
|
日本 |
44,500 |
机器人制造与精密机电强 |
零部件、客户与质量体系优势 |
|
美国 |
34,200 |
集成商多、AI/资本强 |
软件、模型与高价值场景领先 |
|
韩国 |
30,600 |
制造自动化密度高 |
电子/汽车场景与大企业导入 |
|
欧洲 |
85,000 |
安全标准、汽车与机械强 |
系统集成与合规能力突出 |
来源:IFR World Robotics 2025;口径为工业机器人,不含对人形的单独统计。[38]
4.2 全球代表性路线
|
企业/平台 |
形态与路线 |
已披露进展 |
证据判断 |
|
Agility Digit |
双足 + 任务型手;RaaS/物流 |
GXO 多年协议;自报搬运10万+料箱 |
商业现场较强,但任务窄、客户成本未公开 |
|
Boston Dynamics Atlas |
全电双足;工业全身操作 |
2026 产品版,现代汽车与 DeepMind 部署计划 |
工程积累深;规模数据待观察 |
|
Figure 03 / Helix 02 |
五指人形;分层全身VLA |
4分钟洗碗机、触觉精操、多机协作演示 |
前沿强;主要为公司自测 |
|
Apptronik Apollo |
模块化电驱;工业多用途 |
奔驰/Jabil合作;Google DeepMind伙伴 |
产业伙伴强;现场量化数据有限 |
|
1X NEO |
软包覆家用人形;数据优先 |
NEO Gamma 开始内部家庭测试 |
家庭定位明确;安全与自主度待验证 |
|
Unitree G1/H1 |
高性价比通用硬件平台 |
G1 起价低、开发者生态活跃 |
硬件普及快;应用软件需二次开发 |
|
优必选 Walker S |
工业人形;汽车厂场景 |
多家车企训练/示范工厂披露 |
中国工业场景先发;财务披露可跟踪 |
|
NVIDIA GR00T生态 |
模型+仿真+算力平台 |
GR00T N1.x、Isaac、Cosmos |
可能成为中立底座;依赖伙伴真实落地 |
说明:企业披露均为 C 级证据;“演示”“试点”“商业部署”“批量交付”在本报告中严格区分。[15][16][39][40][41][42][43][44][45]
4.3 商业化的四阶段门槛
1. 阶段 0|实验室演示:单机、受控物体、视频剪辑可接受;目标是证明能力存在。
2. 阶段 1|客户 PoC:限定区域和任务,人工看护;目标是验证安全、节拍和集成。
3. 阶段 2|付费部署:持续运行、SLA/服务、明确责任;目标是证明客户愿意长期付费。
4. 阶段 3|可复制扩张:跨站点、跨班次、软件复用;目标是让部署边际成本下降。
当前行业整体位于阶段 1 与阶段 2 之间。Digit/GXO 是少数公开进入多年 RaaS 的案例;多数厂商仍以联合开发、试点和意向订单为主。Figure、Google DeepMind 等的能力演示更能代表技术上限,而非当前商业平均水平。
4.4 单位经济性:应以“有效自主工时”计价
硬件售价不是核心经济口径。真正的每有效工时成本应包含折旧/租赁、现场集成、能源、维护备件、远程操作员、停机损失、安全设施和软件服务,再除以实际完成且无需人工返工的工时。
|
建议公式|每有效自主工时成本 =(年化设备与软件 + 集成摊销 + 运维 + 远程介入 + 停机损失)÷(计划工时 × 利用率 × 自主完成率 × 质量合格率)。 |
当任务种类少、节拍高且环境稳定时,专机通常更优;人形的经济价值来自减少工位改造、覆盖跨区域任务、以软件复用新增技能,以及在夜班/危险/难招聘岗位提高有效产能。
4.5 中美欧日的结构性差异
|
维度 |
中国 |
美国 |
欧洲/日本 |
|
优势 |
制造链完整、成本迭代快、场景和政策密度高 |
AI基础模型、芯片/云、资本与创业人才 |
精密机电、工业客户、安全标准、集成与质量 |
|
短板 |
高端传感/软件生态、原创基准、全球服务 |
制造成本、供应链本土化、工业部署人才 |
大模型平台和风险资本相对分散 |
|
典型策略 |
整机降本 + 场景示范 + 集群 |
模型/平台牵引 + 龙头客户联合开发 |
从工业可靠性和合规切入 |
|
胜负手 |
良率、核心部件、数据共享机制 |
通用模型、开发平台、生态锁定 |
认证、系统集成、长期运维 |
中国工信部《人形机器人创新发展指导意见》提出到 2025 年创新体系初步建立、整机实现批量生产,到 2027 年产业加速规模化,并明确“大脑、小脑、肢体”、数据、仿真、核心部件、场景和安全治理任务。[46] 政策能够加速供给和场景开放,但也可能造成同质化、重复投资与“以出货代替有效部署”,应以真实利用率和客户续约校验。
5. 核心瓶颈、风险与标准
5.1 七个尚未解决的技术瓶颈
- · 开放世界泛化:对未见物体有语义认识,不等于知道正确抓取点、力和失败恢复。
- · 长时序可靠性:若单步成功率为 99%,连续 100 个关键步骤全部成功的理想化概率也仅约 36.6%。
- · 安全与能力冲突:过度保守的安全滤波降低节拍,纯学习策略又缺少可证明边界。
- · 全身接触建模:足底、手掌、物体和环境多点接触导致非光滑高维动力学。
- · 数据质量:成功示范占比过高、失败/恢复数据稀缺、标注不一致、跨具身偏差。
- · 评测碎片化:不同硬件、任务、提示、物体和人工介入规则使成功率不可比。
- · 长期机电漂移:磨损、温度、电池、标定和地面摩擦变化会让离线策略逐渐失配。
5.2 安全:必须是独立于能力模型的系统属性
ISO 10218-1/2:2025 覆盖工业机器人及系统集成的安全要求,但 ISO 10218-1 明确不适用于公众可接触的服务机器人和消费品;个人护理机器人仍参考 ISO 13482,服务机器人安全标准也在演进。[47][48] 这意味着工业封闭区的人形部署与家庭/公共空间部署面临不同合规路径。欧盟《机械法规》还将与高风险 AI 安全组件要求衔接。[49]
|
安全层 |
控制措施 |
验证指标 |
|
机械本体 |
限力/限速、圆角软包覆、制动、跌倒管理 |
最大接触力、停止距离、跌倒包络 |
|
实时控制 |
关节限位、CBF/安全滤波、碰撞避免 |
最坏时延、约束违反率、降级可用性 |
|
任务与语义 |
危险指令拒绝、区域/对象权限、双重确认 |
越权率、误拒率、提示攻击测试 |
|
运行监控 |
异常检测、进度监测、不确定性、自动停机 |
故障提前量、漏报/误报、恢复时间 |
|
运营治理 |
风险评估、版本控制、日志、培训、保险 |
审计覆盖、变更追踪、事故闭环 |
|
网络与数据 |
身份、加密、更新签名、隐私最小化 |
渗透测试、供应链SBOM、数据留存 |
研究上,SafeVLA 通过约束学习探索安全—任务性能权衡,VLSA/AEGIS 将控制障碍函数作为可插拔安全层,Sentinel 结合动作一致性与 VLM 任务进度监控识别失败。[35][36][37] 共同方向是:生成式策略负责提出动作,独立安全层保留否决权。
5.3 评测应该从“成功率”升级为运营指标组
|
指标组 |
核心指标 |
为何重要 |
|
任务能力 |
成功率、质量合格率、周期时间 |
衡量任务价值 |
|
自主性 |
每千动作介入数、远程操作分钟/小时 |
识别“隐藏的人力” |
|
可靠性 |
MTBF、MTTR、连续自主小时 |
判断是否能跨班次 |
|
泛化 |
新物体/新布局/新指令/新站点性能 |
区分记忆与迁移 |
|
安全 |
近失、接触力、停止距离、危险指令通过率 |
进入人机共域的门槛 |
|
经济性 |
每有效工时成本、部署周期、技能切换成本 |
验证规模化 ROI |
VLA-Arena 的结果提示现有模型容易记忆训练分布、对视觉/结构变化不对称地脆弱,并在安全和长时序组合上表现不足。[36] 未来基准必须报告失败类型、人工介入规则和置信区间,而不只是平均成功率。
6. 2026—2030 趋势情景与行动建议
6.1 基准情景:工业多用途先行,家庭通用延后
|
阶段 |
技术形态 |
商业特征 |
主要不确定性 |
|
2026–27 |
分层全身策略;触觉/掌内视觉普及;仿真+真实共训 |
汽车/3PL/电子制造扩大付费试点 |
安全认证、连续运行、交付能力 |
|
2028–29 |
跨站点技能迁移改善;远程介入平台成熟 |
RaaS 与按有效工时计费增加 |
ROI、责任与保险、数据权属 |
|
2030 左右 |
少数平台实现多任务同机复用 |
工业规模部署形成;家庭仍为高价早期产品 |
开放世界可靠性、成本和社会接受 |
乐观情景下,人类视频迁移、合成数据和自动纠错显著降低数据成本,全身 VLA 在多个硬件上形成正迁移,工业部署在 2028 年前进入快速扩张。保守情景下,可靠性与安全认证进展慢、远程介入成本居高不下,人形被轮式移动操作和专机持续压制,行业经历并购与路线收缩。
6.2 技术研发路线建议
5. 架构:采用慢推理—快策略—实时安全三层解耦,明确每层频率、接口和可降级行为。
6. 数据:建立统一 episode 规范,记录成功、失败、接管、力/触觉、环境变化和版本元数据。
7. 评测:从单任务成功率转向连续 8—24 小时压力测试、跨站点复现与故障注入。
8. 安全:把 CBF/碰撞约束、动作监控、语义权限和物理急停做成独立“安全内核”。
9. 硬件:优先提高连续性能、手部寿命、标定自动化和现场可换模块,不追逐峰值自由度。
10. 开放性:支持 ROS 2/标准数据格式、模型回滚、日志导出与第三方安全审计,降低供应商锁定。
6.3 企业导入的 90 天验证框架
|
周期 |
关键活动 |
退出门槛 |
|
0–30 天 |
任务分解、危险分析、基线人工成本、场地和接口勘测 |
任务边界、数据口径、安全负责人明确 |
|
31–60 天 |
沙盒 PoC、失败注入、节拍/介入/能耗测试 |
达到最低成功率且无不可控危险模式 |
|
61–90 天 |
真实班次影子运行、WMS/MES 对接、维修演练 |
连续运行、介入率与单位经济性达标 |
|
扩展前 |
第二站点复现、版本回归、合同/SLA/数据条款 |
跨站点部署边际成本显著下降 |
6.4 投资与产业研究的领先指标
- · 客户从“签署合作”转为“付费续约/扩站点”,以及按有效工作量计费;
- · 真实现场连续运行小时、每千次介入、MTBF/MTTR,而非演示数量;
- · 同一硬件新增技能所需的数据小时、工程师周数和现场停机时间;
- · 关节/手部良率、供应商集中度、关键部件成本曲线与售后备件周转;
- · 训练数据中失败与恢复片段占比、自动发现高价值数据的能力;
- · 安全认证、保险承保、事故披露和第三方测试进展。
|
最终判断|2026 年的真正前沿不是“机器人做到了某件新奇任务”,而是同一模型、同一硬件能否在陌生变化下持续完成任务,并在失败前知道自己不确定、触发安全降级、快速恢复。产业价值将从能力展示转向可验证的自主性、可靠性和单位经济性。 |
附录 A|关键论文与项目导读
|
论文/项目 |
为什么重要 |
索引 |
|
RT-2 |
将动作离散为 token,验证网络知识向机器人控制迁移;VLA 范式起点。 |
[1] |
|
Open X-Embodiment / RT-X |
跨 22 种具身、100 万+真实轨迹的公共数据与正迁移证据。 |
[2] |
|
Octo |
RSS 2024;93M 开源扩散策略,强调跨观察/动作空间微调。 |
[3] |
|
OpenVLA |
7B 开源 VLA,建立可复现实验基线,同时暴露推理成本问题。 |
[4] |
|
π0 |
流匹配连续动作专家,面向高频灵巧和长时序操作。 |
[5] |
|
DROID |
大规模“野外”机械臂数据集,突出场景与采集者多样性。 |
[8] |
|
HumanoidBench |
RSS 2024;揭示通用 RL 在全身任务上的明显短板。 |
[18] |
|
H2O / HumanPlus |
以人类动作驱动全身遥操作和数据采集,连接人类视频与人形策略。 |
[20][21] |
|
ASAP |
RSS 2025;通过动力学残差对齐改善敏捷技能 sim-to-real。 |
[22] |
|
LangWBC |
RSS 2025;语言直接条件化全身控制与组合动作。 |
[19] |
|
HOMIE |
RSS 2025;低成本外骨骼/手套/踏板方案建立全身数据闭环。 |
[24] |
|
Sim-and-Real Co-Training |
RSS 2025;系统化验证仿真与真实共训的收益。 |
[26] |
|
Sentinel |
CoRL 2024;运行时检测动作异常与任务无进展。 |
[37] |
|
VLA-Arena / SafeVLA |
把安全、干扰、外推与长时序纳入系统评测。 |
[35][36] |
|
OpenHLM / HumanoidMimicGen |
2026 预印本;分别代表全身原生 VLA 与自动数据生成前沿。 |
[30][32] |
附录 B|参考文献与一手资料
[1] Brohan et al. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control, 2023. 链接
[2] Open X-Embodiment Collaboration. Open X-Embodiment: Robotic Learning Datasets and RT-X Models, ICRA 2024. 链接
[3] Octo Model Team. Octo: An Open-Source Generalist Robot Policy, RSS 2024. 链接
[4] Kim et al. OpenVLA: An Open-Source Vision-Language-Action Model, CoRL 2024. 链接
[5] Black et al. π0: A Vision-Language-Action Flow Model for General Robot Control, 2024. 链接
[6] Hugging Face. SmolVLA: Efficient Vision-Language-Action Model, 2025. 链接
[7] Chi et al. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion, RSS 2023. 链接
[8] Khazatsky et al. DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset, 2024. 链接
[9] Hugging Face. LeRobot documentation and dataset standard. 链接
[10] Li et al. Survey of Vision-Language-Action Models for Embodied Manipulation, 2025. 链接
[11] Mon-Williams et al. Embodied large language models enable robots to complete complex tasks, Nature Machine Intelligence, 2025. 链接
[12] Google DeepMind. Gemini Robotics technical report / launch, 2025. 链接
[13] Google DeepMind. Gemini Robotics 1.5, 2025. 链接
[14] Google DeepMind. Gemini Robotics On-Device, 2025. 链接
[15] NVIDIA. Isaac GR00T N1 and Physical AI platform, 2025. 链接
[16] Figure. Introducing Helix 02: Full-Body Autonomy, 2026. 链接
[17] Google DeepMind. Gemini Robotics 2 brings whole body intelligence, 2026. 链接
[18] Sferrazza et al. HumanoidBench, RSS 2024. 链接
[19] Shao et al. LangWBC, RSS 2025. 链接
[20] He et al. Learning Human-to-Humanoid Real-Time Whole-Body Teleoperation (H2O), 2024. 链接
[21] Fu et al. HumanPlus: Humanoid Shadowing and Imitation from Humans, 2024. 链接
[22] He et al. ASAP: Aligning Simulation and Real-World Physics, RSS 2025. 链接
[23] Huang et al. Learning Humanoid Standing-up Control, RSS 2025. 链接
[24] Ben et al. HOMIE: Humanoid Loco-Manipulation with Isomorphic Exoskeleton Cockpit, RSS 2025. 链接
[25] Niu et al. Human2LocoMan, RSS 2025. 链接
[26] Maddukuri et al. Sim-and-Real Co-Training, RSS 2025. 链接
[27] Junge & Hughes. Spatially distributed biomimetic compliance, Communications Engineering, 2025. 链接
[28] Fu et al. Mobile ALOHA, CoRL 2024 proceedings. 链接
[29] Zhao et al. Humanoid Everyday dataset, 2025. 链接
[30] Lin et al. HumanoidMimicGen, 2026 preprint. 链接
[31] WholeBodyVLA: Unified Latent VLA for Whole-Body Loco-Manipulation, 2025. 链接
[32] OpenHLM: An Empirical Recipe for Whole-Body Humanoid Loco-Manipulation, 2026. 链接
[33] RoboScape: Physics-informed Embodied World Model, NeurIPS 2025. 链接
[34] Figure. Project Go-Big: Internet-Scale Humanoid Pretraining, 2025. 链接
[35] Zhang et al. SafeVLA: Safety Alignment via Constrained Learning, 2025. 链接
[36] Zhang et al. VLA-Arena: Benchmarking VLA Models, 2025. 链接
[37] Agia et al. Unpacking Failure Modes of Generative Policies (Sentinel), CoRL 2024. 链接
[38] International Federation of Robotics. World Robotics 2025. 链接
[39] Agility Robotics & GXO. Multi-year Digit RaaS agreement, 2024. 链接
[40] Agility Robotics. Digit moves over 100,000 totes, 2025. 链接
[41] Apptronik & Mercedes-Benz. Apollo commercial agreement, 2024. 链接
[42] Boston Dynamics. Atlas evolution from research to industrial humanoid, 2026. 链接
[43] Unitree. G1 official specifications. 链接
[44] 1X. Introducing NEO Gamma, 2025. 链接
[45] UBTECH. 2024 annual report / Walker S industrial deployment disclosure. 链接
[46] 工业和信息化部:《人形机器人创新发展指导意见》,2023。 链接
[47] ISO 10218-1:2025, Robotics — Safety requirements — Part 1. 链接
[48] ISO/TC 299 Robotics standards catalogue. 链接
[49] EU Regulation 2023/1230 on machinery; consolidated text. 链接
[50] NIST AI Risk Management Framework 1.0. 链接
附录 C|术语表
|
术语 |
释义 |
|
VLA |
Vision-Language-Action,视觉—语言—动作模型。 |
|
VLM |
视觉—语言模型,负责语义、对象和空间理解。 |
|
WBC |
Whole-Body Control,全身控制。 |
|
Loco-manipulation |
移动与操作耦合的全身任务。 |
|
Action chunk |
一次预测未来一段动作序列,以降低自回归延迟。 |
|
Flow matching |
学习从噪声到连续动作分布的向量场。 |
|
Sim-to-real |
从仿真训练迁移到真实机器人。 |
|
RaaS |
Robotics-as-a-Service,机器人即服务。 |
|
MTBF / MTTR |
平均故障间隔 / 平均修复时间。 |
|
CBF |
Control Barrier Function,控制障碍函数,用于约束安全集。 |
如果这篇文章帮助到了你,你可以请作者喝一杯咖啡

浙公网安备 33010602011771号