机器人 / 物理 Agent Harness 综合分析与对比:从「更强的模型」到「更好的系统」

机器人 / 物理 Agent Harness 综合分析与对比:从「更强的模型」到「更好的系统」

目录


0x00 概要

本文覆盖五个在 2026 年集中出现、共同回答"如何为机器人/物理 Agent 构建 Harness"这一问题的代表性项目:

项目 一句话定位 关键论文 / 仓库
X-OmniClaw 边缘原生多模态 Android Agent,让手机具备「感知-记忆-行动」闭环 arXiv:2605.05765 / github.com/OPPO-Mente-Lab/X-OmniClaw
MemoHarness 让 Agent 的 Harness(六维控制面)从执行经验中学习,测试时逐用例自适应 arXiv:2607.14159 / github.com/HowieHwong/MemoHarness
HumanCLAW 具身评估框架:冻结 VLM + 原子技能 + 半物理模拟,衡量"动作智能" arXiv:2607.27180 / 未开源
RoboClaw 长程机器人任务的 Agent 框架:VLM 贯穿采集-训练-执行全生命周期 arXiv:2603.11558 / github.com/MINT-SJTU/RoboClaw
RPent(Harness VLA) 用 LLM Agent 编排冻结 VLA,把它"驾驭"成可靠的操控基元 arXiv:2607.08448 / github.com/RLinf/RPent

这五个项目不约而同地把优化重心从"模型权重"转移到了"包围模型的系统层"

  • X-OmniClaw 在边缘侧搭了三支柱架构;
  • MemoHarness 把 Harness 本身变成可学习对象;
  • HumanCLAW 用解耦把"决策智能"从"运动控制"中干净地分离出来;
  • RoboClaw 让同一个 VLM 贯穿数据全生命周期;
  • RPent 用固定基元库把冻结 VLA 变成可靠的螺丝刀。

模型负责"局部专长",Harness 负责"全局编排"——这是五份文档共同指向的核心判断。


0x01 面对的难点与核心冲突

1.1 核心冲突的一句话版本

我们先把五个项目各自面对的矛盾压缩成一句话:

模型的"单项能力"很强,但"放进系统里做事"的可靠性很差——失败时你甚至说不清是模型想错了,还是系统/身体执行错了。

把这句话展开,五个项目分别撞上了它的不同侧面:

  • X-OmniClaw 撞上的是"能力的入口过于碎片化":手机上的输入有截图、摄像头、语音、定时器、外部渠道,UI 有的能拿到结构化 XML、有的只有一张像素图,如何把这些异构信号融合成统一的执行意图?
  • MemoHarness 撞上的是"控制层的高维耦合与弱监督":context / tool / generation / orchestration / memory / output 六个维度互相牵连,改一个就要连带改其他五个;而 benchmark 只给"过/不过"的二元标签,无法告诉你是哪个维度出了问题;到了真实部署连这个二元标签都没有。
  • HumanCLAW 撞上的是"决策与执行的纠缠":机器人摔倒了,到底是"VLM 判断错了该不该上楼梯"(决策错),还是"腿没抬够高绊倒"(执行错)?结果无法区分,因此你永远测不出纯决策能力。
  • RoboClaw 撞上的是"三阶段语义断裂 + 长任务错误级联":数据采集、模型训练、部署执行由不同角色/进程驱动,成功判据和状态分布都对不上;且长任务一步错、步步错,步骤越多整体成功率指数下降。
  • RPent 撞上的是"范式错配":端到端 VLA 在局部接触操作上极强,但在语义重定向、目标换位等部署扰动下会"在错误的目标上执行完全正确的动作";LLM 编码式 Agent 擅长推理却写不出精细接触动作——两边都让错误组件承担了过多职责。

1.2 深挖:难点的四个层次

我们把上述矛盾归纳为四个递进的层次,这构成了整篇报告的分析骨架:

1-四个层次

核心冲突的完整表述:我们想让 Agent 在真实环境(物理世界 / 手机系统 / 终端命令行)里可靠地完成长程任务,但 (1) 无法把不同组件的职责干净切分、失败无法归因;(2) 决策所需的信息/记忆分散且不足;(3) 测试时没有反馈信号且验证机制薄弱;(4) 数据获取与经验沉淀成本高、分布错位。四个问题互相纠缠,单独修任何一个都会撞上其他三个。


0x02 这些项目如何解决这些难点

2.1 解法总览:一张映射表

我们把"难点 → 解法"的因果链画出来,这是本报告最值得反复看的一张表:

难点层次 典型问题 解决策略 代表项目
职责边界 决策与执行纠缠 决策-执行解耦:冻结决策者,把低级控制抽走/外包 HumanCLAW(半物理模拟抽走平衡)、RPent(VLA 只做接触)
职责边界 模型被要求什么都做 职责再分配:LLM 做规划/绑定/编排,模型只做擅长的事 RPent(LLM 编排 + VLA 接触)、RoboClaw(VLM 元控 + VLA 策略)
职责边界 文本与连续运动之间鸿沟 原子技能接口:把连续控制折叠成离散可组合的技能 HumanCLAW(8 个原子技能)、RPent(8 个基元)、RoboClaw(策略池)
信息记忆 异构输入碎片化 统一感知入口 + 时序对齐 X-OmniClaw(Omni Perception)
信息记忆 长程任务状态维持 分层记忆体系(工作/任务/长时) X-OmniClaw、RoboClaw、RPent、MemoHarness 全覆盖
信息记忆 经验无法复用 经验外置化:logs 升级为可检索的决策经验 MemoHarness(双层经验银行)、RPent(JSONL 轨迹+全局规则)
反馈验证 测试时无反馈 检索即自适应:训练期积累经验,测试期零额外搜索 MemoHarness
反馈验证 失败无法归因 诊断算子:把"过/不过"升级为"失败在哪个维度" MemoHarness(D1-D6)、HumanCLAW(确定性规则归因)
反馈验证 LLM 长上下文推理退化 短上下文验证器:用"当前视角即可回答"的 prompt 复查 HumanCLAW(技能专用验证器)
反馈验证 长任务错误级联 运行时过程监督 + 三级恢复(重试→恢复→人类) RoboClaw
数据进化 训练/部署分布不匹配 统一语义回路:同一决策逻辑贯穿三阶段 RoboClaw
数据进化 人工复位成本高 纠缠动作对(EAP):正反策略对自动复位循环 RoboClaw
数据进化 Harness 全局静态、不逐用例自适应 六维解耦 + 经验银行 + 测试时自适应 MemoHarness

2.2 三条贯穿性的解题主线

上面 14 条映射背后,其实是三条更抽象的主线,我们逐个拆解。

主线一:分层与解耦(Hierarchy & Decoupling)——把"想"和"做"切开。

五个项目不约而同地把系统切成"慢脑(决策/编排)"和"快脑(执行/控制)"两层。我们以 X-OmniClaw 和 RoboClaw 为例看这两层是怎么分工的:

慢脑(决策层,100ms+):看全局 → 拆任务 → 选动作/基元/工具 → 编排顺序
    │  由 LLM/VLM 承担,冻结或即插即用,不参与底层控制
    ▼
快脑(执行层,20ms 级):把决策翻译成连续的关节动作 / UI 点击 / 命令执行
    │  由 VLA 策略 / 运动生成器 / 确定性控制器 / 工具函数承担
    ▼
物理/系统(结果层):施加重力、碰撞、UI 响应等真实后果,返回新观测

关键设计判断是:分层不是目的,可归因才是目的。HumanCLAW 说得最直白——用半物理模拟把平衡/电机跟踪失败"抽走",失败就 100% 归因于决策;RPent 用确定性 Analytic Primitive 把非接触操作从 VLA 剥离,VLA 只负责接触瞬间,这样"抓取失败"能定位到 VLA,"路径不对"能定位到规划器。

主线二:基元化(Primitivization)——把连续空间折叠成离散接口。

VLM/LLM 只能输出离散 token,而人体有上百个关节、机械臂有连续动作空间,中间隔着一条鸿沟。三个项目给出同一解法的三种形态:

HumanCLAW:  8 个原子技能  walk/side_step/step_back/turn/climb/walk_down/sit/stop
RPent:      8 个基元      vla_act + move_to/rotate_wrist/rotate_pitch/move_pose/...
X-OmniClaw: 50+ 原子工具  device(snapshot/act/launch) / 系统 / 文件 / 记忆 / 调度 / 渠道

基元化的收益有三点:① 组合推理被强制推回给决策者("坐到沙发上"这种黑盒指令被禁止);② 每个基元可独立验证、独立训练、即插即用(HumanCLAW 新增技能只训一个 ControlNet,RPent 扩展只加一个方法);③ 失败归因粒度可控(能精确到"哪个技能/基元")。

主线三:经验外置与自进化(Externalized Experience & Self-Evolution)——把"跑分"变成"学习"。

MemoHarness 把这条主线讲得最系统。传统 Agent 是"一次配置,永久生效",logs 是死数据;MemoHarness 把每次执行变成一条可检索的决策经验(PerCaseEntry),跨案例再蒸馏成全局模式(GlobalPattern),测试时"检索即自适应"。RoboClaw 的 EAP 是物理世界版的同一条主线:正向策略做完任务、逆向策略自动复位,形成一个"练习→复位→练习"的自进化闭环,部署中的失败轨迹也回流训练。RPent 的 Memory(任务特定 JSONL 轨迹 + 全局 .md 规则)同样是经验外置——只是它"重绑定坐标、绝不重放坐标",比直接存参数更稳健。

一句话总结解法:五个项目用三种武器(解耦、基元化、经验外置)打同一场仗——把"模型会什么"和"系统要可靠"之间那道鸿沟,用一层可学习、可验证、可归因的 Harness 填上。


0x03 五个项目的详细对比

3.1 一张表看懂五个项目

维度 X-OmniClaw MemoHarness HumanCLAW RoboClaw RPent (Harness VLA)
领域 Android 移动 Agent 通用 Agent 控制层优化 具身智能评估 长程机器人操作 冻结 VLA 操控编排
核心对象 边缘设备上的自主手机 Agent Agent 的 Harness/六维控制面 VLM 的"动作智能" 机器人全生命周期 VLA 与 LLM 编排的结合
决策者 云端 LLM/VLM(编排)+ 本地 YOLO/OCR LLM Controller(策略决策) 冻结 VLM(零训练) VLM 元控制器(不训练) LLM Planner(不训练)
执行者 50+ 工具 / Intent 启动 / 行为克隆 生成的 HarnessImpl 代码 技能条件化运动生成器 VLA 策略(π0.5/ACT,需训练) 冻结 VLA_ACT + 7 个解析式基元
学习对象 无(行为克隆=记录 Intent 参数) Harness 本身(六维配置) 无(纯评估) 底层 VLA 策略 + 经验回流 规划器的编排策略(存 Memory)
记忆体系 工作记忆 + 长时个性记忆(Gallery) 双层经验银行(per-case + global) 文本历史(紧凑状态摘要) 角色/任务/工作三层记忆 任务特定 Memory + 全局 Memory
验证机制 后置动作检查 + 循环检测 + 上下文预算 诊断算子 g(·) + 词典序选择 技能专用短上下文验证器 运行时过程监督 + 重试/恢复/人类三级 基元执行后验证 + 重新 staging
失败归因 语义级(工具/阶段) 维度级(D1-D6) 决策级(身体意识/距离幻觉/...) 子任务级(重试/恢复分级) 基元级(VLA 接触 vs Analytic)
关键创新 双轨 UI 接地 + Intent 行为克隆 六维解耦 + 检索式测试时自适应 决策-执行解耦 + 半物理模拟 EAP 自复位 + 统一语义回路 固定基元库 + 感知隔离 + 文件 REPL
开源 ✓ (Apache 2.0, Kotlin/Python) ✓ (Python) ✗(未开源) ✓ (Python, LeRobot) ✓ (Python)
主要局限 Android 碎片化 / 隐私-云脱节 / LLM 延迟 搜索成本 / 泛化有限 / 预算混杂争议 半物理抽象 / 仅 sit 一种交互 / 无本体感知 EAP 仅限可逆操作 / 逆策略失败下界 基元库固定小 / 感知隔离脆弱 / 开环 chunk
发展阶段 最完整的产品级开源方案 研究原型,提出概念框架 研究基准,给出诊断结论 论文方案(开源实现尚未完整) 论文方案 + 较完整开源实现

3.2 按"模型是否冻结"分阵营

这是五者之间最干净的一条分界线,我们专门拆开看:

阵营 A:决策者冻结,纯编排(不训练任何决策参数)
  ├─ HumanCLAW:9 个 VLM 全冻结,零任务微调,衡量"互联网推理能外推多远"
  ├─ RPent:VLA 全程 torch.no_grad(),只学规划器的编排策略(存 Memory)
  └─ RoboClaw:VLM 元控制器用 in-context learning,但底层 VLA 策略要训练
       ↑ 注意 RoboClaw 是混合体:决策层冻结、执行层训练

阵营 B:把 Harness 本身变成学习对象
  └─ MemoHarness:在开发集上做结构化搜索,把六维配置调成最优 + 经验银行
       ↑ 学习的是"控制策略"而非"模型权重",训练/测试两阶段分离

阵营 C:不学任何东西,纯工程组装
  └─ X-OmniClaw:无模型训练;"智能"来自多模型编排 + 提示工程 + 行为克隆记录

这条分界线背后是一个此消彼长的权衡:模型越强,Harness 越可以"傻";模型越弱/越不可靠,Harness 越要聪明。2026 年这批工作的共同判断是:即使模型在快速变强(π0→π0.5→RLDX-1→LingBot-VLA),部署扰动下的可靠性问题并不会自动消失,所以 Harness 必须从"手工静态配置"进化为"可学习、可自适应、可验证"的层。

3.3 按"测量/优化对象"分视角

  • X-OmniClaw、RoboClaw 是"建造者":它们的目标是让系统真正干成事(手机助手、长程任务),用成功率/干预率/数据效率衡量。
  • HumanCLAW 是"考官":它不建造可部署系统,而是设计一场能隔离变量、可归因的考试,用来衡量"动作智能"。
  • MemoHarness、RPent 是"教练":它们优化"如何用现有模型",MemoHarness 教练控制层,RPent 教练编排策略。
  • 共同点:五者都承认——"模型能力"与"系统可靠性"之间有一条必须由系统层填平的鸿沟,这正是本报告的总论点。

0x04 当前业界的实现方案总结

站在 2026 年年中回看,业界对"机器人/物理 Agent 如何构建"已经沉淀出七条可辨识的实现路线,五个项目分别是其中若干条的典型代表:

路线一:分层编排(Hierarchical Orchestration)——已成事实标准。
几乎所有新系统都采用"慢脑决策 + 快脑执行"的两层甚至三层架构。差异只在:决策者是否冻结(HumanCLAW/RPent 冻结,RoboClaw 用 ICL)、执行者是否学习(RoboClaw 的 VLA 训练,RPent 的 VLA 冻结)。这条路线已从"学术选项"变为"工业默认"。

路线二:基元/技能化接口(Primitive / Skill Interfaces)。
把连续控制折叠成离散可组合接口,已成为连接 LLM 与物理/UI 的主流介质。从人类行为克隆(X-OmniClaw 记录 Intent)到原子技能(HumanCLAW)到基元库(RPent)到工具函数(RoboClaw 的 MCP 工具),本质是同一件事:让语言模型只做离散选择,让连续执行落到专用层

路线三:记忆外置化(Externalized Memory)。
"记忆不在上下文里,而在系统里"成为共识。X-OmniClaw 的工作/长时记忆、RoboClaw 的三层记忆、RPent 的双层 Memory、MemoHarness 的双层经验银行,都是把状态与经验从 LLM 上下文窗口里搬出来,变成可查询、可演化、可审计的持久层。

路线四:验证与过程监督(Verification & Process Supervision)。
从"跑完看结果"进化为"每步看状态"。RoboClaw 的运行时过程监督、HumanCLAW 的技能验证器(对抗长上下文退化)、X-OmniClaw 的后置验证 + 循环检测 + 上下文预算、MemoHarness 的诊断算子,四者指向同一个判断:可靠性来自"边做边查",而不是"一步到位"

路线五:自主数据引擎(Autonomous Data Engines)。
训练数据的获取正从"人工示范 + 人工复位"转向"系统自主采集"。RoboClaw 的 EAP(正反策略对自动复位)是最典型的代表;MemoHarness 的经验蒸馏、RPent 的探索式自举(seed 0 试错后固化轨迹)是同一思路的软件形态。

路线六:Harness 优化自动化(Automated Harness Optimization)。
这是 2026 年才真正成型的新路线。MemoHarness 把 Harness 优化定义为"六维结构化搜索 + 经验检索式自适应";同期出现的 Meta-Harness(Lee et al. 2026)优化 harness 代码本身;"Code as Agent Harness"(arXiv:2605.18747)把它上升为范式。业界开始把"手工调 prompt/参数"的隐性工程,变成可搜索、可归因、可迁移的一等研究对象。

路线七:评估基准的"解耦化"(Decoupling in Evaluation)。
HumanCLAW 代表了对评估方法本身的反思:与其给 Agent 一个模糊的环境,不如设计能隔离变量、失败可归因的考试(决策-执行解耦 + 半物理 + 确定性归因规则)。这与 MemoHarness 用"诊断而非分数"指导搜索、RPent 用"感知隔离"逼出 LLM 真视觉推理能力,同属"让评估更有信息量"的浪潮。

业界实现方案的七条路线可以用一句话收束:从"单体模型承担一切"走向"分层系统各司其职"——编排、基元、记忆、验证、数据、Harness、评估七个环,共同构成新一代物理 Agent 的完整拼图。


0x05 未来趋势判断

基于平行论文的互相印证,以及对当前方法的批评(尤其 Wang et al. 对 harness evolution 的"预算混杂"质疑),我们给出七条趋势判断,并按确信度排序:

趋势一(高确信):从"训练更强的模型"转向"构建更好使用模型的系统"。
RPent 明确说这是范式转移,MemoHarness 把控制层变成可学习对象,Code as Agent Harness 综述把它上升为领域。这个趋势的确定性最高——因为模型能力提升与部署可靠性之间的鸿沟不会自动合拢。

趋势二(高确信):Harness 优化从"手工"走向"自动化 + 匹配预算的严谨评估"。
MemoHarness 已示范"搜索 + 诊断 + 经验检索",但 Wang et al. 的批评一针见血:不匹配预算的比较会高估 harness 优化的收益。未来必然出现两类工作:① 更聪明的搜索(无监督信号、在线增量搜索、经验质量门控);② 更严格的评估(与 test-time scaling 在相同推理预算下对比)。

趋势三(高确信):执行层从"开环 chunk"走向"可中断闭环"。
RPent 论文自己承认"开环反馈结构是当前局限";VoLo 的"可中断 VLA + VLM 运行时介入"提供了直接方向。凡是需要连续视觉判断的任务,开环 chunk 都无法胜任——这是物理操作避不开的硬需求。

趋势四(中高确信):"具身自我意识"成为核心研究主题。
HumanCLAW 用 16.8% 成功率给出了本年度最尖锐的实证结论:识别不是瓶颈,模型不知道自己身体在哪才是。MirrorBench(镜子自我识别)、AwareVLN(自省导航)、CapNav(身体维度忽视)从不同角度互相印证。预计身体感知后训练、本体感知/接触信号输入、内部身体模型会成为下一轮热点。

趋势五(中确信):评估基准统一化与"有信息量的成功定义"。
HumanCLAW 的"主观确认"(客观到达 + 主动承认)直指一个更深的问题:现有 benchmark 的"成功率"高估了 Agent 的真实能力。未来基准会要求"到达即自省"(知道'我到了'),而不是仅仅"物理上到了"。这与 MemoHarness 批评者的诉求(预算匹配、持出集泛化)共同指向评估严谨化。

趋势六(中确信):在线/持续学习与跨 Agent 经验共享。
MemoHarness 附录明确画出路线图:有监督搜索 → 在线经验积累 + 增量蒸馏 → 无监督搜索 → 多 Agent 联邦式经验共享。RoboClaw 的 EAP 部署回流、RPent 的 Memory 固化都是雏形。真正的"越用越强"需要解决经验质量保障(避免偶发成功被蒸馏成错误模式)与灾难性遗忘。

趋势七(低-中确信):多模态传感融合与真实世界验证。
HumanCLAW 的麻婆豆腐压力测试、RPent 的厨房场景推演都暴露了纯 RGB-D 感知的极限(透明物体、反光、蒸汽、软体变形)。温度、触觉、力传感器 + 多光谱融合 + 流体/软体物理引擎,是走向真实厨房/家庭的必经之路;而"解耦时学到的决策能否迁移到真实双足/双臂"仍是未经验证的开放问题。

两股反向力量值得注意:① 保守派(Wang et al.)提醒我们 harness 优化的增益可能部分来自"多了几次搜索尝试"而非"学到了更好的策略"——这条批评会持续收紧该领域的可信度标准;② 激进派(Google Project Astra 传言等)提醒我们,如果系统级 Agent 能力被平台方收编,第三方 Agent 获取系统级权限的窗口可能关闭。


0x06 双视角解读:难点、解决方案与未来趋势

本节对前三节最核心的三个命题,分别用"十二岁孩子"和"专业人士"两种语言各讲一遍。

6.1 难点:为什么"模型很强,系统却不可靠"?

给孩子讲:

想象你有一个特别聪明的朋友小明,他数学超好、记忆力超好,但你让他"去厨房把蓝碗里的苹果拿出来放到红盘子上"——他会走到半路忘了要干嘛,或者走到苹果前却不知道自己已经"到了",甚至可能撞到桌子还把杯子打翻。小明不是笨,他只是没有"身体的感觉":他的眼睛在看着世界,但他的脑子感觉不到"我的手在哪、我离苹果还有多远、我刚才撞到了什么"。

再打个比方:你让一个很聪明但是坐在轮椅上的司机开车。他能看懂导航、知道路线,但他控制不了油门刹车(手够不到),车一跑偏他也不知道(没有车身反馈)。整个系统就这样——聪明的大脑和听话的身体之间,缺一根"连线"。这就是所有机器人/手机助手最难的地方。

给专业人士讲:

这是一个"能力-可靠性"错位问题,可以形式化为三层纠缠:① 职责纠缠——系统失败 f = h(VLM 决策, 执行误差, 平衡失败),无法反卷积出责任主体;② 信息纠缠——决策所需的本体感知/接触信号/历史状态要么不存在、要么被塞进一个会退化的长上下文里;③ 信号纠缠——benchmark 只给二元奖励,不提供"失败在哪个环节"的归因信号,且真实部署连二元奖励都没有(测试时无反馈)。MemoHarness 把这个问题表述为"control layer 高维耦合 + 弱监督 + 无反馈";HumanCLAW 把它表述为"决策与执行在物理后果上不可分离";RPent 把它表述为"两个范式把错误组件分配了过多职责"。三条表述指向同一个结构:缺乏一层能把职责切清、能产生归因信号、能在无反馈时依然自适应决策的系统层

6.2 解决方案:解耦 + 基元化 + 经验外置为什么有效

给孩子讲:

我们把问题拆成三招,就像给小明配一个教练和一个遥控器:

  • 第一招,分工:让小明只负责"想"(看、猜、决定下一步),让一个"机器人替身"负责"动"(走、抓、放都做得特别标准,绝不摔跤)。这样万一没做好,我们就能确定——一定是小明想错了,不是替身不听话
  • 第二招,把动作变成"命令卡":不许小明说"你去完成整个任务"这种大话,只准他说"往前走半米""向右转 30 度""坐下"这些小命令。每张命令卡游戏会自动执行得完美。想得对就赢,想错就输,清清楚楚。
  • 第三招,记笔记:小明每次做完都记下来"在沙地上转弯要慢一点""上次到椅子前 0.5 米就宣布到了是错的"。下次遇到差不多的情况,先翻笔记再行动,不用再犯同样的错。

三招合起来,就是五个项目共同做的事:聪明的脑袋 + 听话的身体 + 一本越来越厚的好经验手册

给专业人士讲:

三招的学名分别是 解耦(decoupling)、基元化(primitivization)、经验外置(externalized experience),它们各自解决一个结构性缺陷:

  1. 解耦解决"归因不可能"的问题。HumanCLAW 用半物理模拟(世界走刚体物理、人体走等价运动学速度)把平衡/电机失败剔除,使"失败 = 决策失败"成为可证命题;RPent 用冻结 VLA + 解析式基元把"接触 vs 编排"的失败分离;RoboClaw 用慢脑/快脑分离把语义决策与确定性控制解耦。解耦的收益是失败归因的因果确定性,代价是牺牲了真实世界中被解耦掉的那部分挑战(平衡、电机耦合、本体感觉)——这是 HumanCLAW 被批评者围攻的软肋。
  2. 基元化解决"文本-连续鸿沟"与"组合推理被偷走"的问题。把 >100 维连续控制折叠成 8 个原子技能后,VLM 只做离散选择,运动生成由 ControlNet 兜底;组合责任被强制推回决策者,杜绝"坐到沙发上"这类把寻找/定向/承诺塞进黑盒的指令。基元化的工程红利是每个基元可独立验证、独立训练、即插即用,缺陷是基元库的完备性决定能力上限(RPent 的"固定且小"假设在厨房场景立刻破产)。
  3. 经验外置解决"无反馈部署"与"数据/经验不能复用"的问题。MemoHarness 的"训练期搜索 + 测试期检索"是教科书式的解法——把需要标签的搜索压缩到开发集,部署时靠余弦相似度检索经验,实现零额外搜索的自适应;RoboClaw 的 EAP 则是物理世界版的"自复位数据引擎",把采集分布对齐部署分布。三者的共同代价是经验质量没有保证:一次偶发成功被蒸馏成全局模式,就会系统性教坏后续所有用例。

6.3 未来趋势:往哪里走

给孩子讲:

以后机器人会变成什么样?我猜有四个方向:

  1. 更像"教练+运动员"组合:以后重要的不是找一个什么都会的"超人",而是"聪明的教练"和"专门的运动员"配合——教练看全局做决定,运动员专练自己拿手的动作,还能练出新动作。
  2. 命令卡越来越多、越来越细:从"走/转/停"进化到"抓/切/倒/拌",每一张卡都能被精确检查做没做对。
  3. 机器人慢慢学会"感觉自己的身体":这是最难的一步,就像闭着眼睛也能知道手在哪儿。现在最聪明的 AI 都做不到,所以这是最大的宝藏。
  4. 机器人会记笔记、会互相学:今天失败的教训,明天不再犯;这个机器人学会的,别的机器人也能学会。

给专业人士讲:

趋势可以压缩为三个结构性的转向:① 优化对象的迁移——从 model weights 到 system control layer,证据是 MemoHarness/Meta-Harness/Code as Agent Harness 的连续出现与"Harness Engineering vs Prompt Engineering"的正式分野;② 反馈通道的丰富化——从稀疏二元奖励到维度级诊断(MemoHarness)、到执行时介入(VoLo 的可中断 VLA)、到本体感知与接触信号(HumanCLAW 建议的对照实验)、到过程监督(RoboClaw),这条线的本质是把"跑完才知道"变成"边做边知道";③ 评估的严谨化——匹配预算对比、持出集泛化、主观确认式成功定义、确定性归因规则,这条线会持续挤压"PPT 式 Demo"的生存空间。

最值得盯的三个拐点:其一,当 VLM 开始具备可靠的身体状态估计(proprioception 重建)时,HumanCLAW 的 16.8% 会跳涨,同时也说明该基准测的是"信息缺失"而非"能力缺失"(两可解释至今未决);其二,当 harness 优化在匹配预算下证明自己的独立价值(而非预算红利)时,MemoHarness 一系的地位将被确认,否则会被归并为"test-time scaling 的一种特殊形态";其三,当平台方(Google/Apple 等)把系统级 Agent 能力收编进 OS 时,第三方 Agent 的权限获取窗口决定整个生态的走向。

0x07 总结

五篇论文指向同一个判断:物理/机器人 Agent 的下一场增量,不在"更强的模型",而在"更好的系统"。

X-OmniClaw 证明了这套判断在边缘移动端成立——完整的三支柱栈 + 工业级可观测性,是当下最接近产品化的蓝图;MemoHarness 把它上升为方法论——控制层六维可学习、经验可复用、测试时零反馈自适应,同时接受着"预算混杂"的严肃拷问;HumanCLAW 用一场干净的解耦考试揭示出最深的短板——模型看得见世界,却感觉不到自己的身体;RoboClaw 用 EAP 和统一语义回路打通了"越用越强"的数据闭环,却被"可逆性"牢牢框住;RPent 用冻结 VLA + 固定基元库示范了"驾驭比重新训练更可靠",却撞上"开环 chunk 与连续视觉判断"的墙。

它们各自的缺点,恰恰就是彼此的去处:HumanCLAW 缺本体感知,RPent 缺闭环与可编程控制,RoboClaw 缺不可逆操作与仿真,MemoHarness 缺匹配预算的证明与在线进化,X-OmniClaw 缺标准评估与权限治理。把这些短板补起来的方向——身体意识、可中断执行、经验质量门控、匹配预算评估、多传感融合——就是下一代机器人 Agent Harness 的完整施工图。


第二部分 五个项目逐一拆解


2.1 X-OmniClaw:边缘原生多模态 Android Agent

2.1.1 基础架构与基本功能

X-OmniClaw(OPPO Mente Lab)把手机视为一个"第一人称计算接口",围绕感知-记忆-行动三位一体构建。它要解决的核心矛盾是:云端虚拟化方案拿不到真实设备上下文、纯截图视觉方案缺乏结构化精度、单体自动化缺乏跨任务连续性。基本功能包括:多模态输入(语音/视觉/UI)融合理解、跨 App 多步任务执行、个性化记忆(相册语义化 + 用户画像)、行为克隆(把用户导航路径提炼为可复用技能)、定时/外部渠道(飞书/Discord)自动化。

它采用 Kotlin + Python (Chaquopy) 混合架构:Kotlin 负责平台胶水(UI、工具执行、HTTP 调用),Python 负责 Agent 业务逻辑(迭代控制、上下文预算、循环检测),两者通过 KotlinBridge 模式交互。这个"薄桥接层"架构在移动端不多见,却带来了良好的关注点分离与可维护性。

2.1.2 架构图(四层闭环)

1-X-OmniClaw

2.1.3 数据流(以"这个多少钱"比价为例)

用户输入("这个多少钱" + 摄像头帧)
  → Omni Perception: VLM 识别"用户手持 Evian 喷雾"
      意图分解: {app:"taobao", action:"search", keywords:"Evian 喷雾 价格"}
  → AgentLoop (Python):
      Iter1: 调 LLM → 返回 device(action="launch", target="com.taobao.taobao") → 执行OK
      Iter2: snapshot 观察结果页 → LLM 返回 device(action="act", tap 搜索框) → 执行OK
      Iter3: type 输入 → 搜索 → scroll → screenshot → VLM 提取价格 → 组装回答
  → Omni Memory: Working memory 维持多轮状态;Gallery memory 闲时照片语义化
  → 结果返回: UI 气泡 / TTS 朗读;session_log 落盘

2.1.4 优点

  1. 系统完整性:当前 Android Agent 生态中工程最成熟、方案最完整的开源一次性方案。
  2. 务实的工程路线:行为克隆走 Intent 参数化而非端到端学习,UI 理解走双轨决策而非单一路径,都经得起生产考验。
  3. 工业级可观测性:五层日志 + 14 种运行时进度事件 + Crash 面包屑,调试/运维层面具备生产准备度。
  4. 隐私优先设计:感知与操作本地完成,仅"动脑子"才调云端,含脱敏过滤(ImageMemoryPrivacyFilter)。
  5. 自控制模块self-control/ 让 Agent 能内省并修改自身运行时状态(导航/配置/服务/日志查询),业界最早的"Agent 自省"开源实现之一。

2.1.5 缺点

  1. Android 碎片化:重度依赖 AccessibilityService,MIUI/EMUI/One UI 对无障碍树支持参差,碎片化是生态固有问题。
  2. 电池与热功耗:活跃会话功耗 +15%,CameraFramePusher + YOLO ONNX + 频繁截图难以 7×24 后台运行。
  3. LLM 仍是瓶颈:复杂任务累计 10-40 次 LLM 调用,延迟和成本是部署核心障碍;"边缘原生"名不副实(照片摘要/规划仍需云端)。
  4. 隐私-云脱节矛盾:VLM 语义摘要仍需把照片发云端,脱敏与上云自相拉扯。
  5. 缺乏标准化 Benchmark:以三个 Demo 而非定量指标展示效果,第三方难以复现("PPT Agent"批评)。
  6. 状态管理分散:运行时状态散布在 Python 字典、ContextManager、MMKV、MemoryIndex,无事件溯源,审计困难。

2.1.6 改进方向

  1. 标准化评估:在 AndroidWorld/OSWorld 上建立 SR/步数/token/延迟基线。
  2. 对抗性 UI 测试框架:广告弹出、动态布局、A/B 切换、网络延迟注入。
  3. 隐私技术栈强化:差分隐私/联邦学习,VLM 摘要本地化(Gemma 4/Qwen-VL 边缘可运行)。
  4. 统一状态管理:事件溯源,Agent 动作全部不可变事件化,支持审计回放。
  5. 权限治理框架:Read-only / Approval-required / One-time 分层权限模型。

2.2 MemoHarness:让 Agent 的缰绳从经验中进化

2.2.1 基础架构与基本功能

MemoHarness 的核心洞察是:Agent 的性能瓶颈往往不在基础模型本身,而在包围模型的"控制层"(Harness)——上下文如何组装、工具如何调用、生成如何配置、多步推理如何编排、记忆如何管理、输出如何校验。同一模型同一工具,不同 Harness 可造成数十个百分点的差异;但传统 Harness 是静态的、全局统一的、靠工程师手工调参的。MemoHarness 让它可学习、可记忆、可逐用例自适应

它有两个生命阶段:阶段一(训练)在有参考答案的开发集上做六维结构化搜索 + 诊断 + 经验蒸馏;阶段二(测试)对每个新用例检索经验银行,零标签、零反馈、零额外搜索地自适应出 case-specific Harness。基本功能包括:六维 Harness 配置模型、引导式搜索、双层经验银行、测试时检索自适应、正确性优先的词典序选择。

2.2.2 架构图(双阶段)

1-MemoHarness

2.2.3 数据流(核心搜索循环)

Step 1: W0 = make_minimal_config()   # D1无demo/D2无工具/D3 temp=0/D4 single_call/D5无记忆/D6直通
Step 2: for t = 1..T:
   q_t = Q(W_{t-1}, B_{t-1})              # 构建检索查询
   S = Retrieve(B, q_t)                    # 检索相关经验
   W_t = Π_train(W_{t-1}, S)               # Controller 生成新 harness
   for each x_i: 执行 → r_i=奖励 → z_i=g(诊断: 成功?主维度?分析)
   写入 E_t;更新 case_stats;每 N 轮或连续失败≥3 触发 Distill→G_t
Step 3: W* = 词典序 argmax(r_mean, -c_mean)
Step 4: 每个测试 case: 检索 Top-K 成功/失败 → Π_test → W(x_j) → 执行

2.2.4 优点

  1. 系统性的 harness 解耦:六维分解是第一个把 Agent 控制层完整形式化的框架,为后续研究提供清晰分类学。
  2. 经验复用:检索式自适应在 zero-shot 测试场景高效,无需每个新 case 重新搜索。
  3. 跨模型迁移:6 个基础模型上 +9.8% 平均提升,说明学到的不只是模型特定的 prompt。
  4. 正确性优先设计:词典序选择(r_mean, -c_mean)防止搜索漂移到"便宜但错误"的配置。
  5. 开源代码质量高:数据模型清晰、模块化好、注释充分,是很好的研究起点。

2.2.5 缺点

  1. 搜索成本不匹配基准比较:与固定 harness 的比较没算搜索预算,被 Wang et al. 明确指出。
  2. 泛化性有限:自身报告是"选择性"迁移;平行研究显示持出集几乎无增益。
  3. 单一 baseline 模型:主要实验只用 GPT-5.3-Codex。
  4. 归因不完整:无消融说明每个维度的独立贡献(论文自己承认)。
  5. 经验质量无保证:一次"运气的成功"可能被蒸馏成错误全局模式,且经验中毒(错误诊断被放大)未讨论。
  6. 检索延迟:测试时检索 + 自适应增加每次调用延迟。

2.2.6 改进方向

  1. 匹配预算的基准比较:与 parallel sampling 在相同推理成本下对比。
  2. 经验质量门控:蒸馏前验证模式可重现性(多次重复验证)。
  3. 在线学习:部署后持续积累经验,触发增量搜索。
  4. 归因消融:找出哪些维度最值得搜索。
  5. 无监督搜索:探索无参考答案时的 harness 优化(论文已列 future work)。
  6. 跨组织经验隔离:多租户共享经验银行时的安全与隐私。

2.3 HumanCLAW:解耦决策与执行,衡量"动作智能"

2.3.1 基础架构与基本功能

HumanCLAW(Meta + NTU + UW + Brown + Northwestern,2026.07)回答一个尖锐问题:VLM 能否通过一个物理身体行动? 核心创新是解耦:闭环中冻结的现成 VLM 只负责"决策"——每 0.5 秒发出一个原子技能指令(walk(x,z,ψ)sit(h)),一个技能条件化运动生成器把它变成 0.5 秒的连续全身运动,一个半物理模拟器在世界中执行并施加重力、碰撞、摩擦的真实后果——但把平衡、电机跟踪这类低级控制失败完全排除。这样任务失败 100% 可归因于决策。

基于此构建的 HumanCLAW-Bench 含 41 间室内场景 1,218 个第一人称"寻找-导航-交互"长程 episode,测试 9 个前沿 VLM,最佳仅 16.8% 成功率。核心发现:识别目标不是瓶颈(感知接近饱和),真正的瓶颈是"具身自我意识"缺失——模型不知道自己身体在哪、是否已到达、是否撞到障碍。

2.3.2 架构图(三模块闭环)

1-HumanCLAW

2.3.3 数据流

决策:  ⟨s_t, c_t⟩ = H(p, o_t, h_t)      # H = harnessed VLM
验证:  ⟨s_t, c_t⟩ ← Verifier(⟨s,c⟩, o_t, body_state)   # 不通过则替换修正技能
运动:  x̂_t^fut = G(x_t, s_t, c_t)      # G = 技能条件化生成器
物理:  o_{t+1} = W(x_t, x̂_t^fut)       # W = 半物理模拟器
归因:  失败 episode → 确定性规则分类(身体意识34% / 距离幻觉30% / 中层推理17% / ...)

2.3.4 优点

  1. 方法论创新:决策-执行解耦让"动作智能"首次可独立测量、失败可精确归因。
  2. 严谨的错误归因:自动化、确定性、可复现的根因分类器,无人工标注。
  3. 深刻的实证发现:"具身自我意识缺失"是有说服力、可操作的结论,并量化了各失败模式。
  4. 工程优雅:原子技能 + ControlNet 即插即用 + 零初始化 = 可扩展、可维护。
  5. 公平对比:9 个模型统一脚手架、统一度量,开源模型接近前沿的发现对社区有价值。
  6. 可操作建议:验证器/中层推理/文本历史的消融为"如何改进具身智能"提供具体方向。

2.3.5 缺点

  1. 半物理抽象牺牲了"平衡与电机耦合"的真实挑战(被批评为"为 VLM 回避真实挑战")。
  2. 交互词汇表单一(只有 sit),动作智能覆盖范围窄。
  3. 无 proprioception 接口:"自我意识缺失"可能源于信息不足而非能力缺失(两可解释)。
  4. 无与 fitted policy 的对照,"推理者泛化>策略泛化"的哲学承诺未经检验。
  5. 样本量/场景数有限(1,218 episodes / 41 场景),无置信区间。
  6. 归因粒度限于技能层面,技能内参数错误未被区分。
  7. 数据策展依赖人工,技能扩展成本可能随规模上升。
  8. 运动先验与场景错位:AMASS 无场景上下文,坐姿不包含"避让沙发靠背",暴露"位置-运动分离"的深层局限。

2.3.6 改进方向

  1. 丰富交互词汇表:加入抓取、放置、开门等,测试更精细的身体放置。
  2. 增加本体感知通道:有/无 proprioception + 接触信号的对照实验,厘清"缺失输入 vs 缺失能力"。
  3. 与 fitted policy 对照:RL/BC 训练的人形策略在同一基准对比,检验核心哲学假设。
  4. 持续记忆与自定位模块:spatial memory(拓扑地图)而非仅靠文本历史。
  5. 动态技能参数化:场景感知的坐姿(给定座椅位置+朝向),弥合"位置-运动分离"缺陷。
  6. 真实人形迁移:把 half-physics 训练出的决策者接到真实双足机器人。
  7. RL/后训练改进身体意识:身体感知后训练、接触信号、中层推理例程。
  8. 难度自适应验证器:根据身体状态/进度动态调整检查强度。

2.4 RoboClaw:VLM 贯穿全生命周期的长程任务 Agent 框架

2.4.1 基础架构与基本功能

RoboClaw(arXiv:2603.11558)解决的核心问题是三阶段语义断裂:数据采集、模型训练、部署执行由不同角色/进程驱动,导致语义不一致、分布不匹配、错误级联。解法是统一语义回路:用一个 VLM Agent 贯穿三阶段,使决策逻辑、成功判据、状态表示在采集与执行中保持一致。

基本功能:任务分解(CoT)、子任务选择(VLM + ICL)、策略执行(VLA 底层控制)、状态检查(Env Summary 工具)、错误恢复(重试/恢复/人类三级)、闭环学习(部署数据回流训练)。其核心创新 EAP(纠缠动作对) 为每个策略配一对正/反策略,正向执行完自动逆向复位,形成"练习→复位→练习"的自进化数据采集循环,把人工干预降到 1/8。

2.4.2 架构图(慢脑/快脑分离)

1-RoboClaw

2.4.3 数据流(从用户指令到自进化闭环)

User 任务指令 → VLM 元控制器(CoT推理+子任务选择) → MCP 8组工具
      → VLA Policy(π0.5/ACT) → 动作序列 A_t → 机器人执行
      → 失败分析 → 恢复策略 → 反馈到 VLM 重规划        ← 备份路径
      → EAP: 正向↔逆向自复位 → 轨迹 τ=(τ^→,τ^←)
          → Dataset(Parquet+MP4) → Trainer(LoRA微调)
          → PolicyLib(更新版本) → 回流部署策略          ← 数据回流闭环

2.4.4 优点

  1. 统一语义回路:同一 VLM 贯穿采集/训练/执行,训练时看到的状态 = 执行时遇到的状态。
  2. EAP 自复位数据引擎:人工干预降至 1/8,数据采集效率提升 53.7%,且采集分布对齐部署分布。
  3. 运行时过程监督 + 三级恢复:重试→恢复策略→人类介入,长任务错误不级联放大。
  4. 慢脑/快脑分离 + 双层互斥 + SafetyGateway:架构上保证硬件安全。
  5. 越用越强闭环:部署失败数据回流训练,策略版本持续升级(5 轮 EAP 采集:润肤露放置 42%→86%)。
  6. 零代码本体接入:对话式 onboarding 自动生成 Manifest/发现串口/校准。
  7. LeRobot 生态集成:14 策略/11 机器人,扩展策略只需 30 行 Pipeline builder。

2.4.5 缺点

  1. EAP 前提假设强:要求每个正向操作有可行逆操作;拧开瓶盖可逆,撕开包装/加热/切割不可逆——适用范围局限于可逆操作。
  2. 逆策略成功率下界:P(EAP 完整) = P(正)×P(逆),逆向失败 14%-28% 时环境可能进入两策略都无法处理的未知态,仍需人类介入。
  3. VLM 延迟瓶颈:每步决策 1-3 秒云 API 延迟,执行模式重规划延迟更突出。
  4. 策略间独立性假设:多次自复位后的渐进状态漂移未量化。
  5. 开源实现与论文差距:论文用 π0.5(闭源)而开源用 ACT;EAP 尚未完整实现;AGIBOT G01 专有。
  6. 仿真不足:无 sim-to-real 域迁移工具,实验全在真实环境、成本高。
  7. 实验局限性:仅 4 种抓取类任务、单一机器人平台、一个长任务。
  8. 安全性隐忧:逆策略失败可能产生危险动作;仅"Call Human"兜底,缺硬件级安全约束。

2.4.6 改进方向

  1. 推广 EAP 到不可逆操作:虚拟逆操作、仿真逆向复位(sim-to-real 混合 EAP)、消耗品替换复位。
  2. 延迟优化:本地 VLM 推理、预测性预加载、简单状态走规则/复杂状态才调 VLM 的混合推理。
  3. 策略间依赖建模:环境状态追踪器量化状态漂移,超阈值触发重新校准;学习 Q(s,a) 评估可持续性。
  4. 扩展机器人能力:导航、mobile manipulation、多机器人协作。
  5. 强化仿真管线:MuJoCo/Genesis 集成、域随机化迁移、仿真预训练 + 真机微调。
  6. 架构级安全:关节限位、力矩监控、碰撞检测,与 VLM 决策交叉验证。
  7. 经济性分析:token 消耗、端到端推理成本、与纯人工方案的经济对比。

2.5 RPent(Harness VLA):用 LLM 编排冻结 VLA,驾驭成可靠操控基元

2.5.1 基础架构与基本功能

RPent 的诊断非常犀利:VLA 模型在标准测试里 96% 成功率,环境稍变(换位置、换指令指代)就跌到 50%——不是 VLA 不会抓,而是它在错误的目标、错误的时间、错误的状态下执行。原因是 VLA 被要求同时做语言理解、语义绑定、空间推理、长程组合、局部控制五件事,而它只擅长第五件。

解法:用 LLM Agent 做前四件,让 VLA 只做第五件。中间通过一个冻结的基元库连接:一个基于学习的 VLA_ACT 原语(封装冻结 VLA,只做接触操作:抓取/放置/按按钮/转旋钮)+ 7 个确定性 Analytic 原语(move_to/rotate_wrist/rotate_pitch/move_pose/set_gripper/release/navigate_to,处理所有非接触操作)。系统通过文件介导的 REPL 协议通信(command.json → 执行 → state_NN.json + 图像 + 深度图 → LLM 读取 → 循环),该协议受 Claude Code / Codex 启发。

它有两个生命阶段:探索式自举(seed 0,有 reset 权限,宽松预算,试错后写 Task-Specific Memory + Global Memory)与部署评估(reset 禁用,预算紧缩,检索 JSONL 轨迹但重绑定坐标、绝不重放坐标)。

2.5.2 架构图

1-RPent

2.5.3 数据流(一个基元调用周期)

LLM 读 state_NN.json(任务语言+本体感觉+物体名,无坐标)+ RGB-D/world map
  → 解析当前接触目标(从 RGB 选稳定像素 → back_project 反投影 → 取中位数)
  → 写出 command.json 基元调用 c_t
  → 环境执行(VLA_ACT 用 pi0_pick 闭环判定,Analytic 用 OSC 伺服)
  → done_NN.flag → 生成 state_{N+1} + 图像 + 深度图
  → LLM 验证执行结果(检查接触/位置)→ 成功则继续,失败则重新 staging 重试

2.5.4 优点

  1. 职责再分配是核心贡献:VLA 只做接触,LLM 做绑定/编排/接地,成功率高且失败可归因(LIBERO-Pro 50.0%→82.4%)。
  2. 冻结 VLA + 固定基元库:部署可靠性高、VLA 权重永不更新、学习对象单一清晰。
  3. 文件介导 REPL:每步输入输出有完整记录,审计/调试可离线,LLM 可随时查状态。
  4. 感知隔离 + 深度反投影:证明 LLM 具备从 RGB-D 自行推理空间的能力(而不是依赖特权状态)。
  5. 记忆"重绑定不重放":避免过拟合 seed 0 坐标,跨布局可迁移。
  6. 工程实现扎实post_min_peak_zatan2 偏航提取、O(1) 反投影缓存等技术细节质量高。
  7. 评测成绩显著:Standard LIBERO 96.0%、RoboCasa365 Atomic 91.6%、RoboTwin C2R 58.4%(vs π0.5 47.9%)。

2.5.5 缺点

  1. 开环 chunk 反馈结构:论文自己承认——LLM 在 VLA 执行 5 步 chunk 期间完全盲视,无法执行时介入;对比 VoLo 的可中断 VLA。
  2. 感知隔离的脆弱性:深度噪声(边缘/透明/反光/细长物体)、手动选像素的推理密集、无闭环验证(选点错误会传播)。
  3. 基元库"固定且小"的假设:仅覆盖 LIBERO/RoboCasa/RoboTwin 三个模拟器;真实世界可能需更多基元(Cortex 用 32 个)。
  4. Memory 构建代价:每新任务需 seed 0 探索;若产生次优轨迹,re-grounding 效果受限;Global Memory 写入需人工反馈。
  5. 纯模拟器验证:真实世界的深度噪声、相机标定漂移、系统延迟未覆盖。
  6. 开环 vs 连续视觉判断矛盾:VLA 动作生成与视觉监控架构性分离,实时判断任务(搅拌变色/炖煮不沸)无法胜任。

2.5.6 改进方向

  1. 闭环集成:借鉴 VoLo 的"可中断 VLA + VLM 运行时介入",在 VLA 执行中持续观测。
  2. 在线适应结合:与 Agentic-VLA(在线适应 VLA 权重)结合——前者解决编排、后者解决适应,论文承认可互补。
  3. Memory 自动演化:Global Memory 写入自动化(摆脱人工 .md 反馈)。
  4. 感知泛化:SAM3 集成、更鲁棒的深度处理(透明/反光物体)。
  5. 真实世界验证:相机标定漂移、系统延迟、多光谱/触觉融合。
  6. 动态扩展基元库:按需扩展 CUT/POUR/STIR/SET_TEMP/WAIT_UNTIL 等,配合 VLA 训练数据扩展。

TransFormer-封面

posted @ 2026-09-22 20:11  罗西的思考  阅读(22)  评论(0)    收藏  举报