众擎机器人格斗:从看懂技术路线到能讲清 RL 仿真闭环
很多人第一次接触“机器人格斗 + 强化学习”会有两个感受:
- 词很多:BVH、policy、reward、Sim2Sim……
- 路线很长:看起来像一条“学不完”的流水线。
这篇博客的目标很实在:
把这条路线讲成人话,让初学者能在 10 分钟内看懂主线、1 小时内搭出自己的学习框架。
项目链接:https://github.com/Ethanjoker3615/zhongqing_robot_learning
1. 一句话主线(先别急着看术语)
众擎这类仿真路线,本质上是在做一件事:
把“人类动作示范”变成“机器人能学会并稳定复现的策略”。
你可以把它想象成三步:
- 先给机器人“标准动作作业答案”(reference motion)
- 再让它在仿真里反复练习(RL 训练)
- 最后换个考场再考一次(Sim2Sim)
2. 常见技术路线到底在干什么
团队里常说的流程:
BVH -> 重映射 -> RL训练 -> 策略导出 -> Sim2Sim
下面逐步翻译成“新手能抓住重点”的版本。
2.1 BVH:拿到动作原材料
BVH 可以理解为“人体关节动作录像的结构化版本”。
里面记录了每一帧的骨骼角度变化。
它不是给机器人直接执行的命令,只是原始动作数据。
2.2 重映射:把“人骨架”翻译成“机器人骨架”
人和机器人关节结构不一样,直接套肯定会炸。
所以要把人体动作重映射到机器人可执行的关节空间。
这一步产出的是 reference motion(参考轨迹)。
它更像“标准答案曲线”,不是最终控制器。
2.3 RL 训练:让机器人自己学会“逼近标准答案”
在 Isaac Sim / legged_gym 里定义:
obs(状态)action(动作)reward(评分)
然后用 PPO 训练策略 policy(obs) -> action。
2.4 策略导出:得到可部署的“大脑”
训练完成后导出策略模型。
这时你得到的是“给我状态,我给动作”的策略函数。
2.5 Sim2Sim:跨仿真复试
把策略从 A 仿真(比如 Isaac)迁移到 B 仿真(比如 MuJoCo)。
目的不是炫技,而是验证:
你的策略不是只会在一个环境里“背题”。
3. 一个具体学习场景(带目标)
假设你刚加入团队,目标是:
- 本周内能清楚复述全流程
- 能解释每一步输入输出
- 能说出你当前会什么、还欠缺什么
建议你按这 3 个“可交付物”来学:
- 一张流程图:把 BVH 到 Sim2Sim 串起来
- 一页术语卡:reference motion / policy / reward / Sim2Sim
- 一段 30 秒口述稿:能在面试里稳定输出
这比“闷头看代码”更快建立全局感。
4. 新手最容易踩的 4 个坑
坑 1:把参考轨迹当控制指令
错误理解:轨迹文件喂进去,机器人就会动。
正确理解:轨迹主要用于 reward 对齐,是“评分参考”。
坑 2:把框架当一键工具
错误理解:用了训练框架就自动出结果。
正确理解:你仍要自己做好数据、环境、reward 三件事。
坑 3:把概念混在一起
比如把 GMR 和 TF 混用。
前者偏动作曲线建模,后者偏坐标变换,不是一个层次。
坑 4:只看单仿真成绩
只在一个环境表现好,不能证明泛化。
至少做一次 Sim2Sim 才能更有说服力。
5. 最小可运行思维模型(不用公式先跑通脑子)
把训练循环想成 5 句:
- 读取当前状态
obs - 策略输出动作
action - 环境执行动作,得到新状态
- 用“当前动作 vs 参考动作”计算 reward
- PPO 根据 reward 更新策略
一句话总结:
拿参考动作当标准答案,持续打分,持续纠偏。
6. 给初学者的 7 天上手计划
Day 1-2:建立地图
- 画流程图(BVH -> Sim2Sim)
- 每步写输入/输出一句话说明
Day 3-4:建立术语边界
- 重点吃透 4 个词:reference motion、policy、reward、Sim2Sim
- 给每个词写“是什么 / 不是什么”
Day 5-6:看最小训练闭环
- 跟一次训练日志
- 把“obs-action-reward-update”写成自己的 5 步卡片
Day 7:做一次复述演练
- 录一段 60 秒讲解
- 对照术语卡检查是否混淆
这一套跑完,你还不是“能独立训练全栈的人”,
但你已经是“能说清楚主线并能稳定协作的人”。
7. 结语
众擎这类项目最容易把人劝退的,不是难度本身,
而是“没先建立学习坐标系”。
先把主线看懂,再把概念分开,再做最小闭环,
你会发现它不是一堵墙,而是一段可拆解的楼梯。
对初学者来说,这就够了。先上楼,再冲刺。

浙公网安备 33010602011771号