摘要:
【机器人 / 强化学习】QAM 与 DIVL:评价-执行闭环的完美配合 目录【机器人 / 强化学习】QAM 与 DIVL:评价-执行闭环的完美配合0x00 概要0x01 为什么需要两个算法?1.1 先想清楚要解决什么问题1.2 闭环总览1.3 三阶段逻辑链条0x02 LWD 论文算法2.1 算法图例 阅读全文
posted @ 2026-07-13 20:28
罗西的思考
阅读(114)
评论(0)
推荐(0)
摘要:
【机器人 / 强化学习】QAM:基于伴随匹配的 Q-learning 流策略优化 目录【机器人 / 强化学习】QAM:基于伴随匹配的 Q-learning 流策略优化0x00 概要1.1 核心问题:Flow 策略的优化困境1.1 为什么 Flow 策略难以用 RL 优化?1.2 三种候选方案0x02 阅读全文
posted @ 2026-07-11 19:06
罗西的思考
阅读(132)
评论(0)
推荐(0)
摘要:
【机器人 / 强化学习】DIVL:分布隐式价值学习 目录【机器人 / 强化学习】DIVL:分布隐式价值学习0x00 概要0x01 从 IQL 到 DIVL:为什么标量不够用?1.1 IQL 的遗产:在已知数据中"沙里淘金"1.2 为什么平均数会骗人?1.3 从"给平均分"到"看清各种可能性"0x02 阅读全文
posted @ 2026-07-09 19:30
罗西的思考
阅读(114)
评论(0)
推荐(1)
摘要:
【机器人 / 强化学习】IQL(Implicit Q-Learning):离线强化学习的隐式价值提取 目录【机器人 / 强化学习】IQL(Implicit Q-Learning):离线强化学习的隐式价值提取0x00 概要1.1 核心哲学:在已知数据中"沙里淘金"1.1 离线学习的"贪婪陷阱"1.2 阅读全文
posted @ 2026-07-07 19:27
罗西的思考
阅读(175)
评论(0)
推荐(0)
摘要:
【机器人 / 强化学习】LWD(Learning while Deploying)机器人持续进化的强化学习框架 目录【机器人 / 强化学习】LWD(Learning while Deploying)机器人持续进化的强化学习框架0x00 概要0x01 背景:为什么需要 LWD?1.1 真实世界不是一个 阅读全文
posted @ 2026-07-06 19:35
罗西的思考
阅读(130)
评论(0)
推荐(0)
摘要:
【机器人 / 强化学习】HIL-SERL 工程篇:人类在环的工程架构与物理设计 目录【机器人 / 强化学习】HIL-SERL 工程篇:人类在环的工程架构与物理设计0x00 概要0x01 系统架构总览1.1 逻辑架构1.2 物理拓扑1.3 部署拓扑与启动顺序1.4 独立运行的组件清单1.5 单步交互时 阅读全文
posted @ 2026-07-03 20:09
罗西的思考
阅读(200)
评论(1)
推荐(0)
摘要:
【机器人 / 强化学习】HIL-SERL 算法篇:HG-DAgger 与 RLPD —— 从模仿到超越的训练双阶段 目录【机器人 / 强化学习】HIL-SERL 算法篇:HG-DAgger 与 RLPD —— 从模仿到超越的训练双阶段0x00 概要0x01 HG-DAgger 的核心思想:人类门控的 阅读全文
posted @ 2026-07-01 20:14
罗西的思考
阅读(358)
评论(0)
推荐(0)
浙公网安备 33010602011771号