随笔分类 -  024_强化学习

摘要:【Agentic RL / 强化学习框架 / VERL】Uni-Agent Gateway 深度解析 目录【Agentic RL / 强化学习框架 / VERL】Uni-Agent Gateway 深度解析0x00 概要0x01. Gateway 是为了解决什么问题?1.1 VERL 原有架构的困境 阅读全文
posted @ 2026-08-24 20:44 罗西的思考 阅读(61) 评论(0) 推荐(0)
摘要:【Agentic RL / 强化学习 / OPD】Hermes & OPD 源码阅读笔记 目录【Agentic RL / 强化学习 / OPD】Hermes & OPD 源码阅读笔记0x00 概要0x01 OPD 机制原理 —— "OPD 是什么,怎么工作"1.1 OPD 的完整数据流1.2 vLL 阅读全文
posted @ 2026-08-10 20:53 罗西的思考 阅读(99) 评论(0) 推荐(0)
摘要:【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (16) AReal 目录【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (16) AReal0x00 概要0x01 基础背景1.1 AReaL1.2 工作1.3 训练架构 阅读全文
posted @ 2026-08-04 19:53 罗西的思考 阅读(76) 评论(0) 推荐(0)
摘要:【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (15) Combine模式 目录【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (15) Combine模式0x00 概要0x01 架构1.1 架构:继承而非重写1.2 阅读全文
posted @ 2026-08-03 20:49 罗西的思考 阅读(89) 评论(0) 推荐(0)
摘要:【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (14) Teacher 目录【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (14) Teacher0x00 概要0x01 基础背景1.1 完整数据流1.2 关键点公式代 阅读全文
posted @ 2026-07-29 20:57 罗西的思考 阅读(99) 评论(0) 推荐(0)
摘要:【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (13) OPD实现 目录【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (13) OPD实现0x00 概要0x01 基础背景1.1 通俗讲解1.2 数学形式1.3 OPD 阅读全文
posted @ 2026-07-28 20:12 罗西的思考 阅读(106) 评论(0) 推荐(0)
摘要:【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (12) GRPO 目录【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (12) GRPO0x00 概要0x01 GRPO基础1.1 GRPO 解读PPOGRPOGroup 阅读全文
posted @ 2026-07-27 20:25 罗西的思考 阅读(94) 评论(0) 推荐(0)
摘要:【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (11) 算法总体实现 目录【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (11) 算法总体实现0x00 概要0x01 基础背景1.1 架构1.2 算法三种训练方法核心设 阅读全文
posted @ 2026-07-23 20:48 罗西的思考 阅读(112) 评论(0) 推荐(0)
摘要:【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (10) PRM 目录【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (10) PRM0x00 概要0x01 基础知识1.1 PRM如何解决Agentic RL的稀疏梯度问 阅读全文
posted @ 2026-07-22 20:58 罗西的思考 阅读(137) 评论(0) 推荐(0)
摘要:【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (9) Reward Judging 目录【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (9) Reward Judging0x00 概要0x01 Reward 基础1. 阅读全文
posted @ 2026-07-20 20:35 罗西的思考 阅读(87) 评论(0) 推荐(0)
摘要:【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (8) Environment 目录【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (8) Environment0x00 概要0x01 环境建模基础1.1 标准 RL 系 阅读全文
posted @ 2026-07-16 21:13 罗西的思考 阅读(115) 评论(0) 推荐(0)
摘要:【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (7) Policy Serving 目录【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (7) Policy Serving0x00 概要0x01 基础1.1 架构1.2 阅读全文
posted @ 2026-07-14 20:19 罗西的思考 阅读(91) 评论(0) 推荐(0)
摘要:【机器人 / 强化学习】QAM 与 DIVL:评价-执行闭环的完美配合 目录【机器人 / 强化学习】QAM 与 DIVL:评价-执行闭环的完美配合0x00 概要0x01 为什么需要两个算法?1.1 先想清楚要解决什么问题1.2 闭环总览1.3 三阶段逻辑链条0x02 LWD 论文算法2.1 算法图例 阅读全文
posted @ 2026-07-13 20:28 罗西的思考 阅读(94) 评论(0) 推荐(0)
摘要:【机器人 / 强化学习】QAM:基于伴随匹配的 Q-learning 流策略优化 目录【机器人 / 强化学习】QAM:基于伴随匹配的 Q-learning 流策略优化0x00 概要1.1 核心问题:Flow 策略的优化困境1.1 为什么 Flow 策略难以用 RL 优化?1.2 三种候选方案0x02 阅读全文
posted @ 2026-07-11 19:06 罗西的思考 阅读(115) 评论(0) 推荐(0)
摘要:【机器人 / 强化学习】DIVL:分布隐式价值学习 目录【机器人 / 强化学习】DIVL:分布隐式价值学习0x00 概要0x01 从 IQL 到 DIVL:为什么标量不够用?1.1 IQL 的遗产:在已知数据中"沙里淘金"1.2 为什么平均数会骗人?1.3 从"给平均分"到"看清各种可能性"0x02 阅读全文
posted @ 2026-07-09 19:30 罗西的思考 阅读(97) 评论(0) 推荐(1)
摘要:【机器人 / 强化学习】IQL(Implicit Q-Learning):离线强化学习的隐式价值提取 目录【机器人 / 强化学习】IQL(Implicit Q-Learning):离线强化学习的隐式价值提取0x00 概要1.1 核心哲学:在已知数据中"沙里淘金"1.1 离线学习的"贪婪陷阱"1.2 阅读全文
posted @ 2026-07-07 19:27 罗西的思考 阅读(134) 评论(0) 推荐(0)
摘要:【机器人 / 强化学习】LWD(Learning while Deploying)机器人持续进化的强化学习框架 目录【机器人 / 强化学习】LWD(Learning while Deploying)机器人持续进化的强化学习框架0x00 概要0x01 背景:为什么需要 LWD?1.1 真实世界不是一个 阅读全文
posted @ 2026-07-06 19:35 罗西的思考 阅读(116) 评论(0) 推荐(0)
摘要:【机器人 / 强化学习】HIL-SERL 工程篇:人类在环的工程架构与物理设计 目录【机器人 / 强化学习】HIL-SERL 工程篇:人类在环的工程架构与物理设计0x00 概要0x01 系统架构总览1.1 逻辑架构1.2 物理拓扑1.3 部署拓扑与启动顺序1.4 独立运行的组件清单1.5 单步交互时 阅读全文
posted @ 2026-07-03 20:09 罗西的思考 阅读(154) 评论(1) 推荐(0)
摘要:【机器人 / 强化学习】HIL-SERL 算法篇:HG-DAgger 与 RLPD —— 从模仿到超越的训练双阶段 目录【机器人 / 强化学习】HIL-SERL 算法篇:HG-DAgger 与 RLPD —— 从模仿到超越的训练双阶段0x00 概要0x01 HG-DAgger 的核心思想:人类门控的 阅读全文
posted @ 2026-07-01 20:14 罗西的思考 阅读(252) 评论(0) 推荐(0)
摘要:【机器人 / 强化学习】HIL-SERL 算法篇:DQN + SAC 混合架构的实现哲学 目录【机器人 / 强化学习】HIL-SERL 算法篇:DQN + SAC 混合架构的实现哲学0x00 概要0x01 HIL-SERL 的总体算法思路1.1 HIL-SERL 的算法基因图谱1.2 三类预训练/先 阅读全文
posted @ 2026-06-30 19:57 罗西的思考 阅读(138) 评论(0) 推荐(0)