随笔分类 -  024_强化学习

摘要:[Agent Memory / 强化学习] MemPO源码学习笔记 (4) Rollout实现细节 目录[Agent Memory / 强化学习] MemPO源码学习笔记 (4) Rollout实现细节0x00 概要0x01 回顾0x02 mem_sys_prompt_ids2.1 mem_sys_ 阅读全文
posted @ 2026-09-23 20:43 罗西的思考 阅读(74) 评论(2) 推荐(1)
摘要:[Agent Memory / 强化学习] MemPO源码学习笔记 (3) Rollout思路 目录[Agent Memory / 强化学习] MemPO源码学习笔记 (3) Rollout思路0x00 概要0x01 Rollout 主要内容1.1 时间线1.2 纯 RolloutRollout 阶 阅读全文
posted @ 2026-09-17 20:51 罗西的思考 阅读(106) 评论(1) 推荐(1)
摘要:[Agent Memory / 强化学习] MemPO源码学习笔记 (2) 训练 目录[Agent Memory / 强化学习] MemPO源码学习笔记 (2) 训练0x00 概要0x01 原理1.1 为什么MemPO必须用RL而不是SFT?SFT 的劣势RL解决方式MemPO的实际路径小结1.2 阅读全文
posted @ 2026-09-15 20:45 罗西的思考 阅读(47) 评论(0) 推荐(0)
摘要:[Agent Memory / 强化学习] MemPO源码学习笔记 (1) 总体 目录[Agent Memory / 强化学习] MemPO源码学习笔记 (1) 总体0x00 概要0x01 基础 & 背景1.1 用RL训练记忆系统的要点1.2 主要难点1.3 主要思路1.4 RL训练方案1.4.1 阅读全文
posted @ 2026-09-10 21:00 罗西的思考 阅读(173) 评论(0) 推荐(0)
摘要:【Agentic RL / 强化学习框架】Molt 设计解读 目录【Agentic RL / 强化学习框架】Molt 设计解读0x00 概要0x01 从 RL 流程到 Molt 代码:一次完整映射1.1 第一层:标准 RL 训练流程1.2 第二层:Molt 模块对应关系1.3 第三层:类定义 + 角 阅读全文
posted @ 2026-08-31 20:55 罗西的思考 阅读(109) 评论(0) 推荐(0)
摘要:【Agentic RL / 强化学习框架 / VERL】Uni-Agent Gateway 深度解析 目录【Agentic RL / 强化学习框架 / VERL】Uni-Agent Gateway 深度解析0x00 概要0x01. Gateway 是为了解决什么问题?1.1 VERL 原有架构的困境 阅读全文
posted @ 2026-08-24 20:44 罗西的思考 阅读(127) 评论(0) 推荐(0)
摘要:【Agentic RL / 强化学习 / OPD】Hermes & OPD 源码阅读笔记 目录【Agentic RL / 强化学习 / OPD】Hermes & OPD 源码阅读笔记0x00 概要0x01 OPD 机制原理 —— "OPD 是什么,怎么工作"1.1 OPD 的完整数据流1.2 vLL 阅读全文
posted @ 2026-08-10 20:53 罗西的思考 阅读(148) 评论(0) 推荐(0)
摘要:【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (16) AReal 目录【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (16) AReal0x00 概要0x01 基础背景1.1 AReaL1.2 工作1.3 训练架构 阅读全文
posted @ 2026-08-04 19:53 罗西的思考 阅读(105) 评论(0) 推荐(0)
摘要:【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (15) Combine模式 目录【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (15) Combine模式0x00 概要0x01 架构1.1 架构:继承而非重写1.2 阅读全文
posted @ 2026-08-03 20:49 罗西的思考 阅读(102) 评论(0) 推荐(0)
摘要:【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (14) Teacher 目录【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (14) Teacher0x00 概要0x01 基础背景1.1 完整数据流1.2 关键点公式代 阅读全文
posted @ 2026-07-29 20:57 罗西的思考 阅读(119) 评论(0) 推荐(0)
摘要:【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (13) OPD实现 目录【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (13) OPD实现0x00 概要0x01 基础背景1.1 通俗讲解1.2 数学形式1.3 OPD 阅读全文
posted @ 2026-07-28 20:12 罗西的思考 阅读(148) 评论(0) 推荐(0)
摘要:【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (12) GRPO 目录【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (12) GRPO0x00 概要0x01 GRPO基础1.1 GRPO 解读PPOGRPOGroup 阅读全文
posted @ 2026-07-27 20:25 罗西的思考 阅读(124) 评论(0) 推荐(0)
摘要:【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (11) 算法总体实现 目录【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (11) 算法总体实现0x00 概要0x01 基础背景1.1 架构1.2 算法三种训练方法核心设 阅读全文
posted @ 2026-07-23 20:48 罗西的思考 阅读(138) 评论(0) 推荐(0)
摘要:【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (10) PRM 目录【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (10) PRM0x00 概要0x01 基础知识1.1 PRM如何解决Agentic RL的稀疏梯度问 阅读全文
posted @ 2026-07-22 20:58 罗西的思考 阅读(160) 评论(0) 推荐(0)
摘要:【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (9) Reward Judging 目录【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (9) Reward Judging0x00 概要0x01 Reward 基础1. 阅读全文
posted @ 2026-07-20 20:35 罗西的思考 阅读(111) 评论(0) 推荐(0)
摘要:【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (8) Environment 目录【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (8) Environment0x00 概要0x01 环境建模基础1.1 标准 RL 系 阅读全文
posted @ 2026-07-16 21:13 罗西的思考 阅读(146) 评论(0) 推荐(0)
摘要:【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (7) Policy Serving 目录【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (7) Policy Serving0x00 概要0x01 基础1.1 架构1.2 阅读全文
posted @ 2026-07-14 20:19 罗西的思考 阅读(102) 评论(0) 推荐(0)
摘要:【机器人 / 强化学习】QAM 与 DIVL:评价-执行闭环的完美配合 目录【机器人 / 强化学习】QAM 与 DIVL:评价-执行闭环的完美配合0x00 概要0x01 为什么需要两个算法?1.1 先想清楚要解决什么问题1.2 闭环总览1.3 三阶段逻辑链条0x02 LWD 论文算法2.1 算法图例 阅读全文
posted @ 2026-07-13 20:28 罗西的思考 阅读(115) 评论(0) 推荐(0)
摘要:【机器人 / 强化学习】QAM:基于伴随匹配的 Q-learning 流策略优化 目录【机器人 / 强化学习】QAM:基于伴随匹配的 Q-learning 流策略优化0x00 概要1.1 核心问题:Flow 策略的优化困境1.1 为什么 Flow 策略难以用 RL 优化?1.2 三种候选方案0x02 阅读全文
posted @ 2026-07-11 19:06 罗西的思考 阅读(134) 评论(0) 推荐(0)
摘要:【机器人 / 强化学习】DIVL:分布隐式价值学习 目录【机器人 / 强化学习】DIVL:分布隐式价值学习0x00 概要0x01 从 IQL 到 DIVL:为什么标量不够用?1.1 IQL 的遗产:在已知数据中"沙里淘金"1.2 为什么平均数会骗人?1.3 从"给平均分"到"看清各种可能性"0x02 阅读全文
posted @ 2026-07-09 19:30 罗西的思考 阅读(115) 评论(0) 推荐(1)