随笔分类 - 024_强化学习
摘要:[Agent Memory / 强化学习] MemPO源码学习笔记 (4) Rollout实现细节 目录[Agent Memory / 强化学习] MemPO源码学习笔记 (4) Rollout实现细节0x00 概要0x01 回顾0x02 mem_sys_prompt_ids2.1 mem_sys_
阅读全文
摘要:[Agent Memory / 强化学习] MemPO源码学习笔记 (3) Rollout思路 目录[Agent Memory / 强化学习] MemPO源码学习笔记 (3) Rollout思路0x00 概要0x01 Rollout 主要内容1.1 时间线1.2 纯 RolloutRollout 阶
阅读全文
摘要:[Agent Memory / 强化学习] MemPO源码学习笔记 (2) 训练 目录[Agent Memory / 强化学习] MemPO源码学习笔记 (2) 训练0x00 概要0x01 原理1.1 为什么MemPO必须用RL而不是SFT?SFT 的劣势RL解决方式MemPO的实际路径小结1.2
阅读全文
摘要:[Agent Memory / 强化学习] MemPO源码学习笔记 (1) 总体 目录[Agent Memory / 强化学习] MemPO源码学习笔记 (1) 总体0x00 概要0x01 基础 & 背景1.1 用RL训练记忆系统的要点1.2 主要难点1.3 主要思路1.4 RL训练方案1.4.1
阅读全文
摘要:【Agentic RL / 强化学习框架】Molt 设计解读 目录【Agentic RL / 强化学习框架】Molt 设计解读0x00 概要0x01 从 RL 流程到 Molt 代码:一次完整映射1.1 第一层:标准 RL 训练流程1.2 第二层:Molt 模块对应关系1.3 第三层:类定义 + 角
阅读全文
摘要:【Agentic RL / 强化学习框架 / VERL】Uni-Agent Gateway 深度解析 目录【Agentic RL / 强化学习框架 / VERL】Uni-Agent Gateway 深度解析0x00 概要0x01. Gateway 是为了解决什么问题?1.1 VERL 原有架构的困境
阅读全文
摘要:【Agentic RL / 强化学习 / OPD】Hermes & OPD 源码阅读笔记 目录【Agentic RL / 强化学习 / OPD】Hermes & OPD 源码阅读笔记0x00 概要0x01 OPD 机制原理 —— "OPD 是什么,怎么工作"1.1 OPD 的完整数据流1.2 vLL
阅读全文
摘要:【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (16) AReal 目录【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (16) AReal0x00 概要0x01 基础背景1.1 AReaL1.2 工作1.3 训练架构
阅读全文
摘要:【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (15) Combine模式 目录【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (15) Combine模式0x00 概要0x01 架构1.1 架构:继承而非重写1.2
阅读全文
摘要:【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (14) Teacher 目录【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (14) Teacher0x00 概要0x01 基础背景1.1 完整数据流1.2 关键点公式代
阅读全文
摘要:【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (13) OPD实现 目录【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (13) OPD实现0x00 概要0x01 基础背景1.1 通俗讲解1.2 数学形式1.3 OPD
阅读全文
摘要:【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (12) GRPO 目录【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (12) GRPO0x00 概要0x01 GRPO基础1.1 GRPO 解读PPOGRPOGroup
阅读全文
摘要:【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (11) 算法总体实现 目录【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (11) 算法总体实现0x00 概要0x01 基础背景1.1 架构1.2 算法三种训练方法核心设
阅读全文
摘要:【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (10) PRM 目录【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (10) PRM0x00 概要0x01 基础知识1.1 PRM如何解决Agentic RL的稀疏梯度问
阅读全文
摘要:【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (9) Reward Judging 目录【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (9) Reward Judging0x00 概要0x01 Reward 基础1.
阅读全文
摘要:【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (8) Environment 目录【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (8) Environment0x00 概要0x01 环境建模基础1.1 标准 RL 系
阅读全文
摘要:【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (7) Policy Serving 目录【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (7) Policy Serving0x00 概要0x01 基础1.1 架构1.2
阅读全文
摘要:【机器人 / 强化学习】QAM 与 DIVL:评价-执行闭环的完美配合 目录【机器人 / 强化学习】QAM 与 DIVL:评价-执行闭环的完美配合0x00 概要0x01 为什么需要两个算法?1.1 先想清楚要解决什么问题1.2 闭环总览1.3 三阶段逻辑链条0x02 LWD 论文算法2.1 算法图例
阅读全文
摘要:【机器人 / 强化学习】QAM:基于伴随匹配的 Q-learning 流策略优化 目录【机器人 / 强化学习】QAM:基于伴随匹配的 Q-learning 流策略优化0x00 概要1.1 核心问题:Flow 策略的优化困境1.1 为什么 Flow 策略难以用 RL 优化?1.2 三种候选方案0x02
阅读全文
摘要:【机器人 / 强化学习】DIVL:分布隐式价值学习 目录【机器人 / 强化学习】DIVL:分布隐式价值学习0x00 概要0x01 从 IQL 到 DIVL:为什么标量不够用?1.1 IQL 的遗产:在已知数据中"沙里淘金"1.2 为什么平均数会骗人?1.3 从"给平均分"到"看清各种可能性"0x02
阅读全文
浙公网安备 33010602011771号