会员
周边
新闻
博问
闪存
赞助商
Chat2DB
所有博客
当前博客
我的博客
我的园子
账号设置
会员中心
简洁模式
...
退出登录
注册
登录
罗西的思考
一手伸向技术,一手伸向生活
博客园
首页
新随笔
联系
订阅
管理
上一页
1
2
3
4
5
6
7
···
45
下一页
2026年8月
【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 --- (15)--- Combine模式
摘要: 【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (15) Combine模式 目录【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (15) Combine模式0x00 概要0x01 架构1.1 架构:继承而非重写1.2
阅读全文
posted @ 2026-08-03 20:49 罗西的思考
阅读(101)
评论(0)
推荐(0)
2026年7月
【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 --- (14)--- Teacher
摘要: 【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (14) Teacher 目录【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (14) Teacher0x00 概要0x01 基础背景1.1 完整数据流1.2 关键点公式代
阅读全文
posted @ 2026-07-29 20:57 罗西的思考
阅读(117)
评论(0)
推荐(0)
【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 --- (13)--- OPD实现
摘要: 【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (13) OPD实现 目录【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (13) OPD实现0x00 概要0x01 基础背景1.1 通俗讲解1.2 数学形式1.3 OPD
阅读全文
posted @ 2026-07-28 20:12 罗西的思考
阅读(145)
评论(0)
推荐(0)
【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 --- (12)--- GRPO
摘要: 【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (12) GRPO 目录【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (12) GRPO0x00 概要0x01 GRPO基础1.1 GRPO 解读PPOGRPOGroup
阅读全文
posted @ 2026-07-27 20:25 罗西的思考
阅读(123)
评论(0)
推荐(0)
【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 --- (11)--- 算法总体实现
摘要: 【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (11) 算法总体实现 目录【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (11) 算法总体实现0x00 概要0x01 基础背景1.1 架构1.2 算法三种训练方法核心设
阅读全文
posted @ 2026-07-23 20:48 罗西的思考
阅读(137)
评论(0)
推荐(0)
【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 --- (10)--- PRM
摘要: 【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (10) PRM 目录【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (10) PRM0x00 概要0x01 基础知识1.1 PRM如何解决Agentic RL的稀疏梯度问
阅读全文
posted @ 2026-07-22 20:58 罗西的思考
阅读(156)
评论(0)
推荐(0)
【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 --- (9)--- Reward Judging
摘要: 【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (9) Reward Judging 目录【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (9) Reward Judging0x00 概要0x01 Reward 基础1.
阅读全文
posted @ 2026-07-20 20:35 罗西的思考
阅读(109)
评论(0)
推荐(0)
【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 --- (8)--- Environment
摘要: 【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (8) Environment 目录【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (8) Environment0x00 概要0x01 环境建模基础1.1 标准 RL 系
阅读全文
posted @ 2026-07-16 21:13 罗西的思考
阅读(143)
评论(0)
推荐(0)
【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 --- (7)--- Policy Serving
摘要: 【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (7) Policy Serving 目录【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (7) Policy Serving0x00 概要0x01 基础1.1 架构1.2
阅读全文
posted @ 2026-07-14 20:19 罗西的思考
阅读(101)
评论(0)
推荐(0)
【机器人 / 强化学习】QAM 与 DIVL:评价-执行闭环的完美配合
摘要: 【机器人 / 强化学习】QAM 与 DIVL:评价-执行闭环的完美配合 目录【机器人 / 强化学习】QAM 与 DIVL:评价-执行闭环的完美配合0x00 概要0x01 为什么需要两个算法?1.1 先想清楚要解决什么问题1.2 闭环总览1.3 三阶段逻辑链条0x02 LWD 论文算法2.1 算法图例
阅读全文
posted @ 2026-07-13 20:28 罗西的思考
阅读(113)
评论(0)
推荐(0)
上一页
1
2
3
4
5
6
7
···
45
下一页
公告