06 2026 档案

摘要:【机器人 / 强化学习】HIL-SERL 算法篇:DQN + SAC 混合架构的实现哲学 目录【机器人 / 强化学习】HIL-SERL 算法篇:DQN + SAC 混合架构的实现哲学0x00 概要0x01 HIL-SERL 的总体算法思路1.1 HIL-SERL 的算法基因图谱1.2 三类预训练/先 阅读全文
posted @ 2026-06-30 19:57 罗西的思考 阅读(164) 评论(0) 推荐(0)
摘要:【机器人 / 强化学习】HIL-SERL:人类在环驱动的具身智能进化框架 目录【机器人 / 强化学习】HIL-SERL:人类在环驱动的具身智能进化框架0x00 概要0x01 真机 RL 的"最后一公里"1.1 为什么需要人类在环?1.2 HIL-SERL 的解决方案:四条腿的凳子1.3 论文的核心成 阅读全文
posted @ 2026-06-29 20:09 罗西的思考 阅读(233) 评论(0) 推荐(0)
摘要:【机器人 / 强化学习】SERL:让真机强化学习从“难用”走向“可复现”的强化学习框架 (5)工程篇 目录【机器人 / 强化学习】SERL:让真机强化学习从“难用”走向“可复现”的强化学习框架 (5)工程篇0x00 概要0x01 SERL 要解决什么核心问题?0x02 系统架构:三层解耦的通用适配器 阅读全文
posted @ 2026-06-28 10:22 罗西的思考 阅读(149) 评论(2) 推荐(0)
摘要:【机器人 / 强化学习】SERL:让真机强化学习从“难用”走向“可复现”的强化学习框架 (4)算法篇(DrQ vs VICE) 目录【机器人 / 强化学习】SERL:让真机强化学习从“难用”走向“可复现”的强化学习框架 (4)算法篇(DrQ vs VICE)0x00 概要0x01 奖励与自动化:从手 阅读全文
posted @ 2026-06-26 21:19 罗西的思考 阅读(125) 评论(0) 推荐(0)
摘要:【机器人 / 强化学习】SERL:让真机强化学习从“难用”走向“可复现”的强化学习框架 (3)算法篇(RLPD) 目录【机器人 / 强化学习】SERL:让真机强化学习从“难用”走向“可复现”的强化学习框架 (3)算法篇(RLPD)0x00 概要0x01 基础 & 背景1.1 总体流程图1.2 面临的 阅读全文
posted @ 2026-06-25 20:02 罗西的思考 阅读(241) 评论(0) 推荐(0)
摘要:【机器人 / 强化学习】SERL:让真机强化学习从“难用”走向“可复现”的强化学习框架 算法篇(SAC) 目录【机器人 / 强化学习】SERL:让真机强化学习从“难用”走向“可复现”的强化学习框架 算法篇(SAC)0x00 概要0x01 基础 & 背景1.1 核心思想1.2 熵解决的问题0x02 演 阅读全文
posted @ 2026-06-23 21:41 罗西的思考 阅读(194) 评论(0) 推荐(1)
摘要:【机器人 / 强化学习】SERL:让真机强化学习从“难用”走向“可复现”的强化学习框架 (1)全景篇 目录【机器人 / 强化学习】SERL:让真机强化学习从“难用”走向“可复现”的强化学习框架 (1)全景篇0x00 概要0x01 基础知识 & 背景1.1 论文基本信息1.2 为什么需要 SERL:真 阅读全文
posted @ 2026-06-22 20:24 罗西的思考 阅读(288) 评论(0) 推荐(0)
摘要:【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (6) Rollout 目录【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (6) Rollout0x00 概要0x01 Rollout基础1.1 概念1.1.1 标准 R 阅读全文
posted @ 2026-06-18 20:04 罗西的思考 阅读(163) 评论(0) 推荐(0)
摘要:【Agentic RL / 强化学习框架】Miles 项目技术分析 (2) 关键技术 目录【Agentic RL / 强化学习框架】Miles 项目技术分析 (2) 关键技术0x00 概要0x01 agentic_tool_call1.1 问题1.2 解决方案1.3 框架自动化的主要流水线1.4 深 阅读全文
posted @ 2026-06-16 20:12 罗西的思考 阅读(199) 评论(0) 推荐(0)
摘要:【Agentic RL / 强化学习框架】Miles 项目技术分析 (1) 总体 目录【Agentic RL / 强化学习框架】Miles 项目技术分析 (1) 总体0x00 概要0x01 基础1.1 Agentic RL 的需求与难点1.1.1 传统 RLHF vs Agentic RL 范式对比 阅读全文
posted @ 2026-06-15 20:52 罗西的思考 阅读(336) 评论(0) 推荐(0)
摘要:【强化学习框架】Uni-Agent 深度技术分析(2) 关键技术 目录【强化学习框架】Uni-Agent 深度技术分析(2) 关键技术0x00 概要0x01 修改扩展点1.1 verl 扩展点全景1.2 关键扩展点详解E1: AgentLoopBase——继承契约E3: 注册机制——外部注入 vs 阅读全文
posted @ 2026-06-11 21:33 罗西的思考 阅读(250) 评论(0) 推荐(0)
摘要:【Agentic RL / 强化学习框架】Uni-Agent 深度技术分析(1) 总体 目录【Agentic RL / 强化学习框架】Uni-Agent 深度技术分析(1) 总体0x00 概要0x01 基本功能1.1 竞品对比与定位1.1.1 三者定位1.1.2 七维度对比表1.2 Uni-Agen 阅读全文
posted @ 2026-06-09 20:12 罗西的思考 阅读(492) 评论(0) 推荐(1)
摘要:端侧 Agent OS:手机架构与硬件协同设计 目录端侧 Agent OS:手机架构与硬件协同设计0x00 概要0x01 Part 1:核心论断 — 确定性基线与端侧定位1.1 确定性基线差异1.1.1 LLM 之前1.1.2 LLM 之后1.2 硬件约束反塑软件架构0x02 Part 2:硬件基础 阅读全文
posted @ 2026-06-08 20:05 罗西的思考 阅读(440) 评论(0) 推荐(0)
摘要:Agent OS :五种驯服不确定性的范式 目录Agent OS :五种驯服不确定性的范式0x00 概要0x01 Part 1: 问题空间1.1 不确定性的六个来源1.2 三个独有问题1.3 跨领域全景:计算机中"驯服不确定性"的经典实践1.4 分布式系统深度对标1.4.1 8 个经典问题全景对照1 阅读全文
posted @ 2026-06-04 20:46 罗西的思考 阅读(384) 评论(0) 推荐(1)
摘要:Agent 17 种架构模式 分析 & 思考 目录Agent 17 种架构模式 分析 & 思考0x00 概要0x01 核心概念1.1 设计目标(评估6维度)1.2 设计变量(公式6维度)1.3 联系1.4 产业视角: ETCLSVG 七层分类法0x02 评估维度2.1 维度一: 推理质量 (Reas 阅读全文
posted @ 2026-06-02 21:25 罗西的思考 阅读(847) 评论(0) 推荐(1)
摘要:【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (5) 异步处理 目录【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (5) 异步处理0x00 概要0x01 异步架构0x02 训推分离2.1 为什么训练和推理通常分离?2 阅读全文
posted @ 2026-06-01 20:48 罗西的思考 阅读(247) 评论(0) 推荐(0)