06 2026 档案
摘要:【机器人 / 强化学习】HIL-SERL 算法篇:DQN + SAC 混合架构的实现哲学 目录【机器人 / 强化学习】HIL-SERL 算法篇:DQN + SAC 混合架构的实现哲学0x00 概要0x01 HIL-SERL 的总体算法思路1.1 HIL-SERL 的算法基因图谱1.2 三类预训练/先
阅读全文
摘要:【机器人 / 强化学习】HIL-SERL:人类在环驱动的具身智能进化框架 目录【机器人 / 强化学习】HIL-SERL:人类在环驱动的具身智能进化框架0x00 概要0x01 真机 RL 的"最后一公里"1.1 为什么需要人类在环?1.2 HIL-SERL 的解决方案:四条腿的凳子1.3 论文的核心成
阅读全文
摘要:【机器人 / 强化学习】SERL:让真机强化学习从“难用”走向“可复现”的强化学习框架 (5)工程篇 目录【机器人 / 强化学习】SERL:让真机强化学习从“难用”走向“可复现”的强化学习框架 (5)工程篇0x00 概要0x01 SERL 要解决什么核心问题?0x02 系统架构:三层解耦的通用适配器
阅读全文
摘要:【机器人 / 强化学习】SERL:让真机强化学习从“难用”走向“可复现”的强化学习框架 (4)算法篇(DrQ vs VICE) 目录【机器人 / 强化学习】SERL:让真机强化学习从“难用”走向“可复现”的强化学习框架 (4)算法篇(DrQ vs VICE)0x00 概要0x01 奖励与自动化:从手
阅读全文
摘要:【机器人 / 强化学习】SERL:让真机强化学习从“难用”走向“可复现”的强化学习框架 (3)算法篇(RLPD) 目录【机器人 / 强化学习】SERL:让真机强化学习从“难用”走向“可复现”的强化学习框架 (3)算法篇(RLPD)0x00 概要0x01 基础 & 背景1.1 总体流程图1.2 面临的
阅读全文
摘要:【机器人 / 强化学习】SERL:让真机强化学习从“难用”走向“可复现”的强化学习框架 算法篇(SAC) 目录【机器人 / 强化学习】SERL:让真机强化学习从“难用”走向“可复现”的强化学习框架 算法篇(SAC)0x00 概要0x01 基础 & 背景1.1 核心思想1.2 熵解决的问题0x02 演
阅读全文
摘要:【机器人 / 强化学习】SERL:让真机强化学习从“难用”走向“可复现”的强化学习框架 (1)全景篇 目录【机器人 / 强化学习】SERL:让真机强化学习从“难用”走向“可复现”的强化学习框架 (1)全景篇0x00 概要0x01 基础知识 & 背景1.1 论文基本信息1.2 为什么需要 SERL:真
阅读全文
摘要:【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (6) Rollout 目录【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (6) Rollout0x00 概要0x01 Rollout基础1.1 概念1.1.1 标准 R
阅读全文
摘要:【Agentic RL / 强化学习框架】Miles 项目技术分析 (2) 关键技术 目录【Agentic RL / 强化学习框架】Miles 项目技术分析 (2) 关键技术0x00 概要0x01 agentic_tool_call1.1 问题1.2 解决方案1.3 框架自动化的主要流水线1.4 深
阅读全文
摘要:【Agentic RL / 强化学习框架】Miles 项目技术分析 (1) 总体 目录【Agentic RL / 强化学习框架】Miles 项目技术分析 (1) 总体0x00 概要0x01 基础1.1 Agentic RL 的需求与难点1.1.1 传统 RLHF vs Agentic RL 范式对比
阅读全文
摘要:【强化学习框架】Uni-Agent 深度技术分析(2) 关键技术 目录【强化学习框架】Uni-Agent 深度技术分析(2) 关键技术0x00 概要0x01 修改扩展点1.1 verl 扩展点全景1.2 关键扩展点详解E1: AgentLoopBase——继承契约E3: 注册机制——外部注入 vs
阅读全文
摘要:【Agentic RL / 强化学习框架】Uni-Agent 深度技术分析(1) 总体 目录【Agentic RL / 强化学习框架】Uni-Agent 深度技术分析(1) 总体0x00 概要0x01 基本功能1.1 竞品对比与定位1.1.1 三者定位1.1.2 七维度对比表1.2 Uni-Agen
阅读全文
摘要:端侧 Agent OS:手机架构与硬件协同设计 目录端侧 Agent OS:手机架构与硬件协同设计0x00 概要0x01 Part 1:核心论断 — 确定性基线与端侧定位1.1 确定性基线差异1.1.1 LLM 之前1.1.2 LLM 之后1.2 硬件约束反塑软件架构0x02 Part 2:硬件基础
阅读全文
摘要:Agent OS :五种驯服不确定性的范式 目录Agent OS :五种驯服不确定性的范式0x00 概要0x01 Part 1: 问题空间1.1 不确定性的六个来源1.2 三个独有问题1.3 跨领域全景:计算机中"驯服不确定性"的经典实践1.4 分布式系统深度对标1.4.1 8 个经典问题全景对照1
阅读全文
摘要:Agent 17 种架构模式 分析 & 思考 目录Agent 17 种架构模式 分析 & 思考0x00 概要0x01 核心概念1.1 设计目标(评估6维度)1.2 设计变量(公式6维度)1.3 联系1.4 产业视角: ETCLSVG 七层分类法0x02 评估维度2.1 维度一: 推理质量 (Reas
阅读全文
摘要:【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (5) 异步处理 目录【Agentic RL / 强化学习 / OPD】OpenClaw-RL 源码阅读笔记 (5) 异步处理0x00 概要0x01 异步架构0x02 训推分离2.1 为什么训练和推理通常分离?2
阅读全文
浙公网安备 33010602011771号