罗福莉直播小米 MiMo-V2.6 强化学习:一小时 3 万美元,账本和不稳定一起挂上网

2026 年 9 月 15 日,小米 MiMo 团队上线了一个页面:mimo.xiaomi.com/rl

页面上没有产品介绍,没有参数表,也没有榜单。它只有一块实时刷新的遥测看板——两条强化学习训练线(MiMo-V2.6-Pro 与 MiMo-V2.6-Flash)正在跑,累计花了多少钱、跑到第几步、每步多少 token、奖励曲线走到哪、数据配比是什么,全部滚动更新。负责人罗福莉在沉寂近半年后第一次公开露面,讲的不是发布会叙事,而是一件事:强化学习到底能扩展多远

国产大厂第一次把「RL 训练有多贵、有多不稳定」摊开给公众围观。这件事的技术含量不在模型本身,而在那块看板愿意公开什么

一、热度从哪来:一个反常识的公开

大模型训练从来不缺成本传闻,缺的是可核对的数字。此前行业里能查到的公开成本,基本都来自事后披露的论文或技术报告,粒度到「RL 阶段花了多少钱」为止,没人公开过训练进行中的实时账本。

小米这次做的是后训练 RL 过程的实时直播——注意不是预训练。页面上线时,训练才刚开始一天多。这意味着一件事:如果训练中途崩了、曲线不涨了、钱白烧了,围观者当场就能看见。

这也是罗福莉的复出方式。她是前 DeepSeek 核心成员、DeepSeek-V2/V3 的关键贡献者,加入小米后带队做大模型。沉寂半年之后的第一次公开发声,选了一个最不讨巧的题目——把自己的训练过程做成公开仪表盘。

看板公开的字段大致分四类:

  • 账本类:累计成本、步数、消耗 token 数;
  • 训练类critic/rewards/meanactor/entropy_lossactor/pg_lossactor/grad_norm、KL 散度;
  • 行为类:上下文长度、工具调用轮数、passrate;
  • 业务类:Batch Composition(数据配比)、事故公告。

请添加图片描述

二、先算账:一小时 3 万美元是怎么来的

不同来源在不同时点抓的快照不完全一致,这本身就是「实时」的代价:

来源 时点口径 累计成本
量子位 / 创业邦 Pro 起算 36 小时 两款模型合计超 108 万美元
腾讯新闻 两条训练线累计 超 113 万美元
ic.work 快照 约 106 万美元

平均下来,每小时约 3 万美元。媒体换算的另一种说法是「每秒至少烧 10 美元」。单步粒度上,据 ic.work 分析,Pro 单步约 7.4 万美元、Flash 单步约 2 万美元,而 Pro 一步耗时约 2 小时 06 分。

这些数字会持续上涨——训练还在跑。引用时务必带上时点,否则明天的读者会以为你写错了。

三、钱烧在哪:单步 2 万条轨迹的工程解释

「一小时 3 万美元」听起来像天价,拆到单步就变得可解释了。

据 ic.work 的分析,单步训练是 1568 个 prompt × 每个 16 条 rollout,也就是约 25,088 条轨迹,每条轨迹在 20 亿 token 量级。架构上采用完全异步(fully async)生成,并发沙箱超过 4 万个。

换句话说,钱不是烧在梯度更新上,是烧在采样上。Agentic RL 和传统 RLHF 的成本结构完全不同:后者是在固定 prompt 上打分,前者是让模型在真实环境里跑几十轮工具调用,每一步都要执行代码、读文件、看报错,这些交互全都要算进推理账单。据分析,代码任务占约三分之二,平均每道题约 55 轮工具调用、约 9 万 token 上下文。

按面板口径写一个粗算脚本,成本结构就能看清:

# 按公开看板口径做的成本拆解示意(数字取快照值,非官方实现)
STEPS_PER_HOUR_IF_PRO_ONLY = 1 / 2.1     # Pro 单步约 2h06m
PROMPTS, ROLLOUTS_PER_PROMPT = 1568, 16
TOKENS_PER_TRAJECTORY = 2_000_000_000    # 单条约 20 亿 token 量级

trajectories = PROMPTS * ROLLOUTS_PER_PROMPT          # ≈ 25,088
pro_cost_per_step = 74_000                            # 美元,ic.work 快照
flash_cost_per_step = 20_000

# 成本 / 轨迹:Pro 约 2.95 美元一条,这个数字比"每小时 3 万美元"更能指导本地实验
print(trajectories, pro_cost_per_step / trajectories)  # 25088 2.949...

# 单步 token 吞吐 → 换算推理单价量级
print(pro_cost_per_step / (trajectories * 1e-3))      # 单位:美元/千条轨迹的粗略量纲

这个拆解对开发者真正的用处是:当你评估自己要不要做 Agentic RL 时,该看的是「每条轨迹多少钱」,而不是「一次训练多少钱」。前者可以按你的任务规模线性放大,后者只会劝退。

请添加图片描述

四、罗福莉讲的三个 scaling 维度

据 x-techcon 整理的罗福莉公开发言,团队沉寂近半年只研究一个问题——强化学习到底能扩展多远,并沿三个维度做 scaling:

  1. 训练计算量:走全异步架构,把生成和训练解耦,让采样吞吐不再被同步等待拖住。
  2. 环境与 harness:把多任务 Agentic RL(代码、通用、视觉、网络安全、聊天)混进同一次训练,使用多套 harness。这条最容易被低估——环境是 RL 的新原料,任务的多样性直接决定策略泛化的边界。
  3. 评分算力(grader compute):采用基于测试用例与量规(rubric)的智能体组内信用分配(in-group credit assignment),也就是让评分本身也消耗算力,而不是靠一个廉价 reward model 拍脑袋。

第三条是三条里最有信息量的。传统 RLHF 的瓶颈在 reward model 的准确度,而 Agentic 场景下可以用可执行测试用例当奖励信号——代价是每次判分都要真跑一遍。把「评分算力」当成一个独立可扩展维度来投入,是这轮 RL 从「对齐技术」变成「训练技术」的标志。

罗福莉表示具体技术方案将在未来几周陆续开源。需要注意的是,这条推文没有公布发布日、参数量,也没有正式榜单成绩,更无开源权重或 API——现在能确认的只有方法和过程。

五、透明度的边界:连故障都公告

看板最反直觉的一条公告是:

the mimo-v2.6-pro run is restarting due to a vram issue on one node

Pro 训练因为某个节点的显存问题正在重启。这条告警和未收敛的权重、实时采样日志一起挂在网上。

据 AI Weekly 评价,实时流式输出奖励曲线和评测指标,「这是 OpenAI 和 Anthropic 都没有提供的透明度」。多家媒体的判断类似:连事故都公告,这种透明度在业界罕见。

对做工程的人来说,这件事的价值不在道德层面,而在它把 RL 训练的真实故障率变成了可观测数据。节点崩、显存炸、重启、loss 尖刺——这些在技术报告里通常被一句「训练过程稳定」抹掉的细节,第一次有了公开样本。

六、指标怎么读:奖励曲线与离线评测

看板上的核心训练指标是 dynsam/avg@n,展示时会带上相对第 1 步的 Δ 变化。据不同时点的快照:

  • 一条快照记录 Pro 从约 0.565 升到 0.614,Flash 从约 0.514 升到 0.603;
  • 另一条快照是 Pro 0.590(▲0.026)、Flash 0.596(▲0.083)。

离线评测方面,DeepSWE v1.1 上 Pro 约 63.72(第 10 步)、Flash 60.77(第 12 步),另有来源报 Pro 62.24。不同快照数值有差异,引用时必须注明时点——这是实时看板的固有特性,不是数据打架。

值得一提的是 Flash 的表现:在第 12 步就已经追到 60.77,和 Pro 的差距(约 3 分)远小于两者参数量与单步成本(7.4 万 vs 2 万美元)的差距。如果这个趋势保持,「小模型 + 长 RL」的性价比叙事会更有说服力。

七、横向对比:两天烧掉的钱,比两家加起来还多

行业里被反复引用的公开口径有两个:

模型 RL 阶段成本 配置
DeepSeek-R1 约 29.4 万美元 512 张 H800
MiniMax-M1 约 53.5 万美元 512 张 H800,约三周
小米 MiMo-V2.6(Pro+Flash) 约 106~113 万美元 两条线并行,两天多

后者的两天,超过了前两者之和。

但这里必须打三个补丁,否则这个对比会误导人:

  1. 口径不一致。DeepSeek-R1 与 MiniMax-M1 公布的是 RL 阶段成本,小米这个数字对应的是后训练 RL 的两条并行训练线,任务类型与 rollout 规模差异巨大(Agentic 多任务 vs 数学/代码推理),不能直接等价。
  2. 均为厂商自行披露,没有第三方审计。
  3. 小米的训练仍在进行,113 万美元不是终值。

真正可比的量纲是「每条轨迹的成本」和「单位有效训练信号的代价」,而不是总额。但后者至少第一次有了实时更新的公开数字,这对行业定价(无论是对算力、对 API、还是对「自研 RL 值不值」)是有锚点意义的。

八、HN 的两种声音:开放度与技术质疑

消息同步出现在 HN 上(据 HN Companion 收录的讨论),评论区形成两股明显不同的声音。

关于开放度,典型观点是反讽式的:「中国公司比美国甚至欧洲公司更开放。」有人推测西方实验室不这么做是为了保护竞争信息或担心发布时点,也有人归结为自信——「像车库门开着,或至少让门变成半透明」。

技术侧的质疑更值得写进笔记

  • 「fully async」与 step time 的定义矛盾。Yifan Jiang 指出,如果 trainer time + sampler time = step time,那就存在顺序依赖,与「完全异步」的说法不符。这是个可验证的工程质疑:真异步意味着采样和训练各自按自己的节奏推进、用 off-policy 数据修正偏差,而同步流水线的总时长本来就等于两段之和。看板公开的粒度不足以判断是哪一种。
  • 同时跑 Flash 和 Pro 的 RL 是否合理,也有人存疑。
  • 训练中评测是否算刷分。争议在于,一边训练一边看 DeepSWE 分数,是把 benchmark 当方向盘(benchmaxxing),还是业内标准做法。看板上公开了评测值,却没公开评测频率与选择规则,这个问题短期内不会有定论。
  • 历史成绩的怀疑。有怀疑论者搬出 MiMo 2.5 Pro 在 DeepSWE-1.1 上仅 19%,而同期前沿对手在 69~74% 区间——意思是:这次曲线爬得快,起点也低。

这些质疑目前都还没有官方回应。围观一个实时看板的正确姿势,是把「公开的数字」和「数字的含义」分开对待:前者是事实,后者需要方法披露才能判断。

请添加图片描述

九、总结:这次直播真正公开的东西

把事件剥到最里层,小米公开的其实是三样东西:

第一,一份可核对的 RL 账单。 一小时 3 万美元、Pro 单步 7.4 万美元、每条轨迹约 3 美元——这些数字让「训练前沿模型要烧多少钱」从传闻变成了可引用的快照。

第二,一套不稳定的证据链。 节点显存故障导致重启的公告,比任何「训练过程稳定」的措辞都更有工程参考价值。

第三,一个可被证伪的承诺。 罗福莉说技术方案将在未来几周开源。如果真开源了,这套「环境 + harness + grader compute」的三维 scaling 就有了可复现的脚手架;如果只是又一次发布会前奏,看板上的曲线也就失去了解释。

对开发者而言,这次事件最实际的价值不在模型分数,而在两个可以立刻用的判断:

  • 评估 Agentic RL 的成本,看「每条轨迹多少钱」,不是「一次训练多少钱」。 按公开口径,Pro 一条轨迹约 3 美元量级,你可以用自己任务的工具调用轮数直接放大估算。
  • 实时看板的数字是快照,不是结论。 引用必须带时点,横向对比必须标口径——这既是写作纪律,也是工程判断纪律。

MiMo-V2.6 还没发布,分数也没定。但「把训练过程挂上网」这件事本身,已经在国产大模型的叙事里划出一道新线。

参考链接

posted @ 2026-09-17 11:49  BehaviourBlogs  阅读(0)  评论(0)    收藏  举报