围观了小米 MiMo-V2.6 发布前的 70 小时:一场两千多万的公开训练

小米刚刚正式发布并开源 MiMo-V2.6——发布稿里的数字($262 万 / $85 万训练成本、各 30 步、DeepSWE 58.4 → 72.57),与我们的记录分毫不差。因为在发布之前,小米把这次 RL 训练做成了实时公开的看板,我们以约每小时一次的频率围观了 70 个小时:近 60 轮检查、2000 多个指标全程落库,巅峰时折合上万张 H100 同时在烧。三个发现,一个比一个意外。

一、先说结论:72.57,卡在公开榜第一梯队门口

两个 run 各 30 步收官:

pro flash
训练时长 5.3 天(14 次重启) 3.5 天(5 次)
成本 262万美元 85万美元
累计 token 75.0B 81.4B
在线 avg@n 峰值 0.643(@20) 0.662(@29)

三项离线评测,pro 全部登顶:DeepSWE 72.57、In-house Coding 65.43、AutomationBench 53.1(flash:67.86 / 62.91 / 52.8);在线收益上 flash 反超(涨幅 +0.130,接近 pro 两倍)——pro 赢评测,flash 赢过程
image
三项里只有 DeepSWE 存在公开对照,放进官方榜单(113 题,2026-09-03 更新):
image

pro 的 72.57 正好卡在第一梯队门口——距榜首的 GPT-6 Astra、Gemini 3.8 Flash、Claude Opus 5(74)只差 1.4 分;flash 的 67.86 与 grok-4.6、GPT-5.5 同档,和它整个 run 的高性价比画风一致。

更值得看的是橙色弧线的两端:pro 的 RL 起点 58.4,正是 Claude Opus 4.8(59)的水平;30 步 RL 之后跨到 72.6,一步跨过榜上约一整代模型。flash 涨幅更狠:+19.2,从榜尾水平直接跨进中坚梯队。

(口径提示:两边考的是同一套题,但"答题框架"不同——公开榜统一用 mini-swe-agent,看板用小米自家框架,同一模型换个框架分数会差几分。所以上面的对比是"大概在什么段位",不是官方排名。)

还有一个反常识的细节:直播大部分时间里,叙事一直是"pro 赢编码、flash 赢自动化"——AutomationBench 上 flash 以 52.8 长期压制。直到 run 结束后评测补发,pro step 29 冲上 53.1,最后一步反超登顶,DeepSWE 最终步追平峰值。在线奖励是过程指标,结算画面总是滞后的——在 run 结束当天写结论,大概率会写错。

二、钱:$347 万,从不暂停

image

看板直接标了烧钱速率:pro $5.71/秒、flash $2.855/秒,正好 2:1。66 次实际抓取的成本读数,每一个都精确落在"速率 × 时长"的直线上——包括卡死重跑的 58 分钟和滞留的 6.4 小时:训练心电图可以停,账单的滴答不停。

两个 run 训练侧配置完全相同(各 30 步、每步 1,568 个任务、训练样本数一模一样),差异全在推理侧:flash 的 token 便宜 3.3 倍,于是用 1/3 的预算反而烧了更多 token(81.4B vs 75.0B)、跑了近两倍沙箱。pro 的溢价:多花 $177 万换 DeepSWE 峰值 +4.71 分,约 $37.5 万换 1 分。两 run 合计 $347.5 万(约合人民币 2,470 万元)、156.4B token。

训练贵是训练的事,用起来不贵:官方宣布 V2.6 沿用 V2.5 的 API 定价不变——按发布稿的说法,相同价格下性能约为海外同档模型的 20~60 倍。

三、最好看的一幕:教科书级"假崩盘"

9 月 19 日下午,pro 的在线训练奖励走出了这样一条曲线:

0.6431 → 0.6421 → 0.6229 → 0.6217 → 0.5964

四连跌,最大单步跌幅为全 run 之最。按教科书,这够拉"训练崩了"的警报了——我们的自动监控也确实第一次报了警。但同一窗口的三条证据指向相反结论:离线评测在创新高(DeepSWE 68.05)、rollout 通过率处于历史最高区间、平均上下文三步内从 10.5 万 token 猛拉到 11.9 万——任务在变难,不在变笨。
image

我们在 18:13 的检查报告里写下推断:训练配比在快速转向更长更难的任务。一分钟后,官方公告发布:

"we filtered out tasks that are relatively easy for the current pro model."
(我们过滤掉了对当前 pro 模型而言相对容易的任务。)

一次看起来最像事故的曲线,其实是一次主动的课程升级。后续把它钉死:切换配比后第一个数据点立刻反弹 +0.030,DeepSWE 随后首破 70、冲上 72.57。被过滤掉的"容易",换来了后来的"上限"。

四、19 次重启,和两次安静的结束

pro 重启 14 次——开训头 14 个小时就占了 4 次。官方公告只解释了其中 4 次:单节点 VRAM 故障、训练集群与判题服务网络断连(顺带把 cyber 数据集整个移出训练池,理由是"rollout 日志里发现坏模式")、一类 infra 错误、expert 负载不均导致的 GPU OOM(之后调整了并行策略)。其余 10 次无声无息,包括 58 分钟内连续两次卡死在 step 23 的循环。卡点一直在漂移:OOM、连环卡死、training 44%、刚起步——没有固定病灶,只有不断换位置的事故

flash 安静得多:5 次重启、3.5 天跑完,然后在 9 月 19 日上午、step 31 进行到 1.3 小时时主动终止,无公告无解释——终止前一步,它刚打出全程最高的 0.6623。pro 的收官步也有最后一幕悬疑:step 30 在 100% 处滞留 6.4 小时、实时采样冻结,按历史模式第 15 次重启似乎在所难免——它最终自行解除,带着全 run 最低的 KL 落库,正常终止。5.3 天的训练,以最安静的方式结束。

五、三个值得记住的细节

1. 任务越训越长,没有回头。 平均上下文:pro 从 7.2 万涨到 13.7 万 token(+90%),flash 涨到 14.8 万(+105%);平均单条回复超过 10 万 token——不是聊天,是动辄上万步工具调用的智能体轨迹。单步耗时随之从 2~3 小时涨到 4~6 小时。

2. 几十亿 token 烧下来,探索性反而越来越强。 两个 run 的策略熵全程上行(学习率恒定 3e-6),KL 缓慢爬升、从未失控;pro 后期的 KL 呈隔步"心跳"(0.0095 → 0.0044 → 0.0074 → 0.0038…),与课程批次的隔步切换对得上;flash 的最后一步 KL 首破 0.01——最小的模型,在终点做了最大的一次策略更新。

3. 在线 ≠ 离线。 flash 在线 avg@n 峰值比 pro 高 0.019,三项离线评测却全部落后——在线采样器的收益和真实任务能力是两回事。对训练团队如此,对围观者更是如此:别拿训练奖励当 benchmark 读。

六、结语

把 2000 多个指标、每次重启、连烧钱速率都实时公开,行业里几乎独一份。课程怎么调、数据集怎么下线、卡死时账单怎么走——这些论文里一行都不会有的信息,才是这场直播最值钱的部分。


数据:mimo.xiaomi.com/rl 公开接口,跟踪窗口 2026-09-18 至 09-21(UTC+8),近 60 轮逐小时检查;成本为看板计费读数,人民币按 7.1 估算;公开榜单取自 deepswe.datacurve.ai 2026-09-03 快照,与看板 harness 口径存在差异,仅作坐标系参考。

文章首发地址:https://mp.weixin.qq.com/s/Ht4iE7VKg-zhekHcjvcyBw

posted @ 2026-09-22 08:20  AiFly  阅读(17)  评论(0)    收藏  举报