同一天,两把国产旗舰:一个 46 分登顶开源榜,一个 44 分只要 1/2.8 的钱
2026-09-22 这一天出了两条值得放一起看的新闻:小米凌晨发布并开源 MiMo-V2.6 系列,Artificial Analysis(下称 AA)上午发布了对阶跃星辰 Step 5 Preview 的完整评测。 关键是——它们用的是同一把尺子(AA Intelligence Index),一条 46 分、一条 44 分,成本却差出一个量级。 这篇不吹不黑,把两组数据摊开,聊聊 2026 年我们到底该怎么读”模型分数”这件事。
先说结论
- 46 分 vs 44 分,这 2 分的差距基本可以忽略;真正值得看的是它们各自把”智能-成本”这条线往外推了多远——一个靠 MIT 全开源 + 单任务 $0.13,一个靠”同级智能、1/2.8 成本”。
- 两家走的是完全相反的路:小米权重、技术报告、RL 环境、训练代码一次性全放;阶跃现在只给 API,权重要等到 10 月 15 日。同一个”开源模型”标签底下,含金量并不一样。
- AA 的分数不是终点,是起点。Step 5 Preview 官方宣传”全球开源前三”,但 AA 明确指出它幻觉率偏高、Agent 类评估落后同级;MiMo 分数最高,也被 AA 标注”输出偏冗长”。只看排行榜名次选模型,2026 年了还是会翻车。
下面拆开讲。
一、两条新闻到底说了什么
| 小米 MiMo-V2.6 Pro | 阶跃 Step 5 Preview | |
|---|---|---|
| 发布时间 | 2026-09-22 04:51(凌晨) | 2026-09-20,AA 评测 09-22 09:49 |
| 架构 | MoE,1.02T 总参 / 42B 激活 | 稀疏 MoE,600B 总参 / 27B 激活 |
| 上下文 | 1M | 1M |
| 模态 | 文本/图像/语音/视频输入,输出文本 | 文本/图像/视频输入 |
| AA Intelligence Index | 46 分(开源权重第一) | 44 分(与 Kimi K3 max 持平) |
| 每任务成本 | $0.13 | 约 $0.72(同级约 $2.00) |
| API 定价 | $0.435 / $0.87 每百万 token,99% 缓存折扣(国区 3 元 / 6 元每百万词元) | $1.00 / $2.70 每百万 token(缓存命中 $0.05) |
| 输出速度 | 约 124.5 tokens/秒 | — |
| 权重 | MIT 许可,已开源 | 封闭,2026-10-15 开放 |
| 附带开源 | 技术报告 + RL 环境 + 训练代码 | 暂无 |
一句话概括:MiMo 是”我全给你”,Step 5 是”先用我的 API,一个月后再说”。
二、46 分是什么概念?先看清楚这张榜的位置
单独一个数字没意义,得看分布。AA Intelligence Index 上:
| 位置 | 分数 | 代表 |
|---|---|---|
| 闭源第一梯队 | 53 | Claude Fable 5.1、GPT-6 Astra |
| 开源权重榜首 | 46 | MiMo-V2.6-Pro |
| 国产第一梯队(闭源/半闭源口径) | 45 | GLM-5.3 (max)、Qwen3.8 Max |
| 第二档(权重封闭/半闭源) | 44 | Step 5 Preview(权重 10-15 开放)、Kimi K3 (max) |
| 同类开源权重中位数 | 18 | — |
两个值得注意的点:
- MiMo 的 46 分不仅超过前代(MiMo-V2.5-Pro 只有 26 分),还压过了 45 分的国产双雄——这是开源权重模型第一次摸到这个位置。前代一代涨了 20 分,这不是渐进式改进。
- 别忘了中位数只有 18 分。开源世界里绝大多数模型还趴在 18 分附近,46 分是极端长尾。看评测时把”榜首”和”中位数”一起看,才知道差距是 2 分还是 28 分——后者才是这次发布的真实分量。
同一天,卡兹克做了一次 Grok 4.7 与 MiMo V2.6 的实测对比,结论是后者成了”性能、价格、速度”这个不可能三角的当前版本答案。这个判断和 AA 把它列进 Intelligence vs. Cost per Task 帕累托前沿是同一回事:不是它最强,是它在”每一块钱买到多少智能”这条轴上站得最靠外。
三、Step 5 Preview 的牌:1/2.8 成本,以及被藏在后面的三个”但是”
AA 给 Step 5 Preview 的结论很克制:44 分,与 Kimi K3 (max) 持平,略低于 GLM-5.3 (max) 和 Qwen3.8 Max 的 45 分,但每任务成本约 $0.72,约为同级模型(约 $2.00)的 1/2.8。阶跃官方随后转发并补充单任务成本 $0.71,称其”推动了智能-成本帕累托前沿的外扩”。
这个说法是成立的——对预算敏感的批量任务(内容审核、文档分类、批量摘要、Agent 里的子调用),成本降 2.8 倍比分数涨 1 分有用得多。
但 AA 同一份评测里也写了三个”但是”,容易被宣传稿吞掉:
- ⚠️ 前沿推理确实进步了:HLE 46%,相比自家 Step 3.7 Flash 是大幅提升——这是相对自家前代,不是相对同级。
- ⚠️ AA-Omniscience 幻觉率较高。幻觉率高的模型在”跑分”上未必吃亏(选择题可以蒙),但一旦接入真实业务就是定时炸弹。
- ⚠️ GDPval-AA 等 Agent 类评估落后于 Qwen3.8 Max 与 GLM-5.3。而阶跃自己的定位恰恰是”面向长任务 Agent”——主打场景上的第三方评估反而落后,这是最需要追问的一处。
还有个口径问题值得留意:阶跃 9-20 发布时称”跻身全球开源模型前三”,但当时权重是封闭的,且 AA 的排序里它在 45 分的 GLM-5.3 和 Qwen3.8 Max 之后。这类”开源模型”的说法,在权重真正放出来之前,建议都先打个引号。
好消息是权重 10 月 15 日就放。到那时它到底是”真前三”还是”宣传前三”,社区一测便知——这是唯一不会骗人的验证。
四、另一边的硬证据:MiMo 这 46 分不是跑分堆出来的
我一般对厂商自述的”科研案例”持保留态度,但 MiMo 这次给的两个是可以核验的:
- Lean 4 形式化证明:完成 Li–Yorke《周期三蕴含混沌》主定理的完整形式化证明,6000 余行源码通过 Lean 内核核验,且官方称此前未接受针对 Lean 的专项后训练。内核核验是二值的——要么过要么不过,没有”差不多”。这是比任何排行榜都硬的证据。
- 真实材料研究:以 Co-Scientist 角色参与 PFAS 吸附用 MOF 材料筛选,检索文献、提出候选、调用计算工具模拟筛选,把约一个月的研发周期压到 2—3 天。这条有第三方(小米侧)口径成分,但流程描述是具体的、可复现的。
训练侧的信息也值得记一笔:罗福莉(团队成员)称这很可能是迄今开源模型团队完成的计算量最大的单次强化学习训练,方法是 MixRL 在中等难度可验证任务上训练、再用 MOPD 合并其他能力,并认为其创新超过她曾部分参与的 DeepSeek R1(她本人注明这是个人判断)。另有口径称训练历时不到 6 天、成本约 262 万美元——这个数字如果属实,是整条新闻里最吓人的部分:46 分、MIT 开源、含训练代码,总成本 262 万美元。
官方把这次发布定位为探索 RSI(递归自我改进)路径的关键一步。这话每家都在说,但”开源 RL 环境 + 训练代码”是目前少数能让外部真正复现验证的做法——RSI 是不是真的,得靠别人能不能重跑。
五、那到底该怎么读这些评测?给个能直接用的框架
第一步:先看分数落在分布的哪里,别只看名次。 46 vs 44 是噪音级差异;46 vs 中位数 18 才是信息。榜首换人是新闻,中位数涨没涨才是行业进度。
第二步:把”每任务成本”拉出来单独看。 跑分是给论文用的,成本是给账单用的。$0.13(MiMo)、$0.72(Step 5)、$2.00(同级)、$206.66(AA 评测这两个模型花的钱)——同样一件事,成本可以差 15 倍。做批量业务时,成本轴的优先级应该高于分数轴。
第三步:找”主打场景”上的第三方评估。 厂商说擅长什么,就去第三方看什么。Step 5 说擅长 Agent,那 GDPval-AA 落后就是红灯;MiMo 说擅长编码,Code Arena WebDev 1628 分(总排名约第 10、MIT 开源第 3)就是对应证据。宣传口径和评估口径对不上时,以评估口径为准。
第四步:警惕”早期分数”和”输出冗长”这两个坑。 Arena 官方注明 1628 是早期 AutoEval 分数,由奖励模型自动投票产生,会随真人投票增多而收敛;AA 则标注 MiMo 在评测中产出 1.4 亿输出 tokens、偏冗长。冗长不只是花钱——放在 Agent 里就是上下文窗口消耗更快、等待更久。
第五步:权重放没放、放了什么,单独算一笔账。
| 你拿到的东西 | MiMo-V2.6 | Step 5 Preview(当前) |
|---|---|---|
| 权重 | ✅ MIT | ❌ 10-15 后 |
| 技术报告 | ✅ | 部分 |
| RL 环境 + 训练代码 | ✅ | ❌ |
| 可自托管 / 审计 | ✅ | ❌ 只能走 API |
“开源”不是营销形容词,是一个清单。 清单打勾越多,你越能自己验证它、微调它、在内网跑它——这恰恰是政企和数据敏感场景唯一在意的事。
写在最后
这一天的两条新闻,其实说的是同一件事的两面:
智能-成本的帕累托前沿正在被持续外推,而”开源”这个词的内涵,正在分化成”全开源”和”只开 API”两种东西。
46 分登顶的那家把整条训练管线交了出来,成本压到单任务 $0.13;44 分的那家用 1/2.8 的成本证明了”够用且便宜”同样是竞争力,代价是权重要再等 23 天。
对选型的人,我的建议只有一句:别问”哪个模型最强”,问”我的任务在哪个成本档位上,需要多少可验证性”。 分数每年都在洗牌,权重放没放、每任务花多少钱——这两件事不会骗人。
10 月 15 日阶跃开权重那天,这篇里的所有判断都值得拿出来对一遍账。
数据来源(AIHOT 站内页):
- 小米发布 MiMo-V2.6 Pro 与 Flash 全模态开源模型(2026-09-22 04:51,来源:X @XiaomiMiMo)
- Artificial Analysis 评测 Step 5 Preview:Intelligence Index 得 44 分,成本约为同级模型 1/2.8(2026-09-22 09:49,来源:X @ArtificialAnlys)
- 延伸:AA 评测 MiMo-V2.6-Pro 详细数据、MiMo-V2.6 发布与科研案例、卡兹克实测 Grok 4.7 vs MiMo V2.6、Step 5 Preview 官方发布、Elvis Saravia 实测 Step 5 vs GLM 5.3
- 评测分数与成本为评测方/厂商披露口径,AutoEval 等分数会随样本更新收敛;引用具体数字请回原始评测页核对。
posted on 2026-09-22 21:27 fox_charon 阅读(3) 评论(0) 收藏 举报
浙公网安备 33010602011771号