西方开源模型回来了:1T 参数只烧 4,000 块 GPU,但只追到 GLM 5.2
西方开源模型回来了:1T 参数只烧 4,000 块 GPU,但只追到 GLM 5.2
10 月 5 日和 6 日,Reflection 和 Mistral 几乎同时放了开放权重模型。朋友圈的说法是"西方终于追上来了"。 我把两家披露的技术参数和第三方评测对着看了一遍,结论没这么体面:一款定位在"美中之外最智能",一款被自家研究者说成"仍落后中国同行"。 这篇想聊三件事:这两次发布的技术底牌到底是什么水平;"美国闭源 > 中国开源 > 西方开源"这个排序成不成立;以及西方为什么在 2026 年突然又开始做开源了。 顺手算了两个数——4,000 块 GPU 训 1T 模型到底合不合理,以及"开源"的权重你真能自己跑起来吗。
先说结论
- 三段格局成立,而且 AA 智能指数上能看到两道明显断层:美国闭源 53~58 分 → 中国开源 41~46 分 → 西方开源 38 分档。中间是两道坎,不是一条平滑的坡。
- 但差距不是均匀的,编码这一格已经翻过来了。 据 VentureBeat 口径,Mistral Large 4 在 DeepSWE 上得 62%,超过 GLM-5.3 的 61%。差距集中在通用推理、多模态和长任务智能体,纯编码领域西方开源已经追平甚至单点反超。
- "1T 参数只烧 4,000 块 GPU" 不矛盾,因为 MoE 的训练账是按激活参数算的。 但这也意味着"1T"这个数字的宣传价值远大于工程含义——真正决定成本的是那 49B。
- 开源权重 ≠ 你能自己跑。 1.05T 参数光权重,4-bit 量化就要 525GB 显存,实际部署门槛在 8 张 H200 这个量级。这个折扣,是"开源"这个词今年最需要打引号的地方。
- 西方回来的最硬原因不是情怀,是蒸馏的单向性。 中国实验室能蒸馏 Anthropic 和 OpenAI 的输出,西方实验室做不到同样的事。这把"能力差距"重新定义成了"起点位置差距"——不随努力程度变化。
下面逐个拆。
一、先把技术底牌摊开
1.1 两家的参数表
| Mistral Large 4 | Reflection Beam | |
|---|---|---|
| 代号 | Le Chonk | — |
| 架构 | 细粒度 MoE + 1.6B 视觉编码器 | 纯文本稀疏 MoE |
| 总参 / 激活 | 1.05T / 49B(激活比 4.7%) | 501B / 23B(激活比 4.6%) |
| 模态 | 原生多模态 | 仅文本 |
| 上下文 | 512K(OpenRouter 另有 1M 说法) | 1M(官方措辞"有效上下文") |
| 预训练数据 | 未披露 | 23.8 万亿 token |
| 训练算力 | 仅 4,000 块 NVIDIA GPU,自有算力 | 未披露 |
| 权重 | 计划 10 月底(TechCrunch 说三周内) | 本月,Apache 2.0 |
| 现在能自托管吗 | ❌ 只有公开 guardrail 端点 | ❌ 候补名单,仍在最终安全测试 |
| AA 智能指数 | 38(与 GPT-6 Luna max 持平) | 未出分 |
| 定价 | $0.68 / $2.09 每百万 token(前两周五折),任务成本 $0.57 | 未公布 |
两家的激活比例几乎一模一样(4.6% vs 4.7%),这不是巧合——细粒度 MoE 已经是这个量级模型的默认解法,差别只在专家切多细、路由怎么做。
1.2 "1T 参数只用 4,000 块 GPU"——这个数其实是合理的
先把最容易引起误会的点算清楚。TechCrunch 说 Mistral Large 4 只用 4,000 块 NVIDIA GPU 训练,很多人的第一反应是"这不可能,1T 参数的模型哪是 4,000 卡能养的"。
问题出在算力公式上。稠密模型的训练算力约等于 6 × N × D(N 为全部参数、D 为训练 token 数),但 MoE 每个 token 只激活一部分专家,所以账要按激活参数走:
C ≈ 6 × N_active × D
代入 Mistral Large 4:
N_active = 49B,假设D = 20TtokenC ≈ 6 × 4.9e10 × 2e13 ≈ 5.9e24 FLOPs- 4,000 张 H100,FP8 峰值约 2 PFLOPS/卡,按 40% 利用率算 → 有效
3.2e18 FLOP/s 5.9e24 / 3.2e18 ≈ 1.8e6 秒 ≈ 21 天
量级是对得上的。 所以 4,000 卡训 1T 模型并不神奇——神奇的是我们总把"1T 参数"当成训练成本,而它其实主要是显存成本。
⚠️ 这是我按 20T token、40% MFU 做的粗算,Mistral 没有披露实际 token 量和训练时长,所以只能看量级。但结论方向是全行业通用的:MoE 的稀疏性,是西方实验室能用小算力打出"1T 级"模型的根本原因。
反过来说也更残酷:如果只能拿 4,000 卡,就必须把 token 量压下来。 而 token 量恰恰是这一轮能力差距最真实的来源之一——Beam 的 23.8 万亿 token 是明牌,Mistral 的没写。
1.3 那这份"开源"你跑得动吗?
这是我觉得最该被拿出来说的一节。"开放权重"和"你能自己部署"是两件事。
按 4-bit 量化(每参数 0.5 字节)估算纯权重体积:
| 模型 | 总参数 | 4-bit 纯权重 | 实际部署门槛 |
|---|---|---|---|
| Mistral Large 4 | 1.05T | 约 525 GB | 8 × H200(141GB)起 |
| Reflection Beam | 501B | 约 250 GB | 4 × H100 80GB |
| MiMo-V2.6-Pro(对照) | 1.02T | 约 510 GB | 8 × H200 起 |
Mistral Large 4 光权重就要 525GB——4 张 H200 是 564GB,理论够装但一点余量都没有,实际得 8 张起步,而且还没算 512K~1M 上下文的 KV cache。这个量级的上下文,KV cache 本身就是个不小的数。
所以第二档和第三档里那些"1T 级开源模型",自托管的真实门槛都在"8 卡 H200"这个量级。个人开发者和小团队实际上只能通过 OpenRouter、Together 这类托管方去用——权重是开的,成本没降。
MiMo 把权重、技术报告、RL 环境、训练代码一次性全放,这是"开源"的完整形态;而 Mistral 和 Beam 目前的措辞都是"计划放出权重"。Hugging Face CEO Clément Delangue 那句话说得挺准:"在权重尚未开放之前不能自称最佳开源权重模型。"
二、三段格局:四道数据摆一起看
2.1 分数轴
| 档位 | 代表 | AA 智能指数 | 口径时点 |
|---|---|---|---|
| 美国闭源 | Claude Opus 5.5 | 58 | 10-06,The Decoder 引述 |
| 当前领先者 | 57.6 | 10-01,AA 官方 | |
| Gemini 4 Argon | 53 | 10-01,追平 GPT-6 Astra max | |
| 中国开源 | MiMo-V2.6-Pro | 46 | 09-22,开源权重第一 |
| GLM-5.3 (max) | 45 | 09-22 | |
| Qwen3.8 Max | 45 | 09-22 | |
| Kimi K3 (max) | 44 | 09-22 | |
| Ant Ling 3.1 Flash | 41 | 10-06,前代只有 20 | |
| 西方开源 | Reflection Beam | ≈ GLM 5.2 档 | 10-06 |
| Mistral Large 4 | 38 | 10-06 | |
| 参考 | 开源权重中位数 | 18 | 09-22 |
两道断层的宽度不一样:闭源到中国开源约 7~12 分,中国开源到西方开源约 5~7 分。 这就是"三段"而不是"两段"的全部依据。
⚠️ 口径提醒:Ant Ling 3.1 Flash 的 41 分是 AA 智能指数 v4.3 口径,09-22 那批是更早版本。AA 指数一直在涨版本,跨月直接比差值会有系统性误差,上表只用来看相对位置。
顺带一个宏观数据:AA 官方说各个分数里程碑之间的间隔已经从 239 天缩到 126 天、再到 99 天,当前领先者 57.6——整个榜单在加速,所以"落后一档"在时间上可能只等于落后一两个月。
2.2 成本轴
这一轴中国开源赢得最干脆,也是被引用最少的一轴:
- MiMo-V2.6-Pro:单任务 $0.13,MIT 许可,99% 缓存折扣
- DeepSeek V4.1 Flash:ARC-AGI-2 72.9% / 每任务 $0.13,ARC-AGI-1 94.5% / $0.07(比 V4 Flash 高 11.5 / 5.5 分,代价是每任务成本高约 250%)
- Mistral Large 4:任务成本 $0.57(预览期五折)
- Kimi K3:官方口径每任务成本显著更高
分数差 5 分、成本差 4 倍,这两个数字放在一起才是真实的选型画面。 对跑批量的场景(内容审核、文档分类、Agent 里的子调用),成本轴比分数轴重要得多。
2.3 效率轴:这里有个容易读错的地方
Beam 的官方宣传是"推理任务上以少三到四倍算力匹配 GLM 5.2",马东锡 NLP 的转述是"推理计算量只有 GLM 5.2 的 1/3–1/4",而 Artificial Analysis 的独立早期指标说"同等智能水平下 token 效率突出"。
三处口径听上去一致,但指向的都是推理侧,不是训练侧。
这中间的区别很关键:
- 推理侧省算力 = 同样一道题,它思考得少、输出 token 少 → 便宜的是调用方
- 训练侧省算力 = 用更少的卡和 token 训出同等能力 → 便宜的是厂商
宣传稿把两件事说得像一件。"1/3–1/4"不能被读成"训练也省了 3~4 倍"——训练成本这笔账,两家都没披露。AA 那句"token 效率突出"才是唯一有第三方背书的表述,而它说的是推理。
⚠️ 这段是全文最容易被追问的地方。 如果有人拿"Beam 只要 1/4 算力"来论证"西方开源更高效",把训练成本和推理成本分开问就行。
2.4 那个被忽略的格:编码
DeepSWE 成绩(VentureBeat 口径)
Mistral Large 4 62% ← 超过了
GLM-5.3 61%
Code Arena: WebDev 上 Mistral Large 4 拿到 1534 分、第 45 名(比 Mistral Large 3 的第 130 名高 304 分,比 Mistral Medium 3.5 高 271 分)。
这是全文唯一一处西方开源明确超过中国开源的地方,也是最容易被"三段格局"这个说法盖掉的地方。 如果你的判断只建立在"谁分高"上,就会漏掉最具说服力的那格证据——它说明差距是结构性的、分领域的,而不是全面落后。
三、差距为什么会长成这个形状
3.1 蒸馏是单向的,这是最硬的一条
Yuchen Jin 在评论 Beam 和 Mistral Large 4 时把这层窗户纸捅破了:
"这让我不禁思考,西方与中国开源模型之间真正的差距是否就是这么简单:中国实验室可以蒸馏 Anthropic 和 OpenAI 的模型。西方实验室不能。"
这句话的分量在于,它把"能力差距"翻译成了"起点位置差距"。中国实验室的教师模型是世界第一梯队,学生的起点就在高处;西方实验室要自己从零爬到 GLM 5.2,投入是前者的数倍。这不是努力问题,方向不变的话也补不上。
而且这不是理论推演,是有案例的。OpenAI 在 9 月 30 日披露了一起有组织的模型蒸馏攻击:7 月 24–25 日出现来自超 4,000 用户、16,000 次请求,关联账号超 15,000 个,7 月 28 日关停。
更值得看的是后续——The Decoder 的复测发现,同样手法在 Azure 上仍然能窃取 GPT-6 Astra 等模型的推理内容。
也就是说:只要最强模型还在以 API 形式对外开放,这条"抄近道"的路就一直开着,而且平台间的防护并不一致。这直接决定了西方开源的追赶难度被结构性地设高了一档。
3.2 最前沿的算力被锁在最不愿意开源的公司手里
Reflection 有英伟达的投资、501B/23B 的规格、1M 上下文、23.8 万亿 token 的训练量——配置不差。但它不是 OpenAI、不是 Anthropic、不是 Google,拿不到那个量级的训练预算。
于是就出现一个很别扭的结构:美国最顶尖的算力集中在三家开源意愿最低的公司手里,而有开源意愿的中型实验室没有算力。 算力和意愿被分在了不同公司,这是西方开源掉到第三档的根本原因,比"技术不行"准确得多。
看一组对比就知道量级差多少:
- Anthropic:未来数年算力支出 5180 亿美元,其中约 4137 亿不可撤销,即使容量闲置也要付,平均每年约 410 亿美元
- SpaceX:正洽谈借款 400 亿美元采购英伟达芯片(阿波罗牵头,约 100 亿银行贷款 + 300 亿投资级债券,预计 2027 年完成)
- Mistral:4,000 块 GPU
第一档的位置,本质上是"谁敢烧这个钱、谁必须烧回来"的结果。58 分的模型如果开放权重,Pro/Max 订阅的定价权会被自己的权重打穿——所以那 4137 亿美元的承诺和闭源决策,是同一件事的两面。
3.3 中国这边为什么选开源
反过来说,中国头部实验室几乎同时把开放权重当主战场,也不是道德选择。
打不过闭源的资本厚度,就用可下载、可私有化、可国产算力部署去换份额。权重开放换来的是三件更实在的东西:国产加速卡的部署入口、政企客户的私有化采购、生态位的锁定。MiMo 一次把权重、技术报告、RL 环境、训练代码全放还带 99% 缓存折扣,DeepSeek 一路压每任务成本——这都是在用成本曲线换份额。
一句话:美国闭源靠定价权赚钱,中国开源靠成本曲线占位,西方开源两条都不占,所以掉到第三档。
四、那西方为什么又回来做开源了
4.1 先看一句已经很直白的话
Mistral 官方的定位是"美欧最佳开放权重模型"。这是一个明确的地缘 bloc 表述——它不说"最强",说"美欧最佳"。
TechCrunch 说得更透:Mistral Large 4 被定位为"介于闭源与中国开源模型之间的第三条路线"。
加上 HF CEO 那句"未开放权重前不该自称最佳开源权重模型",整个舆论场在争的其实不是分数,是"开源"这个词的定义权。这已经上升成类别层面的争夺了。
4.2 不回来,就等于把一整块叙事让出去
事实基础很硬:Beam 被自家研究者描述为落后 GLM 5.3 / Kimi K3 / DeepSeek V4.1 Flash,Mistral Large 4 是"美中之外最智能"。过去一年"开放权重"这个类别的主导权,事实上在中资实验室手里。
Axios 的报道把这个动机写得很明白:Reflection 等多家西方企业本月将推出开放权重模型,预计"最初落后于美国竞争对手最先进的闭源模型,但足以同中国友商的顶级开放权重模型竞争"。
请体会这句话的措辞——标准不是"领先中国",是"同中国友商竞争"。 这就是防守姿态的完整表述。
Nathan Lambert 的行为也很说明问题:他先转发祝贺 Reflection 发布 Beam,随后又公开说 Reflection"加入了 Nvidia 和 Thinking Machines 的行列——发布了自家最强模型却仍落后于中国同行"。
"我们发了最强模型但还是落后"正在变成一个被反复公开讨论的叙事。 这种公开压力本身就是推力。
4.3 更实际的一条:换赛道
Mistral 的做法最能说明问题。4,000 块 GPU、优化用例明确指向网络安全、金融、芯片设计——这不是在通用赛道上硬追,是挑那些通用大模型不擅长、又必须可审计可控的场景去卡位。
VentureBeat 口径下它 DeepSWE 62% 超过 GLM-5.3 的 61%,就是这个策略的直接产出。
在通用能力上追不平,就在垂类上单点突破。 这条路如果走通,中国开源在通用能力上的领先并不会自动转化为垂类统治。
4.4 商业上,权重已经不是"送钱",而是一条漏斗
基础设施今年其实已经铺好了:
- Together Link(10-05):把已有的编码智能体接到 Together AI 的开源模型上,宣称省下 50%+ 支出
- OpenRouter:Mistral Large 4 上线即公测,定价透明
- Prime Intellect:Prime Inference 服务前沿开源模型,内部每天处理近 1 万亿 token
- Hugging Face:已经是事实上的分发层
权重免费,推理算力、托管服务、agent harness 才是收入。 对 Mistral 这种没有 Google / Microsoft 分发渠道的公司,"开源"是抢生态位成本最低的入口。
4.5 还有一层:合规成本在涨
EU AI Act 已经开始产生实际成本。OpenAI 为此推出 textGrain 文本水印,未来数周将在欧盟为 ChatGPT 和 Codex 输出自动添加、覆盖所有套餐——前沿模型的输出侧已经被合规约束了。
在这个背景下,"开放权重"对欧洲实验室还多了一层含义:能力以可审计、可本地部署的形式落地。 Mistral 作为欧洲唯一的头部前沿实验室,需要一个能对标中美的开放权重旗舰,这不只是商业选择。
五、等权重真放出来,你该测什么
两家现在都还没放权重。等放了之后,别直接信跑分,按这四步过一遍:
第一步:核许可,不核名字。 MiMo 是 MIT、Beam 是 Apache 2.0、Mistral Large 4 还没公布。"开源"这三个字在不同许可下的商业含义差别很大——有的允许闭源二次分发,有的对商用规模有附加条款。先看 LICENSE 文件,再看宣传稿。
第二步:核分词器。 把同一批文本分别喂给新模型和已知家族,逐 token 比对切分结果。分词器是模型的"齿痕",不同厂商、不同代际的 BPE 合并规则几乎不可能完全一致。这一步能验证它到底是不是从零训的——Reflection 说 Beam 是"从零端到端训练",这个说法可以验。
第三步:测"1M 上下文"是有效还是仅上限。 官方的措辞是"有效上下文 100 万 token",这个说法比"窗口 1M"严谨,但仍要实测。用长文档中段插入关键信息、观察召回位置,比看参数表可靠。Mistral Large 4 的上下文数字已经在 OpenRouter 上自相矛盾过(先 512K 后又 1M),这个矛盾本身就说明口径没定死。
第四步:测每任务成本,不是每 token 价。 AA 反复强调"token 效率"是有原因的:一个每百万 token 便宜一倍的模型,如果输出 token 消耗是两倍,实际成本完全可能更贵。 Upstage Solar Mini 4 就是现成的反例——每 token 定价很低,但因为每任务要烧约 88k 输出 token,单任务成本反而约为 GPT-6 Luna (max) 的 5 倍。
六、我的判断
如果要给这件事压一句:
"美国闭源 > 中国开源 > 西方开源"在分数上成立,但它在两个地方会误导人。
一是它把差距说成了全面性的,实际上编码这一格已经翻过来了,差距的结构比排序重要。二是它容易让人忽略效率轴——西方开源这次打的不是"我比你聪明",是"我用更少的钱达到你的水平"。当推理效率这个维度被抹平,中国开源的成本优势窗口就会收窄。这是未来两年真正要看的比赛,不是下一个分数。
对国内从业者,我的建议是三句:
- 通用能力上不必追美国闭源。 4137 亿美元级的不可撤销算力承诺,不是靠勤奋能补的。
- 中国开源真正的护城河在成本曲线和部署生态。 $0.13 的单任务成本是客户每天在用的时候验证过的,比排行榜名次抗打。
- 垂类是被低估的战场。 Mistral 选网络安全、金融、芯片设计,立刻拿到了中国开源没有的叙事——垂类不需要打败 GLM-5.3,只需要解决一个通用模型解决不了、又必须可审计的问题。
数据来源
全部内容取自 AIHOT(aihot.news)收录的公开报道与第三方评测,未使用训练记忆补写。
核心两篇 - Mistral 发布 Mistral Large 4(AA 智能指数 38 分)→ https://aihot.news/items/rmc5fz5rbcwzsr7cdl5jo1ojk - Reflection 发布 501B 开源模型 Beam → https://aihot.news/items/qy7y0cfu1wbum1ej9urwylfxr
技术参数与评测 - AA:Mistral Large 4 智能指数 38 分 → https://aihot.news/items/n051p5n4kqjg0p1zaolr98lp0 - AA:智能指数进步提速(里程碑间隔 239→126→99 天)→ https://aihot.news/items/wqc9ruxf916bpgj5ydj3g3tvh - AA:Gemini 4 Argon 53 分 → https://aihot.news/items/v4apga9k7wdoz05ktc8xgk6va - AA:Ant Ling 3.1 Flash 41 分(v4.3 口径)→ https://aihot.news/items/bxyfoo4x5psbjbo91w8o033ng - AA:Upstage Solar Mini 4 每任务成本反例 → https://aihot.news/items/uskbm4kps4q3eyjrm660voji7 - TechCrunch:仅用 4,000 块 GPU 训练、定位第三条路线 → https://aihot.news/items/y2hsshqqh0u6z1dmazgro0mi2 - Code Arena: WebDev 1534 分、第 45 名 → https://aihot.news/items/kxqn0rzbtjdxg7ibbjge08tzt - HF CEO 质疑"未开放权重前不能自称最佳" → https://aihot.news/items/bep9n0ynlavf6p7xilv9v1udu - Yuchen Jin:Beam 与 Mistral Large 4 追平 GLM-5.2、蒸馏单向性 → https://aihot.news/items/mwh0gvs7rw1ncbbi1bribhrd4 - TechCrunch:Beam 主打低推理成本对标中国开源 → https://aihot.news/items/hikgw3vnggish0m05typ0nm39 - OpenRouter 上线 Mistral Large 4.0(上下文口径矛盾)→ https://aihot.news/items/z94jsbcn3hkyiagdyb9wai8sm
事件来龙去脉 - Mistral Large 4 发布 → https://aihot.news/story/9185ce03-ea6c-4422-abbf-bef5d5f8b884 - Reflection Beam 发布 → https://aihot.news/story/553aab31-30b1-4787-bd62-3b006d83295e - Mistral Large 4 登 Arena 争议 → https://aihot.news/story/2041fa53-4d75-4089-98a7-a6a1519ee992 - OpenRouter 公测上线 → https://aihot.news/story/ba311364-6e3a-4851-ac12-c36c45832116
蒸馏与算力背景 - OpenAI 披露并处置有组织蒸馏攻击 → https://aihot.news/items/gq8k1ru5wb2hx8ihtno5rrlrf - The Decoder:同样手法在 Azure 上仍可窃取 GPT-6 Astra 推理内容 → https://aihot.news/items/uxe9v0hypn93df9ogn6glwled - Anthropic 5180 亿美元算力支出、4137 亿不可撤销 → https://aihot.news/items/nnl0kba78980jig0szh0hkfop - SpaceX 洽谈借款 400 亿美元采购英伟达芯片 → https://aihot.news/items/xoabqybtd9qrfmikalao9gba8 - DeepSeek V4.1 Flash ARC-AGI 成绩与成本 → https://aihot.news/items/quya0qxvagwzjaw5wd9ma7vvu
生态与合规 - Together Link 接入开源模型降费 50%+ → https://aihot.news/items/ef2o8x2jh4m8n7ggsq5bc5eag - Prime Intellect 发布 Prime Inference → https://aihot.news/items/e54qt77e1upo9oqowk38fply1 - OpenAI 欧盟 textGrain 文本水印 → https://aihot.news/items/xx5mgdemrqmqw5zw410sbawcz - Qwen-Image-2.1 登顶 AA-Image 开源权重榜 → https://aihot.news/items/kaz49j9sbrf1rcugch9d2fdjm
本文数据全部取自 AIHOT(aihot.news)匿名只读接口收录的公开报道。1.2 节的算力粗算为本文推算,假设条件已标注;其余数字均来自上述信源原文。重要事实请回原文核对。
posted on 2026-10-07 18:42 fox_charon 阅读(4) 评论(0) 收藏 举报
浙公网安备 33010602011771号