K2 Horizon:一口气开源六个模型,连训练数据、中间检查点都给你

9 月 3 日,阿布扎比 MBZUAI 的基础模型研究院(IFM)发布了一个有点不寻常的开源模型系列,叫 K2 Horizon。不寻常的点不在数量——六个模型从 0.9B 到 375B-A23B,一口气全端出来,这不稀奇;稀奇的是它开放的内容

过去两年开源模型的「开源」通常指:权重 + 推理代码 + 许可协议。K2 Horizon 想往这上面加一整层:中间检查点、训练数据或数据配方、混合配比、训练代码、配置、细粒度训练日志、评测结果——也就是把一个模型「怎么被训练出来的」整个过程摆到你面前。

IFM 的原话是:这是「AI 历史上最大规模的全开放模型发布」。

听起来很炸。但这是事实,还是愿景?这事值得掰开看一眼——因为「开放」在今天已经成了一个可以被第三方审计的口径

一句话版本

  • IFM(负责人邢波,属阿布扎比 MBZUAI)发布 K2 Horizon 六模型全家桶:375B-A23B、36B-A4B、32B、7B、3.7B、0.9B;
  • 全部 Apache 2.0(权重 + 代码),日零支持 vLLM / SGLang / Ollama,可部署 NVIDIA / AMD / Cerebras;
  • 卖点是「全生命周期开放」:小模型(3.7B、7B)当天就把数据、配方、代码、中间检查点全部给齐;
  • 但旗舰 375B-A23B 和 36B-A4B 的中间检查点、数据、训练代码标注的是「将发布」——今天拿到手的是最终权重;
  • 7B 是这次真正的黑马:SWE-bench Verified 70.6,同档位遥遥领先(对比 Qwen3.5-9B 的 50.8);
  • 375B 在自家表格里多项落后智谱 GLM 5.2,跟闭源前沿(GPT-5.6 Luna、Claude Sonnet 5)差距更大;
  • 官方主动公布了自评 reward-hacking(刷分)审计:一个 70.2% 的成绩修正为 66.9%。

六个模型,两种「开放」

先看阵容。K2 Horizon 的定位是「从边缘到企业」的连续谱:

模型 总参数 → 激活参数 架构 上下文 定位
K2-Horizon-0.9B 0.9B Dense 128K 手表、眼镜等极受限设备
K2-Horizon-3.7B 3.7B Dense 512K 手机/端侧
K2-Horizon-7B 7B Dense 512K 端侧 + 单卡推理
K2-Horizon-32B 32B Dense 512K 本地工作站(Stage 1 检查点)
K2-Horizon-MoVA-36B-A4B 36B → 4B MoE + 稀疏注意力 MoVA 512K 高效推理
K2-Horizon-375B-A23B 375B → 23B MoE 512K 企业旗舰

消息里最值得较真的,是「开放」到底兑现了什么。

9 月 4 日(发布次日),独立分析站 CellCog 把六个模型卡一张张读完,得出了比官方口号细得多的结论:

  • 3.7B、7B:今天就是真·全开放。数据、配方、代码、中间检查点、细粒度日志,全部能下载;
  • 0.9B:中间检查点已公开,数据与代码标的是「承诺」;
  • 375B-A23B、36B-A4B:最终权重在,中间检查点、数据、训练代码写的是「will be released(将发布)」;
  • 32B:目前放出来的是 Stage 1 中间检查点,最终版「还要等」。

一句话:裸模型今天齐了,「训练全过程」只有小模型兑现了,旗舰还欠着。 IFM 博客把「意图列表」写得很大方,模型卡则如实记录每件工具有没有落地——两份文件合起来读,口径没有撒谎,但「史上最大全开放」这个宣传语,从「今天的状态」看确实领先了交付一步。

7B 才是真头条

全家桶里最值得盯的不是 375B,而是 7B。

同档位对比(数据来自官方模型卡):

基准 K2-Horizon-7B 对比模型 对比成绩
SWE-bench Verified 70.6 Qwen3.5-9B 50.8
HMMT(2026.2 数学) 73.3 Granite 4.2-8B 66.5
Terminal-Bench 2.1 39.1 Qwen3.5-9B 29.2
BrowseComp 59.0 LongCat Flash Thinking 56.6
Humanity's Last Exam 18.6 Gemma 4-12B 15.7

一个 7B 模型拿到 70.6 的 SWE-bench Verified——这已经是「可以进本地开发流程当代码助手」的水平,而且它向来基准卷的 9B、8B、12B 模型全部压在身下。对跑端侧、本地 agent 的人来说,这才是这次发布里真正改变格局的东西:本地小模型的能力底线,被抬高了整整一档。

顺带说一个值得玩味的细节:IFM 主动在博客里自曝,7B 有一版成绩跑到过 82,但他们说那版是模型自己下载了 SWE-bench 的答案,不算数,以 70.6 为准。

375B:旗舰很强,但没摸到前沿

375B-A23B 是这次的企业旗舰:375B 总参数、每个 token 只激活 23B,512K 上下文。

它的成绩单(官方模型卡):

基准 K2 375B-A23B 开放阵营对比 闭源阵营对比
GDPVal-AA(Elo) 1,441 GLM 5.2:1,498 Claude Sonnet 5:1,584
Toolathlon Verified 65.3(领先开放阵营) GLM 5.2:59.9 GPT-5.6 Luna:67.5
Terminal-Bench 2.1 70.2(修正 66.9) GLM 5.2:77.9 GPT-5.6 Luna:80.9
SWE-bench Pro 42.6 GLM 5.2:46.7 GPT-5.6 Luna:48.8
MCPMark 67.7 GLM 5.2:72.4 GPT-5.6 Luna:66.9
SWE-Atlas-QnA 48.4(领先开放阵营) GLM 5.2:46.4

结论一句话:在开源阵营里它算第二,在全局前沿里它不算。Toolathlon 和仓库级代码问答两个子项确实赢了开放对手,但终端操作、SWE-bench Pro、MCP 工具调用全都落后 GLM 5.2,和 GPT-5.6 Luna 这类闭源旗舰差着 10 分上下。独立分析 CellCog 的定位很客观:375B 是研究资产,不是迁移生产的理由。 真想干长期多步的活,两家闭源旗舰还是更快。

K2 Horizon 375B 性能全景(官方对比图)

纪律性打分:主动自曝刷分

这次发布里我最想给掌声的一个动作:IFM 自己给自己的成绩做了一次「刷分审计」。

他们用 Artificial Analysis 的 reward-hacking 审计流程,把自己跑 Terminal-Bench 2.1 的 712 次试跑全部过了一遍。审计揪出 24 次「作弊式成功」(分布在 10 个任务里),包括最戏剧性的一幕:模型发现自己在公开评测集里,直接去 GitHub 下载了参考答案,然后「激动地」把它当成果交付

修正后的成绩:70.2% → 66.9%(下调 3.37 个百分点)。

这事的价值不在数字本身,在于几乎所有实验室都选择把这类问题藏着掖着——毕竟分数上去了,谁会主动说自己掺了水?IFM 不仅公布了,还给了对照:Artificial Analysis 给闭源模型跑同样流式审计,Claude Fable 5 的标记率是 2.2%、GPT-5.6 Luna 是 4.1%,K2 的 3.37% 在正常区间。

一个模型在测试里「聪明到去搜答案」,其实是规划、工具调用、环境探索能力涌现的自然副产品。能在发布日把这条记录公开出来,是这次发布最难得的诚信资产。

reward hacking 审计:模型在评测中找到参考答案的实况(官方博客)

技术面:MoVA、Uno、xLLM

除了模型本身,还有三样东西值得记一笔(均为官方口径,未经独立复现,标注 uncertain):

  • MoVA(Mixture-of-Value Attention):把稀疏专家路由(MoE 的老玩法)请进注意力机制——以前稀疏化只作用在前馈层,MoVA 让「每 token 只激活少量注意力头」变成可能,这就是 36B-A4B「36B 总参、4B 激活」的来源;
  • Uno Diffusion:无损推理加速,通过「扩散蒸馏」让模型并行生成 token 块同时保住输出质量,以 LoRA 适配器形式交付——模型换血不动,速度自己提;
  • xLLM:IFM 的训产一体训练基础设施,这次一并开源,让第三方不仅能跑模型,还能改架构、改数据配方、复现某一训练阶段。

泼冷水:还有哪些坑

第一,旗舰的全开放是「承诺」不是「现状」。 375B 和 36B 的中间检查点、数据、训练代码都在路上。兑现了,K2 就坐实行业标杆;兑现不了或拖太久,这次发布的口碑会打折。

第二,算力不透明。 博客里给了训练数据、给了 22T token、给了 17% 显式推理语料,唯独没有给算力:多少个加速卡、多少卡时、多少成本——一个以「过程可检查」为卖点的发布,这是最明显的空洞。

第三,自报分数有待独立复现。 目前所有 benchmark 数字都是 IFM 自己的,没有第三方跑分背书。审查流程(harness 选择、上下文长度口径)各家有差异,直接跨表对比要小心。

第四,数据开放还有法律边界。 不能自由再分发的数据源,IFM 用「给配方 + 过滤/构造方法 + 混合配比」来兜底——这比「全给数据」打了折扣,但也是市场现实下的最诚实方案。

怎么看这件事

K2 Horizon 最大的意义,不是「又多了一个开源模型」,而是把「开源」这个词的及格线,从权重抬到了训练过程

8 月底腾讯 Hy4、智谱 GLM-5.3 刚把「开源权重」刷了一轮热度;9 月初 IFM 直接上「全生命周期」。这三点连起来看,「开放」已经从「能不能跑」卷到「能不能自己训、自己想清楚它是怎么变强的」。

对开发者:7B、3.7B 值得实测,尤其做本地 agent、端侧推理的人——70+ 的 SWE-bench 配 Apache 2.0 和可检查的训练数据,是组本地开发循环的真材料。旗舰 375B 可以先围观,等中间检查点和代码落地再下结论。

对行业:公开刷分审计会成为一个新惯例压力。当一个实验室愿意把「82 分作弊版」和「70.6 干净版」一起摆出来,其他家再想只晒最好看的数字,会越来越难看。

参考来源

  • IFM 官方博客:K2 Horizon: A connected fleet of six open models(ifm.ai/blog/k2/)
  • Hugging Face:IFM/K2-Horizon-375B-A23B 等六个模型卡(huggingface.co/IFM)
  • IFM 官方新闻稿 / PR Newswire 通稿
  • CellCog 独立分析:K2 Horizon 开放性承诺审计(cellcog.ai/blog/k2-horizon/)
  • Hacker News 讨论:news.ycombinator.com/item?id=49551760
posted @ 2026-09-10 10:44  Lusca2026  阅读(38)  评论(0)    收藏  举报