预算有限还想私有化 K3?2.68T 显存+交钥匙交付,商红科技让中小团队也能上车
7 月 27 号,月之暗面把 Kimi K3 开源了。2.8 万亿参数,100 万 Token 上下文,原生多模态。
问了一圈做 AI 的朋友,反应出奇一致:东西是好东西,跑不起。

满血部署按 H200 算,大概 8 到 16 台模组。生产级基线是 64 张以上加速卡搭 Supernode。对大多数公司来说,这个账单拿给老板批,没几个人敢签。
但有一条路——商红科技用两台浪潮 NF5868G8 把这事跑通了。
为什么两台机器就够
关键在于 K3 官方的权重格式。月之暗面发布时直接给了 MXFP4 权重,搭配 MXFP8 激活,HuggingFace 上 96 个分片总计约 1.56TB。下载完就是量化好的,不用自己再折腾一轮。
1.56TB 只是权重本体。推理是权重、激活、KV Cache 三部分抢显存。所以方案的核心就是在显存总量上留够余量。
两台 NF5868G8 怎么配
商红科技给出的方案是这样:
单台 NF5868G8:
8U 机身,16 张双宽 PRO6000D 84G
PCIe Fabric 全互联,两卡间 P2P 带宽 128GB/s,延迟压了 60%
2 颗 6767P(第六代至强)
24 条 64GB DDR5,32 槽
2 块 7.68TB U.2 NVMe
6 块 3300W 钛金电源,N+1 冗余,整机 16.5kW
400G + 10G 双口网卡
两台合计 32 卡、2.68T 总显存。1.56TB 权重装进去之后,剩下的空间留给激活和 KV Cache,跑 K3 推理够用。
组网侧一台 X400 400G 智算交换机就够了。参数面 3.2Tbps 无阻塞 RDMA,有效带宽 95%,是 RoCE 的 1.6 倍。而且 X400 二层就能挂 8000 张 GPU,将来要扩容不用换交换机。

有一个可以参考的性能数据:NF5868G8 这个架构在部署 DeepSeek 671B 时,推理性能比传统 2 机 8 卡方案高出近 40%。这块板子对付超大模型的互联带宽瓶颈,确实有明显改善。
门槛不在机器,在怎么把机器装对
方案是现成的,参数也算清楚了。但真做起来,模型怎么切分、PCIe 拓扑怎么搭、显存策略怎么配——这些环节随便一个没调到位,吞吐量打对折很正常。
商红科技给的不只是机器清单。他们是浪潮信息官方授权的亿元级钻石分销商,300 多人的团队服务过 3 万多家企事业单位。从售前帮你做架构设计,到进场部署,再到 7×24 小时售后——整件事是交钥匙交付,不是卖完硬件就拉倒。

预算卡在千万以内、又想把 K3 私有化落地的团队,找他们要个定制方案比什么都实在。

浙公网安备 33010602011771号