导航

DeepSeek最强悍的,从来不是训练模型,而是Infra

Posted on 2026-08-22 07:24  蝈蝈俊  阅读(7)  评论(0)    收藏  举报

过去一年,DeepSeek以“花小钱办大事”的形象震撼了全球AI圈。V3模型训练成本仅557.6万美元,R1模型登上《自然》杂志封面——这些成就让外界将目光聚焦在它的算法创新上。

但真正懂行的人知道:DeepSeek最强的,从来不是训练模型,而是Infra(基础设施)。

一、从“萤火”开始:Infra基因刻在骨子里

DeepSeek的Infra实力,并非凭空而来。它的母公司幻方量化,早在量化交易时代就开始了对算力的极致追求。

2019年,幻方量化投入近2亿元,自主研发了深度学习训练平台“萤火一号”,搭载1100块GPU。这个占地相当于一个篮球场的AI超级计算机,号称可以匹敌4万台个人电脑的超级算力

2021年,“萤火二号”升级至10亿元,搭载了约1万张英伟达A100显卡。据业内人士估算,幻方的萤火超算平台,算力至少是同业平均的10倍以上。“萤火二号”实测FP16算力达1.5 EFLOPS,在性能上接近DGX-A100,但成本降低了一半,能耗减少了40%。

建机房、铺冷却、调PUE——这些过去是云厂商和电信运营商的专属领域,幻方量化早早亲自下场。而这种“从硬件到软件全栈掌控”的工程文化,被完整地继承到了DeepSeek。

二、技术实力的硬核证据:把硬件性能“压榨”到极致

DeepSeek的Infra团队有多强?数据会说话。

3FS并行文件系统:在2025年的开源周中,DeepSeek开源了Fire-Flyer File System(3FS)。这个系统在180节点集群中实现了6.6 TiB/s的总读取吞吐量;每个客户端节点的KVCache查询峰值吞吐量超过40+ GiB/s。有网友评价,这“就像从自行车升级到了高铁”

DualPipe算法:DeepSeek自研的双向管道调度算法,让计算和通信完全重叠,将万卡集群训练效率提升至92.1%。

自研推理加速框架DSpark:与北大联合开源,在同等吞吐量下将生成速度提升60%至85%。

这些不是纸上谈兵的论文,而是已经在大规模生产环境中验证过的工程成果。

三、557.6万美元的“奇迹”:Infra如何改写成本公式

DeepSeek-V3仅使用2048块英伟达H800 GPU,耗时不到两个月,以557.6万美元完成训练。而同等规模的模型,行业巨头的投入动辄数亿美元甚至数十亿美元。

这个“奇迹”的背后,是Infra团队的硬功夫。

DeepSeek创始人梁文锋曾明确表达反对“大力出奇迹”的资源堆砌模式,主张通过架构和工程效率优化来弥补硬件短板,让“小力”也能出奇迹

而这种效率至上的哲学,在DeepSeek被贯彻到了极致。有业内人士透露,DeepSeek的Infra工程师数量多于算法工程师,而在很多大公司情况正好相反

四、来自最强对手的评价:“全球顶级”

如果自说自话不够有说服力,来看看最顶尖同行怎么说。

游凯超,开源大模型推理引擎vLLM的核心维护者、Inferact联合创始人兼首席科学家。vLLM是大模型推理引擎中的“扛把子”,在开源模型生态中处于核心地位

在张小珺的商业访谈录中,游凯超对DeepSeek的Infra团队给出了极高的评价——“绝对是全球顶级的”

他进一步剖析了背后的原因:DeepSeek的深厚工程功底,源于创始团队在幻方量化时期对性能极限的压榨——自建机房、全站优化、对机器每个细节深度控制。他还指出,DeepSeek在推理引擎方面比vLLM走得更前,vLLM团队曾不断向其学习。

一个被全球最顶尖的Infra团队视为学习对象的存在——这本身就是最有力的证明。

五、从“算法公司”到“基建公司”:Infra的战略升维

如果说之前的Infra实力还停留在技术层面,那么DeepSeek最新的动作,则把Infra提升到了战略高度。

2026年6月,DeepSeek完成首轮外部融资,募资总额约500亿元。随后,公司开始大规模招聘土木、电气、暖通、能源等专业人才。招聘信息中写道:“每一代人都会遇到属于自己的基础设施革命。过去是铁路、电网和互联网,今天则是支撑AI发展的超大规模算力集群。

据报道,DeepSeek计划在内蒙古乌兰察布建设一座约1吉瓦(GW) 的大型AI数据中心

这意味着DeepSeek正在把Infra能力从“软件优化”延伸到“物理基建”——从比特世界,一路打到原子世界。他们要追求的,是从机房散热到电力成本的总体拥有成本(TCO)最优

当土木、暖通、电气工程师也开始成为大模型公司的招聘对象时,这本身就说明:AI的竞赛早已不止于模型参数和榜单排名,而是延伸到了芯片、电力等基础设施层面

六、Infra主导的组织文化:一开始就做MoE的秘密

DeepSeek的组织架构也印证了Infra的主导地位。

公司采用极度扁平的组织架构,团队规模长期控制在150-200人左右。但这种“小团队”的效率却惊人——核心研发离职率不到4%。

更重要的是决策逻辑。有业内人士指出,一个团队做MoE(混合专家模型)的早晚,直接反映了Infra团队的影响力和地位。MoE在算法人员眼里是降本手段,不直接提升模型能力上限。但DeepSeek一开始就做MoE,这说明Infra团队在模型结构上有巨大的影响力

换句话说,在DeepSeek,Infra不是算法的“后勤”,而是算法的“设计师” 。模型架构的选择,首先要考虑的是在Infra上跑得高效。

结语

DeepSeek的故事揭示了一个被很多人忽视的真相:在AI领域,模型能力的天花板,往往不是由算法决定的,而是由Infra决定的。

557.6万美元训练出顶级模型,不是运气;6.6 TiB/s的文件系统吞吐,不是偶然;被vLLM核心维护者称为“全球顶级”,更不是恭维。

这是十年量化交易时代积累的工程底蕴,是对每一块GPU、每一根网线、每一度电的极致掌控。

DeepSeek最强的,从来不是训练模型,而是Infra。 而这个判断,正在被越来越多的证据所印证。