过去一年,DeepSeek以“花小钱办大事”的形象震撼了全球AI圈。V3模型训练成本仅557.6万美元,R1模型登上《自然》杂志封面——这些成就让外界将目光聚焦在它的算法创新上。
但真正懂行的人知道:DeepSeek最强的,从来不是训练模型,而是Infra(基础设施)。
一、从“萤火”开始:Infra基因刻在骨子里
DeepSeek的Infra实力,并非凭空而来。它的母公司幻方量化,早在量化交易时代就开始了对算力的极致追求。
2019年,幻方量化投入近2亿元,自主研发了深度学习训练平台“萤火一号”,搭载1100块GPU。这个占地相当于一个篮球场的AI超级计算机,号称可以匹敌4万台个人电脑的超级算力。
2021年,“萤火二号”升级至10亿元,搭载了约1万张英伟达A100显卡。据业内人士估算,幻方的萤火超算平台,算力至少是同业平均的10倍以上。“萤火二号”实测FP16算力达1.5 EFLOPS,在性能上接近DGX-A100,但成本降低了一半,能耗减少了40%。
建机房、铺冷却、调PUE——这些过去是云厂商和电信运营商的专属领域,幻方量化早早亲自下场。而这种“从硬件到软件全栈掌控”的工程文化,被完整地继承到了DeepSeek。
二、技术实力的硬核证据:把硬件性能“压榨”到极致
DeepSeek的Infra团队有多强?数据会说话。
3FS并行文件系统:在2025年的开源周中,DeepSeek开源了Fire-Flyer File System(3FS)。这个系统在180节点集群中实现了6.6 TiB/s的总读取吞吐量;每个客户端节点的KVCache查询峰值吞吐量超过40+ GiB/s。有网友评价,这“就像从自行车升级到了高铁”。
DualPipe算法:DeepSeek自研的双向管道调度算法,让计算和通信完全重叠,将万卡集群训练效率提升至92.1%。
自研推理加速框架DSpark:与北大联合开源,在同等吞吐量下将生成速度提升60%至85%。
这些不是纸上谈兵的论文,而是已经在大规模生产环境中验证过的工程成果。
三、557.6万美元的“奇迹”:Infra如何改写成本公式
DeepSeek-V3仅使用2048块英伟达H800 GPU,耗时不到两个月,以557.6万美元完成训练。而同等规模的模型,行业巨头的投入动辄数亿美元甚至数十亿美元。
这个“奇迹”的背后,是Infra团队的硬功夫。
DeepSeek创始人梁文锋曾明确表达反对“大力出奇迹”的资源堆砌模式,主张通过架构和工程效率优化来弥补硬件短板,让“小力”也能出奇迹。
而这种效率至上的哲学,在DeepSeek被贯彻到了极致。有业内人士透露,DeepSeek的Infra工程师数量多于算法工程师,而在很多大公司情况正好相反。
四、来自最强对手的评价:“全球顶级”
如果自说自话不够有说服力,来看看最顶尖同行怎么说。
游凯超,开源大模型推理引擎vLLM的核心维护者、Inferact联合创始人兼首席科学家。vLLM是大模型推理引擎中的“扛把子”,在开源模型生态中处于核心地位。
在张小珺的商业访谈录中,游凯超对DeepSeek的Infra团队给出了极高的评价——“绝对是全球顶级的”。
他进一步剖析了背后的原因:DeepSeek的深厚工程功底,源于创始团队在幻方量化时期对性能极限的压榨——自建机房、全站优化、对机器每个细节深度控制。他还指出,DeepSeek在推理引擎方面比vLLM走得更前,vLLM团队曾不断向其学习。
一个被全球最顶尖的Infra团队视为学习对象的存在——这本身就是最有力的证明。
五、从“算法公司”到“基建公司”:Infra的战略升维
如果说之前的Infra实力还停留在技术层面,那么DeepSeek最新的动作,则把Infra提升到了战略高度。
2026年6月,DeepSeek完成首轮外部融资,募资总额约500亿元。随后,公司开始大规模招聘土木、电气、暖通、能源等专业人才。招聘信息中写道:“每一代人都会遇到属于自己的基础设施革命。过去是铁路、电网和互联网,今天则是支撑AI发展的超大规模算力集群。”
据报道,DeepSeek计划在内蒙古乌兰察布建设一座约1吉瓦(GW) 的大型AI数据中心。
这意味着DeepSeek正在把Infra能力从“软件优化”延伸到“物理基建”——从比特世界,一路打到原子世界。他们要追求的,是从机房散热到电力成本的总体拥有成本(TCO)最优。
当土木、暖通、电气工程师也开始成为大模型公司的招聘对象时,这本身就说明:AI的竞赛早已不止于模型参数和榜单排名,而是延伸到了芯片、电力等基础设施层面。
六、Infra主导的组织文化:一开始就做MoE的秘密
DeepSeek的组织架构也印证了Infra的主导地位。
公司采用极度扁平的组织架构,团队规模长期控制在150-200人左右。但这种“小团队”的效率却惊人——核心研发离职率不到4%。
更重要的是决策逻辑。有业内人士指出,一个团队做MoE(混合专家模型)的早晚,直接反映了Infra团队的影响力和地位。MoE在算法人员眼里是降本手段,不直接提升模型能力上限。但DeepSeek一开始就做MoE,这说明Infra团队在模型结构上有巨大的影响力。
换句话说,在DeepSeek,Infra不是算法的“后勤”,而是算法的“设计师” 。模型架构的选择,首先要考虑的是在Infra上跑得高效。
结语
DeepSeek的故事揭示了一个被很多人忽视的真相:在AI领域,模型能力的天花板,往往不是由算法决定的,而是由Infra决定的。
557.6万美元训练出顶级模型,不是运气;6.6 TiB/s的文件系统吞吐,不是偶然;被vLLM核心维护者称为“全球顶级”,更不是恭维。
这是十年量化交易时代积累的工程底蕴,是对每一块GPU、每一根网线、每一度电的极致掌控。
DeepSeek最强的,从来不是训练模型,而是Infra。 而这个判断,正在被越来越多的证据所印证。
浙公网安备 33010602011771号