开源大模型私有化部署要几张卡?

开源大模型私有化部署要几张卡?195 个模型的显存需求一览(2026 年 9 月)

数据截至 2026 年 9 月 30 日。显存数字取自 vLLM 官方 recipes(recipes.vllm.ai)标注的最低显存, 卡数按「显存装得下」推算。完整数据和测算工具在 https://modelsage.cn/self-host ,每天自动同步。

「DeepSeek 私有化部署要几张卡」「Qwen 本地部署需要多大显存」是企业做大模型落地时最常被问到的问题。网上答案很多,但大多只讲一两个模型,精度口径也不统一:有的按 BF16 算,有的按 INT4 算,同一个模型能差 4 倍。

这篇把 vLLM 官方 recipes 收录的 195 个开源模型整理到同一口径,先给结论,再给明细表。

一、先看分布:九成以上的模型,一台 8 卡机器就够了

按每个模型最省显存的那一档(通常是 INT4 / FP4 量化)统计:

先看分布:九成以上的模型,一台 8 卡机器就够了

先看分布:九成以上的模型,一台 8 卡机器就够了

8 卡 H200 都装不下的只有 7 个:Kimi-K3、Kimi-K2-Instruct、Qwen3.8-2.4T-A95B、MiMo-V2.5-Pro,以及 inclusionAI 的三款万亿参数模型(Ring-2.6-1T、Ling-2.6-1T、Ring-1T-FP8)。这些必须跨节点部署,工程复杂度是另一个量级。

需要说明:单卡能装下的 86 个里,有相当一部分是 OCR、语音、小尺寸模型。真正的旗舰对话模型,基本都在「单机 8 卡」这一档。

二、主流模型明细

下表是企业最常问到的模型。「—」表示单机 8 卡装不下,需要跨节点。

主流模型明细

主流模型明细

几个值得注意的点:

1. 看总参数,不要看激活参数。 MoE 模型(名字里带 A3B、A10B 这类后缀的)推理时只激活一小部分参数,所以速度快;但全部专家权重都要放进显存。Qwen3.6-35B-A3B 每次只激活 3B,显存却要按 35B 准备。

2. 量化档位决定一半的预算。 同一个 Qwen3.5-397B,INT4 要 2 张 H200,FP8 要 4 张。上线前先确认业务对量化后的精度损失是否可以接受,这比比较卡价更重要。

3. FP4 类格式要看卡的代际。 表中 MXFP4 / NVFP4 这类 4-bit 浮点格式主要面向 Blackwell 架构(B200、RTX 50 系、RTX PRO 6000)。在老一代卡上能否运行、性能如何,要以 vLLM 对具体模型的验证结果为准。

4. 国产卡:昇腾 910C 已有官方验证。 vLLM recipes 中,DeepSeek-V4-Flash(INT8,341 GB)、Qwen3.6-27B、Qwen3-30B-A3B、Kimi-K3 等模型标注了昇腾 910C 的验证记录。有信创要求的项目可以优先从这些模型里选。

三、这些数字是「下限」

表中的卡数只回答「权重装不装得下」,实际部署通常要更多:

  • KV Cache:上下文越长、并发越高,需要的额外显存越多。长文本、高并发场景要在此基础上预留余量。
  • 张量并行的约束:多卡切分通常要求卡数是 2 的幂。算出来 3 张,实际往往要上 4 张。
  • 跨节点通信:超过 8 卡就要跨机器,对网络(IB / RoCE)有要求,成本和运维难度都会明显上升。

四、买卡之前,先算利用率

显存只决定「能不能跑」,「值不值得自己跑」取决于另一个数:利用率。

吞吐估错 30%,自建成本差 30%;利用率从 80% 掉到 10%,自建成本差 8 倍。白天峰值买的算力,夜里空转;而 API 按 token 计费,不用不花钱。很多企业自建亏钱,不是因为卡慢,而是因为卡闲。

建议的判断顺序:

  1. 按上表确定模型和量化档位需要几张卡;
  2. 估算每天的 token 用量;
  3. 用卡的月租(或折旧)加运维开销,算出「自建比调 API 划算」需要的最低利用率;
  4. 评估业务能否长期稳定跑到这个利用率。

第 3 步的计算我们做成了一个在线工具:选模型、量化档位和卡型,输入日均 token 量和卡价,直接给出盈亏平衡利用率,并可以生成链接分享给同事。

工具地址:https://modelsage.cn/self-host

数据来源:vLLM 官方 recipes(显存与硬件验证),整理于 2026 年 9 月 30 日。模型更新较快,以工具页的最新数据为准。

posted @ 2026-10-06 11:20  sc00001  阅读(9)  评论(0)    收藏  举报