开源大模型私有化部署要几张卡?
开源大模型私有化部署要几张卡?195 个模型的显存需求一览(2026 年 9 月)
数据截至 2026 年 9 月 30 日。显存数字取自 vLLM 官方 recipes(recipes.vllm.ai)标注的最低显存, 卡数按「显存装得下」推算。完整数据和测算工具在 https://modelsage.cn/self-host ,每天自动同步。
「DeepSeek 私有化部署要几张卡」「Qwen 本地部署需要多大显存」是企业做大模型落地时最常被问到的问题。网上答案很多,但大多只讲一两个模型,精度口径也不统一:有的按 BF16 算,有的按 INT4 算,同一个模型能差 4 倍。
这篇把 vLLM 官方 recipes 收录的 195 个开源模型整理到同一口径,先给结论,再给明细表。
一、先看分布:九成以上的模型,一台 8 卡机器就够了
按每个模型最省显存的那一档(通常是 INT4 / FP4 量化)统计:

先看分布:九成以上的模型,一台 8 卡机器就够了
8 卡 H200 都装不下的只有 7 个:Kimi-K3、Kimi-K2-Instruct、Qwen3.8-2.4T-A95B、MiMo-V2.5-Pro,以及 inclusionAI 的三款万亿参数模型(Ring-2.6-1T、Ling-2.6-1T、Ring-1T-FP8)。这些必须跨节点部署,工程复杂度是另一个量级。
需要说明:单卡能装下的 86 个里,有相当一部分是 OCR、语音、小尺寸模型。真正的旗舰对话模型,基本都在「单机 8 卡」这一档。
二、主流模型明细
下表是企业最常问到的模型。「—」表示单机 8 卡装不下,需要跨节点。

主流模型明细
几个值得注意的点:
1. 看总参数,不要看激活参数。 MoE 模型(名字里带 A3B、A10B 这类后缀的)推理时只激活一小部分参数,所以速度快;但全部专家权重都要放进显存。Qwen3.6-35B-A3B 每次只激活 3B,显存却要按 35B 准备。
2. 量化档位决定一半的预算。 同一个 Qwen3.5-397B,INT4 要 2 张 H200,FP8 要 4 张。上线前先确认业务对量化后的精度损失是否可以接受,这比比较卡价更重要。
3. FP4 类格式要看卡的代际。 表中 MXFP4 / NVFP4 这类 4-bit 浮点格式主要面向 Blackwell 架构(B200、RTX 50 系、RTX PRO 6000)。在老一代卡上能否运行、性能如何,要以 vLLM 对具体模型的验证结果为准。
4. 国产卡:昇腾 910C 已有官方验证。 vLLM recipes 中,DeepSeek-V4-Flash(INT8,341 GB)、Qwen3.6-27B、Qwen3-30B-A3B、Kimi-K3 等模型标注了昇腾 910C 的验证记录。有信创要求的项目可以优先从这些模型里选。
三、这些数字是「下限」
表中的卡数只回答「权重装不装得下」,实际部署通常要更多:
- KV Cache:上下文越长、并发越高,需要的额外显存越多。长文本、高并发场景要在此基础上预留余量。
- 张量并行的约束:多卡切分通常要求卡数是 2 的幂。算出来 3 张,实际往往要上 4 张。
- 跨节点通信:超过 8 卡就要跨机器,对网络(IB / RoCE)有要求,成本和运维难度都会明显上升。
四、买卡之前,先算利用率
显存只决定「能不能跑」,「值不值得自己跑」取决于另一个数:利用率。
吞吐估错 30%,自建成本差 30%;利用率从 80% 掉到 10%,自建成本差 8 倍。白天峰值买的算力,夜里空转;而 API 按 token 计费,不用不花钱。很多企业自建亏钱,不是因为卡慢,而是因为卡闲。
建议的判断顺序:
- 按上表确定模型和量化档位需要几张卡;
- 估算每天的 token 用量;
- 用卡的月租(或折旧)加运维开销,算出「自建比调 API 划算」需要的最低利用率;
- 评估业务能否长期稳定跑到这个利用率。
第 3 步的计算我们做成了一个在线工具:选模型、量化档位和卡型,输入日均 token 量和卡价,直接给出盈亏平衡利用率,并可以生成链接分享给同事。
工具地址:https://modelsage.cn/self-host
数据来源:vLLM 官方 recipes(显存与硬件验证),整理于 2026 年 9 月 30 日。模型更新较快,以工具页的最新数据为准。

浙公网安备 33010602011771号