文章时间:2026年8月9日
覆盖范围:卡的类型、算力规格、国内外采购限制、费用情况、国内选型建议
数据时效:重点覆盖 2026年2月—8月 的最新动态
数据来源:NVIDIA 官网、公开媒体报道(路透社、环球时报、第一财经等)、渠道报价(京东/算力租赁平台)、行业分析机构
一、核心结论速览
| 维度 |
2026年8月现状 |
| 最先进在售卡 |
B300(Blackwell Ultra,288GB HBM3e),Rubin 已发布将于 2026 下半年交付 |
| 中国合规可买的英伟达卡 |
H20(¥9万~12万/卡)、B30(新特供,约 $6,500~8,000)、H200(2026年1月起获准逐案出口,但条件严苛,截至年中尚无实质采购);另:RTX PRO 工作站全家族(4000~6000)不受管制、国内随便买 |
| 采购管制 |
出口管制层层加码:H200 需"逐案审查";2026年5月起连中企境外子公司绕道采购也被堵 |
| 价格区间(单卡) |
H100 $2.5万~4万;H200 $3万~4万;B200 $4万~4.5万;B300 整机为主;国内 H20 ¥9万~12万 |
| 国内企业现实选择 |
合规首选 H20/B30;国产化选昇腾 910C/910D;<50卡/年用量建议直接租云算力,比自购省 30%~45% |
二、卡的类型:英伟达算力卡全景
英伟达算力产品线按代际架构和市场定位两条线划分。截至 2026 年年中,主流在售/在研架构为:
代际路线图:Ampere(2020)→ Hopper(2022)→ Blackwell(2024)→ Blackwell Ultra(2025)→ Rubin(2026)→ Rubin Ultra(2027)→ Feynman(2028)
2.1 按市场定位分类
| 产品线 |
定位 |
代表型号 |
| 数据中心加速卡 |
AI 训练/推理主力,SXM/PCIe 形态 |
H100、H200、B200、B300、GB200/GB300 NVL72 |
| 中国特供版 |
为符合出口管制专门设计(降算力/换显存) |
H20、B30 |
| 专业工作站卡 |
桌面/工作站 AI 与图形,不受出口管制 |
RTX PRO 4000/4500/5000/6000 Blackwell 全家族(含 Max-Q、Server 版) |
| 消费级游戏卡 |
个人 AI、图形渲染 |
RTX 50 系列(RTX 5090/5080/5070) |
| 超算整柜 |
机架级一体化算力 |
GB200 NVL72、GB300 NVL72、Vera Rubin NVL72 |
2.2 各代际代表型号速览
- H100(Hopper,2022):上一代 AI 训练主力,"大模型时代的发动机"。2023—2025 年几乎所有主流大模型(GPT-4、Llama、DeepSeek 等)训练都用它。
- H200(Hopper 升级,2024):H100 同款算力核心,显存从 80GB 升级到 141GB HBM3e,专为长上下文、大模型推理优化。
- H20(中国特供,2024):为绕开出口管制而生,算力砍到 H100 的约 1/6,但保留了 96GB 大显存和 NVLink 高带宽。
- B200(Blackwell,2024):全新架构,首次原生支持 FP4 精度,算力较 Hopper 提升数倍。
- B300 / Blackwell Ultra(2025):B200 的显存与算力双升级版,288GB 显存是当前单卡最高,配套 GB300 NVL72 整柜方案。
- B30(中国特供,2025底出货):基于 Blackwell 架构,改用 GDDR7 显存以满足出口合规,价格远低于 H20。
- Vera Rubin(2026年3月发布):下一代平台,HBM4 显存、FP4 推理算力 50 PFLOPS(Blackwell 的 5 倍),2026 下半年起交付。
- RTX PRO Blackwell 系列(2025):专业工作站卡,96GB 超大显存(RTX PRO 6000)跑本地大模型推理/微调,不受出口管制,国内京东可直接购买。
- RTX 50 系列(2025):消费级,RTX 5090 为旗舰(32GB GDDR7),个人开发者/小团队 AI 首选。
三、算力情况:各卡详细规格
说明:数据中心卡采用 稀疏(sparse)峰值算力 标注更常见,表中同时给出部分型号的稠密值;实际部署中算力还受显存带宽、互联、软件栈影响。
3.1 数据中心卡规格对比
| 型号 |
架构 |
显存 |
显存带宽 |
FP16/BF16 算力 |
FP8 算力 |
FP4 算力 |
功耗 |
发布时间 |
| H100 SXM |
Hopper |
80GB HBM3 |
3.35 TB/s |
989 TFLOPS(稀疏) |
1,979 TFLOPS |
— |
700W |
2022 |
| H200 SXM |
Hopper |
141GB HBM3e |
4.8 TB/s |
989 TFLOPS(稀疏) |
1,979 TFLOPS |
— |
700W |
2024 |
| H20(特供) |
Hopper |
96GB HBM3 |
4.0 TB/s |
约 148 TFLOPS |
约 296 TFLOPS |
— |
400W |
2024 |
| B200 SXM |
Blackwell |
192GB HBM3e |
8.0 TB/s |
2,250 TFLOPS |
5 PFLOPS(稠密) |
10 PFLOPS(稠密) |
1,000W |
2024 |
| B300 SXM |
Blackwell Ultra |
288GB HBM3e |
8.0 TB/s |
2,250 TFLOPS |
5 PFLOPS(稠密) |
15 PFLOPS(稠密)/20(稀疏) |
最高 1,400W |
2025 |
| B30(特供) |
Blackwell |
GDDR7(容量未完全公开,约 180GB 级) |
低于 B300 |
约为 H20 的 75%~90% |
— |
支持 |
约 700W |
2025 Q4 出货 |
关键解读:
- B300 是当前单卡算力与显存之王:288GB HBM3e 可单卡容纳 200B+ 稠密模型(FP8),万亿参数 MoE 模型仅需一个 8 卡节点即可跑。推理 token 成本较 Hopper 时代降低约 35 倍(SemiAnalysis 2026 Q1 基准)。
- H200 vs H100:算力完全一样(同一个核心),H200 的 141GB 显存让长上下文推理、大模型训练受益明显,是"显存即正义"的典型。
- H20 算力被刻意阉割:FP16 仅约 H100 的 15%,但保留 96GB 显存——设计意图就是"能跑大模型推理、不能高效训练",主要满足国内推理市场。
- B30 走"低算力高性价比"路线:性能约为 H20 的 75%~90%,但价格低 30%~40%,能效比 H20 高约 30%,专为国内推理市场设计。
3.2 整柜超算方案
| 方案 |
组成 |
总算力 |
显存总量 |
互联 |
功耗 |
| GB200 NVL72 |
72×B200 + 36×Grace CPU |
FP4 约 1.4 EFLOPS |
13.8TB |
NVLink 5 域 |
约 120kW |
| GB300 NVL72 |
72×B300 + 36×Grace CPU |
FP4 约 1.5×GB200 |
20.7TB |
NVLink 5 Ultra |
约 140kW |
| Vera Rubin NVL72 |
72×Rubin GPU |
FP4 约 3.6 EFLOPS |
20.7TB HBM4 |
NVLink 6(260TB/s) |
液冷 |
3.3 专业工作站卡:RTX PRO Blackwell 全家族
RTX PRO Blackwell 系列是英伟达 2025 年发布的专业工作站卡,采用与数据中心 B200 相同的 Blackwell 架构(第五代 Tensor Core,支持 FP4),不受美国出口管制、国内可直接购买,是本地跑大模型推理/微调、数据科学、专业图形的主力选择。全家族分 Workstation(桌面工作站)、Max-Q(低功耗)、Server(服务器) 三种形态。
| 型号 |
显存 |
显存带宽 |
CUDA 核心 |
AI 算力(FP4) |
FP32 算力 |
功耗 |
形态 |
定位 |
| RTX PRO 6000 Blackwell |
96GB GDDR7 ECC |
1,792 GB/s |
24,064 |
4,000 TOPS |
110 TFLOPS |
600W |
2-slot 主动 |
旗舰:本地跑 70B+ 量化模型、大规模 AI 开发 |
| RTX PRO 6000 Blackwell Max-Q |
96GB GDDR7 ECC |
1,792 GB/s |
24,064 |
3,511 TOPS(稀疏) |
110 TFLOPS |
300W |
2-slot 主动 |
低功耗旗舰:可 4 卡并装一台工作站 |
| RTX PRO 6000 Blackwell Server |
96GB GDDR7 ECC |
1,597 GB/s |
24,064 |
4,000 TOPS |
110 TFLOPS |
600W |
2-slot 被动 |
服务器形态:机架内多卡部署 |
| RTX PRO 5000 Blackwell |
72GB(可选48GB)GDDR7 ECC |
1,344 GB/s |
14,080 |
2,064 TOPS |
65 TFLOPS |
300W |
2-slot 涡轮 |
均衡之选:AI 计算+专业可视化兼顾 |
| RTX PRO 4500 Blackwell |
32GB GDDR7 ECC |
896 GB/s |
10,496 |
1,617 TOPS |
51 TFLOPS |
200W |
2-slot 主动 |
中端:本地 LLM 微调、8K 后期 |
| RTX PRO 4000 Blackwell |
24GB GDDR7 ECC |
672 GB/s |
8,960 |
1,178 TOPS |
37 TFLOPS |
140W |
1-slot 主动 |
入门:紧凑工作站、CAD/CAM |
| RTX PRO 2000 Blackwell |
16GB GDDR7 ECC |
448 GB/s |
— |
— |
— |
70W |
1-slot |
低端专业入门 |
关键解读:
- RTX PRO 6000(96GB)是"桌面版 B200":显存容量与 B200 数据中心卡同级(96GB vs 192GB),单卡即可在桌面加载 70B~100B 参数的量化大模型做推理/微调,无需服务器机架。
- Max-Q 版(300W) 与标准版同显存同核心,通过降功耗换来静音、低散热要求,支持一台工作站插 4 卡(MIG 最多 4 实例),适合多卡并行的本地 AI 开发。
- Server 版为被动散热、机架部署设计,带宽略降(1,597 GB/s),面向小型机架式 AI 服务器。
- RTX PRO 5000(72GB) 是"显存与预算的平衡点",性能约为 6000 的一半,价格也约为一半,是性价比最高的本地大模型卡。
- 全部支持 ECC 显存纠错、PCIe 5.0、CUDA 12.8+,可直接复用数据中心 CUDA 生态,无迁移成本。
3.4 消费级游戏卡
| 型号 |
架构 |
显存 |
AI 算力 |
功耗 |
国内参考价 |
| RTX 5090 |
Blackwell |
32GB GDDR7 |
约 3,300 AI TOPS |
575W |
¥2.8万~3.4万 |
| RTX 5080 |
Blackwell |
16GB GDDR7 |
约 1,800 AI TOPS |
360W |
¥8,000~1万 |
| RTX 5070 |
Blackwell |
12GB GDDR7 |
— |
250W |
¥4,599 起 |
| RTX 4090(上代) |
Ada Lovelace |
24GB GDDR6X |
1,321 AI TOPS |
450W |
¥1.3万~2.2万 |
四、采购限制:出口管制时间线与现状(截至 2026年8月)
4.1 管制政策时间线
| 时间 |
事件 |
影响 |
| 2022年10月 |
美国首轮芯片管制:A100/H100 禁售中国 |
催生 A800/H800 特供版 |
| 2023年10月 |
管制升级:连特供版也禁售 |
英伟达推出 H20 特供版应对 |
| 2025年4月9日 |
BIS 通知:H20 对华出口需许可证,无限期有效 |
英伟达计提 45~55 亿美元费用,H20 一度停供 |
| 2025年7月15日 |
黄仁勋在北京宣布 H20 恢复对华销售(许可证获批) |
2025 下半年恢复出货约 40 万颗 |
| 2025年12月 |
特朗普批准 H200 对华出口(附加条件:25% 销售收入上缴、安全审查) |
H200 解禁信号 |
| 2026年1月13日 |
BIS 最终规则:H200/MI325X 等从"推定拒绝"改为"逐案审查"(要求 TPP<21,000、DRAM 带宽<6,500GB/s 等);同日美国众议院通过《远程访问安全法案》(限制对中企提供云算力) |
H200 技术性放行 |
| 2026年1月15日 |
新规生效:第三方测试审核、中国采购量不超过美国客户 50%、禁军用、需安全措施证明 |
条件极其严苛 |
| 2026年3月18日 |
GTC 上黄仁勋宣布已获中国客户 H200 订单、重启 H200 生产(传每家中国企上限 7.5 万颗、总出货限 100 万颗) |
重大转折信号 |
| 2026年5月31日 |
BIS 新指引:总部在中国或澳门的企业,其境外子公司采购先进芯片同样需许可证——堵住"绕道第三国采购"漏洞 |
数年中资海外子公司采购通道被切断 |
| 2026年3月~8月 |
美国酝酿"全球 AI 芯片许可制"(<1000 颗简化审批,>20 万颗需买方政府参与审批);《MATCH 法案》等立法推进 |
管制从"对华"走向"全球分级" |
4.2 当前(2026年8月)各卡对华状态
| 型号 |
对华状态 |
说明 |
| H100 / A100 / B200 / B300 / GB系列 |
❌ 禁售 |
处于先进算力管制清单(ECCN 3A090.a/b),推定拒绝 |
| H20 |
✅ 可售(需许可,已获批) |
2025年7月起恢复,国内可正常合规采购 |
| H200 |
⚠️ 技术性放行(逐案审查) |
2026年1月新规允许,但条件严苛:第三方测试、不超美客户量50%、25%收入上缴;截至2026年年中中国买家尚未实质采购 |
| B30(特供) |
✅ 可售 |
为合规设计(GDDR7 显存、低算力),2025 Q4 起出货 |
| RTX 50 系列消费卡 |
✅ 可售 |
消费级不在先进算力管制清单,国内正常流通(但存在涨价) |
| RTX PRO 全家族(4000/4500/5000/6000) |
✅ 可售 |
工作站/专业卡不受先进算力管制,国内京东/丽台等渠道正常在售 |
⚠️ 重要提示:政策变动极快,2026年以来几乎每月都有新规(RASA 云服务限制、《AI 监控法案》、MATCH 法案等)。采购前务必以美国 BIS 最新公告为准,并咨询专业合规顾问。云服务层面也在收紧——《远程访问安全法案》限制美企向中企提供先进算力云服务,海外云训练也面临合规风险。
五、费用情况
5.1 单卡购买价格(2026年,含渠道溢价)
| 型号 |
海外参考价(美元) |
国内渠道价(人民币) |
备注 |
| H100 SXM |
$3.0万~4万 |
¥18万~35万 |
海外 PCIe 版约 $2.5万~2.8万 |
| H200 |
$3.0万~4万 |
¥25万~45万 |
国内现货紧张 |
| B200 |
$4.0万~4.5万 |
¥35万~60万+ |
供应受限,溢价高 |
| B300 |
整机为主(8卡约 $55万) |
国内整机约 ¥700万/台 |
单卡不零售 |
| H20(合规) |
$1.0万~1.2万 |
¥9万~12万 |
2026年Q1约9-10万,Q2 10-12万 |
| B30(合规) |
$6,500~8,000 |
约 ¥5万~6万起步(8卡整机 ¥140万~160万) |
2025Q4 起出货,备货量预计120万颗 |
| RTX 5090 |
官方 $1,999,实际 $4,000+ |
¥2.8万~3.4万 |
2026年7月部分型号涨价20-30% |
| RTX PRO 6000 Blackwell |
$13,399~15,000 |
¥6万~15万 |
96G 工作站版约 ¥6万~9万;96G 服务器版约 ¥15万;京东在售 |
| RTX PRO 6000 Blackwell Max-Q |
约 $20,000 |
约 ¥13万~15万(渠道询价) |
300W 低功耗版,价格与标准版接近 |
| RTX PRO 5000 Blackwell |
$6,400~8,700(72G) |
¥5.5万~6.5万(72G);48G 约 ¥5万 |
京东自营 72G 常卖 ¥58,699,历史低 ¥54,999 |
| RTX PRO 4500 Blackwell |
$3,000~4,200 |
约 ¥2.5万~3万(渠道询价) |
Newegg PNY 版 $3,446 起 |
| RTX PRO 4000 Blackwell |
$2,200~2,500 |
¥1.4万~1.5万 |
京东丽台自营 24G 常卖 ¥14,199~15,039 |
| 昇腾 910C(国产) |
— |
¥6万~8万 |
8卡服务器 ¥110万~120万 |
5.2 整柜价格
| 方案 |
海外价格 |
| GB200 NVL72(72卡整柜) |
约 $200万~340万 |
| GB300 NVL72(72卡整柜) |
约 $370万~400万 |
5.3 云上/租赁价格
海外(美元/卡时,2026年中):
| 型号 |
按需价格范围 |
中位数/典型 |
| H100 |
$1.03 ~ $12.29 |
约 $2.29 |
| H200 |
$1.45 ~ $13.78 |
— |
| B200 |
$3.75 ~ $9.86 |
— |
| B300 |
$6.94 ~ $9.16 |
— |
| GB200 NVL72 整柜 |
$756 ~ $1,944/小时(整柜) |
— |
国内(人民币,2026年2月→7月,整体降价 8%~17%):
| 型号 |
2026年7月时租价 |
月租参考 |
备注 |
| RTX 4090(容器) |
¥1.96/时 |
约 ¥1,341/月 |
性价比首选 |
| H20(容器) |
¥6.20/时 |
约 ¥3,571/月 |
2026年2月曾达 ¥7-8/时 |
| 昇腾 910B(容器) |
¥3.58/时 |
约 ¥2,397/月 |
国产化需求 |
| H100(8卡裸金属) |
— |
¥84,480/月 |
2026年4月 ¥92,000 → 7月降价8% |
| H200 |
¥7.5~8.0/时 |
¥6.0万~6.6万/月 |
2026年2月报价,涨幅25-30%,排期至2027年Q2 |
| 阿里云 H20 8卡实例 |
¥120/时 |
约 ¥8.6万/月(按量) |
包年约省60% |
💡 趋势判断:①高端卡(H100/H200)因订单排期至 2027 年,现货紧缺、价格坚挺甚至上涨;②国产卡(昇腾)产能爬坡 + 新特供卡(H20/B30)入局,2026年下半年租赁价格大概率继续下行;③消费级(40系/50系)受 2026年7月 渠道涨价影响,价格有所上浮。
六、国内如何选英伟达算力卡:分场景选型指南
6.1 先看清现实约束(合规红线)
- 可以买:H20、B30(特供合规版)——官方渠道可正常采购;
- 理论上可买但几乎买不到:H200(需美国逐案许可 + 第三方测试 + 上限约束,截至2026年年中中国市场无实质成交);
- 买不到(禁止):H100、B200、B300、GB200/GB300、Vera Rubin;
- 不受限:消费级 RTX 50 系列、专业工作站 RTX PRO 4000/4500/5000/6000 全家族(含 Max-Q、Server 版)——无出口管制,京东/丽台等渠道现货充足(数据中心级大规模部署不在此列,机架级部署需走服务器渠道)。
6.2 按场景推荐
| 场景 |
推荐方案 |
参考预算 |
理由 |
| 个人开发 / 小团队微调(7B-32B 模型) |
RTX 4090 ×1~2 / RTX 5090 |
¥1.3万~7万 |
24/32GB 显存够用,无需服务器机架,CUDA 生态完善 |
| 工作室 / 中等规模推理(30B-70B 本地推理) |
RTX PRO 5000(72GB) |
¥5.5万~6.5万/卡 |
单卡 72GB 可跑 70B 量化模型,300W 功耗工作站可承受 |
| 本地大模型开发 / 数据科学(70B+ 本地微调) |
RTX PRO 6000(96GB) 或 Max-Q 多卡 |
¥6万~15万/卡 |
96GB 显存单卡跑 70B-100B 量化模型,Max-Q 版 300W 可 4 卡并装 |
| 企业大模型推理(合规优先) |
H20(96GB) 或 B30 |
卡 ¥9万~12万 / ¥5万~6万 |
国内唯一合规的数据中心级英伟达卡;B30 更便宜、能效更高 |
| 企业训练/微调 70B+(合规优先) |
H20 8卡节点 + NVLink |
整机约 ¥100万~150万 |
96GB 大显存可容纳更大 batch;算力虽弱但稳定合规 |
| 小型机架式 AI 服务器 |
RTX PRO 6000 Server 版 或 RTX PRO 5000 多卡 |
2卡约 ¥30万 |
被动散热、机架部署,无需数据中心级供电(600W/卡) |
| 前沿大模型训练(有海外部署条件) |
H200 / B200 / B300(海外机房) |
卡 $3万~4.5万 |
只能在海外部署,注意 RASA 云服务限制带来的合规风险 |
| 国产化替代(政策/安全要求) |
昇腾 910C/910D、寒武纪、海光 |
910C 单卡 ¥6万~8万 |
政企、运营商、金融场景中标主力;2026年产能已趋于稳定 |
6.3 买卡 vs 租算力(关键决策)
核心判断标准:年用卡量 <50 张卡 → 建议租,别买。 算力租赁平台测算,按需租用总成本(含运维/机房/电力)比自购低 30%~45%。
| 维度 |
自购 |
租赁 |
| 前期投入 |
H20 单卡 ¥10万+,8卡节点 ¥100万+ |
无(按小时/按月) |
| 灵活性 |
差,锁死硬件 |
好,随需求伸缩 |
| 适合场景 |
年利用率 >70% 的持续训练 |
波动需求、测试、推理起步 |
| 当前行情 |
高端卡排期至2027年 |
2026下半年价格下行,H20 已降至 ¥6.2/时 |
6.4 采购路径建议
- 合规特供卡(H20/B30):通过英伟达中国认证渠道商、主流云厂商(阿里云、腾讯云、火山引擎)或整机厂商(浪潮、新华三、宁畅等)采购,务必要求完整授权链路与合规文件;
- 消费/工作站卡:京东自营、官方渠道即可——RTX PRO 4000(丽台自营约 ¥1.4万)、RTX PRO 5000 72GB(京东自营约 ¥5.9万)、RTX PRO 6000(¥6万~15万);这类卡无出口管制限制,现货充足;
- 租赁:阿里云、腾讯云、火山引擎等公有云;或极智算(jygpu)等算力聚合平台比价;
- 警惕:市面上"水货 H100/B200"多经灰色渠道流入,存在海关扣押、无法质保、以及违反美国出口管制法律的风险(2026年5月后绕道采购亦被堵),企业采购需谨慎评估法律风险。
七、国产替代与市场格局(参考维度)
- 华为昇腾 910C/910D:2026年已规模交付政企/运营商渠道,8卡服务器 ¥110万~120万,性能对标 H100 的 60%~80%,生态(MindSpore/CANN)逐步成熟,是国产化首选;
- 寒武纪思元、海光深算、摩尔线程:单卡 ¥3万~5万,主打中小模型推理,性价比突出;
- AMD MI300X/MI325X:海外市场对英伟达的主要竞争者,国内因 ROCm 生态适配成本高,主要被头部大厂采用(整机 ¥120万~130万);
- 格局判断:黄仁勋 2026年 公开承认"美国出口限制正把中国市场让给中国公司"。据行业统计,英伟达数据中心业务 FY2027 Q1 收入 $752亿(同比+92%),但中国大陆贡献占比已大幅下滑;国产卡在推理侧快速渗透,训练侧仍以英伟达特供卡为主。
八、风险提示与免责声明
- 政策风险极高:2026年以来美国对华芯片政策"月月有变"(H200 解禁、境外子公司堵漏、全球许可制酝酿、MATCH 法案等),本报告政策部分为 2026年8月9日 时点判断,采购决策前务必核实最新法规;
- 价格波动大:渠道价格受供需、关税、汇率影响,上下浮动可达 20%~30%;
- 数据来源:本文价格/规格数据综合 NVIDIA 官网、路透社/环球时报/第一财经等媒体报道及公开渠道报价,仅供参考,不构成采购建议;
- 合规:涉及美国出口管制(EAR 3A090 等)的产品采购,建议咨询专业出口管制律师。