【大模型技术落地实践】2 - 国产加速设备选型
背景
多方面因素导致国产设备将会是未来大模型在各种组织内落地的主流
国产 AI 芯片厂商及主要产品
| 厂商名称 | 主流产品 | 核心参数 | 应用场景与市场情况 |
|---|---|---|---|
| 华为 (Huawei) | 昇腾 (Ascend) 910B | 工艺: 7nm 算力: FP16/ BF16 256 TFLOPS 显存: 64GB HBM2e, 带宽 1.6TB/s |
场景: 千亿级大模型预训练、微调;数据中心大规模分布式训练;自动驾驶、科学计算。 市场: 国产 AI 芯片“带头大哥”,技术实力雄厚,拥有全栈生态(CANN+MindSpore),市场份额领先。 |
| 昇腾 (Ascend) 910C | 工艺: 7nm (Chiplet) 算力: FP16/BF16 约 800 TFLOPS 显存: 128GB HBM3, 带宽 3.2TB/s, 互联带宽 784GB/s 功耗: 约 400W |
场景: 千亿/万亿级大模型预训练与微调;华为 CloudMatrix 384 超节点集群;直接对标 NVIDIA H100。 市场: 2025 年已规模量产和部署,是国产高端算力替代的核心产品。 |
|
| 昇腾 (Ascend) 950 (分 950PR 与 950DT) |
工艺: 7nm 算力: FP8:1P; FP4:2P 显存: 128GB/144GB, 带宽 16TB/s 与 /4TB/s 互联带宽: 2TB/s 功耗: 约 600W+ |
场景: 950PR 版用于大模型推理、多模态生成、长文本处理;950DT 用于万亿参数模型训练,4TB/s 带宽解决 Decode 瓶颈,稀疏激活场景效率提升 40%+。 市场: 950PR 已经用于 DeepSeek V4 推理,预计 2026 第四季度量产 950DT 进行模型训练。 |
|
| 平头哥 (T-Head) | 真武 (Zhenwu) 810E (PPU) | 特点: 自研并行计算架构 显存: 96GB HBM2e 互联: 片间互联带宽 700GB/s |
场景: AI 训练、AI 推理、自动驾驶。已在阿里云部署多个万卡集群。 市场: 阿里云旗下,性能被指超越 A800,与 H20 相当,已服务国家电网、小鹏汽车等 400 多家客户。 |
| 昆仑芯 (Kunlunxin) | 昆仑芯 P800 | 工艺: XPU-R 架构 算力: FP16 345 TFLOPS (稠密) 显存: 96GB HBM2e, 互联带宽约 200GB/s |
场景: 大模型微调与推理,特别适合高吞吐推理场景;多模态模型。 市场: 百度旗下,2024 年中国加速芯片市场出货量位居国产第二。已成功点亮 3.2 万卡集群,单机 8 卡即可高效运行满血版 DeepSeek 模型。 |
| 寒武纪 (Cambricon) | 思元 (Siyuan) 590 (MLU590) | 工艺: 7nm+ Chiplet 算力: FP16 约 314 TFLOPS, 整体性能约为 A100 的 80% |
场景: 云端 AI 训练与推理,是国产高端算力替代的重要方案之一。 市场: 已与 DeepSeek 等头部模型公司深度合作,实现“发布即适配”,2025 年市值一度超越茅台,营收增长迅猛。 |
| 思元 (Siyuan) 370 (MLU370-X8) | 工艺: 7nm 算力: INT8 256 TOPS, FP16 96 TFLOPS 显存: 48GB LPDDR5, 带宽 614.4 GB/s |
场景: 中大模型规模微调;高密度推理集群;多模态 AI 任务,在政务、金融领域规模落地。 市场: 采用双芯 Chiplet 设计,兼顾训练与推理,产品线齐全,商用落地案例丰富。 |
|
| 海光信息 (Hygon) | 深算 (Deep Computing) 二号 (DCU Z210) | 工艺: 7nm 算力: FP16 Tensor 200 TFLOPS, INT8 400 TOPS 显存: 64GB HBM2 |
场景: 适合科学计算与 AI 融合场景;为习惯 CUDA 生态的开发者提供便捷的国产替代方案。 市场: 采用 GPGPU 路线,兼容“类 CUDA”生态环境,代码迁移成本低,在金融、电信等行业广泛应用。 |
| 沐曦 (MetaX) | 曦云 (Xiyun) C600 | 工艺: 12nm 特点: 144GB HBM3e 显存及 3.35TB/s 显存带宽,支持 MetaXLink 超节点扩展 生态: 自研 MXMAC 软件栈,无缝兼容 PyTorch/TensorFlow |
场景: AI 训练与推理;高性能数据分析;科学计算;智算中心。 市场: 核心团队来自 AMD,已成功商业化落地并启动 IPO。在 Kimi-K2 等大模型上实现规模化部署。 |
| 燧原科技 (Enflame) | 云燧 (Yunsui) T21 | 工艺: 7nm 算力: FP16 128 TFLOPS, INT8 256 TOPS 显存: 32GB HBM2E, 带宽 1.6TB/s |
场景: 中大规模型预训练 / 微调;数据中心 AI 训练;在泛互联网、智算中心、智慧城市等场景应用。 市场: 专注云端 AI 算力产品,发布了基于国产 AI 芯片的文生图 MaaS 平台“燧原模图”。 |
| 摩尔线程 (Moore Threads) | MTT S5500 | 工艺: 第四代“平湖”架构 算力: 单卡 AI 稠密算力 FP8 精度下最高 1000 TFLOPS 显存: 80GB, 带宽 1.6TB/s, 互联带宽 784GB/s |
场景: 大模型训练与推理;智算中心千卡 / 万卡集群部署;云渲染、数字孪生等多元场景。 市场: 国产全功能 GPU 领军企业,已构建万卡级智算集群,2025 年登陆科创板,商业化进程提速。 |
| 壁仞科技 | BR106、BR166 | 工艺: BR106 采用 7nm 成熟工艺与自研 BIREN 训推一体架构,规模商用主力芯片,适配全场景 AI 计算。 特色: BR166 采用先进 2.5D Chiplet 芯粒封装,集成两颗 BR106 计算晶粒,晶粒间双向互联带宽高达 896GB/s,算力、显存、编解码能力较 BR106 实现翻倍。 |
场景: 大模型训练与推理;支撑千卡、万卡级智算中心集群部署,同时可覆盖云端高性能计算、智能视频解析、行业算力赋能等多元场景。 市场: 壁仞科技为港股国产 GPU 第一股,是国内少数具备高端通用 GPGPU 全自主研发与规模量产能力的领军企业。公司依托自研 BIRENSUPA 全栈软件生态,兼容主流 AI 开发框架,大幅降低行业迁移适配成本。 |
| 清微智能 | 云端旗舰 TX81 与边缘量产 TX5 系列 | 创新: 搭载 TSM-LINK 算力网格直连技术,无需依赖高端先进制程,即可实现高效 AI 计算,原生支持万亿参数大模型部署。 算力: X81 单芯片 FP16 稠密算力可达 512 TFLOPS,搭载该芯片的 REX 1032 整机集群算力可达 4 PFLOPS。 |
市场: 截至 2026 年 5 月,公司可重构芯片累计出货量超 3000 万颗,全国部署 AI 加速卡超 3 万张,稳居国产 GPU 非算力第一梯队。覆盖大模型训练与全量推理场景,可稳定适配 DeepSeek 等主流开源大模型,支持千亿、万亿级参数模型部署、微调与常态化在线推理,综合推理能效优异,广泛用于千卡、万卡级国产智算中心集群建设。 |
本人文章禁止转载,博客地址:https://www.cnblogs.com/lijiext

浙公网安备 33010602011771号