引言

2026 年 7 月 17 日 20:00,砺算首款面向普通消费者的全自研独立显卡 LX-7G100 在京东自营开售,零售定价 2688 元。相比此前 3299 元的创始限量版(两批均快速售罄、二手炒至 4000 元以上),零售版直降 611 元,首次把"全自研国产 GPU"拉进了 2500~3000 元的主流消费区间。

但价格只是表层。真正值得拆解的是:在硬件规格纸面相当亮眼(192 组纹理单元 / 96 组光栅化单元 / 12GB 192bit GDDR6)的前提下,实测综合性能却约为 RTX 3060 的 三分之二。这中间的差距,正是国产 GPU 在架构效率、驱动成熟度、软件生态三个维度上需要补课的真实写照。

本文不写新闻摘要,仅从 TrueGPU 天图架构、硬件规格、软件生态、超分技术、性价比、散热设计、赛道全景七个维度做纯技术拆解,并对购买决策给出工程化建议。


1. TrueGPU 天图架构技术解析

1.1 全自研的技术意义

判断一款"国产 GPU"的含金量,第一件事不是看跑分,而是看它的 ISA(指令集架构)和 RTL(寄存器传输级)代码来源。当前国内"国产 GPU"大致分为三类:

国产 GPU 三种技术来源:

┌─────────────────────────────────────────────────────────────┐
│ 类型 A:IP 授权组装                                          │
│  购买 Imagination PowerVR / ARM Mali / Verisilicon Vivante  │
│  的现成 GPU IP 核,集成进自研 SoC                            │
│  → 微架构、指令集、编译器后端均受限于授权方                   │
│  → 代表:部分信创 SoC 内的集成 GPU                           │
├─────────────────────────────────────────────────────────────┤
│ 类型 B:架构授权 + 二次开发                                  │
│  获得某家 GPU 公司的微架构授权,在其基础上修改                │
│  → 可定制部分单元,但核心 ISA 与原架构绑定                   │
│  → 授权到期 / 出口管制时存在断供风险                         │
├─────────────────────────────────────────────────────────────┤
│ 类型 C:全自研(砺算 TrueGPU 路线)                          │
│  从计算核心、专属指令集到底层软件驱动均独立设计               │
│  → 不使用任何海外第三方 GPU IP                               │
│  → 微架构、ISA、编译器、驱动全栈自有                         │
└─────────────────────────────────────────────────────────────┘

砺算 LX-7G100 属于类型 C,其技术意义可以拆为三层:

第一层:规避授权断供风险。 历史上 Imagination 曾因华为被列入实体清单而短暂中断授权(后恢复),ARM 在出口管制下也存在授权审查。全自研 ISA 意味着无论外部环境如何变化,砺算都不会因为"授权方一纸函件"而无法继续设计下一代产品。这对一个要做长期迭代的 GPU 公司是生死线。

第二层:获得架构演进的主导权。 购买 IP 核的厂商,其架构路线图被授权方锁定——授权方下一代 PowerVR / Mali 是什么形态,你只能跟随。而砺算可以按自己对中国市场需求的理解(例如对国产 AI 推理负载、信创办公场景的侧重)来规划架构演进,不必为授权方的全球产品节奏买单。

第三层:与 Intel / AMD / NVIDIA 架构的本质独立。 TrueGPU 不属于 x86 阵营的 Gen/Xe 系,不属于 AMD 的 GCN/RDNA 系,也不属于 NVIDIA 的 Tesla/Maxwell/Turing/Ampere/Ada 系。这意味着它的寄存器分配模型、Warp/Wavefront 调度策略、内存一致性模型都是独立设计的,没有"兼容某家历史包袱"的约束,也没有"必须沿用某家 ABI"的束缚。代价是——所有围绕这套 ISA 的编译器、驱动、调试工具都要从零造起。

1.2 架构推测与技术特征

公开信息给出的硬约束是:台积电 6nm、192 组纹理单元(TMU)、96 组光栅化单元(ROP)、12GB GDDR6 192bit、PCIe 4.0 x16。基于这些约束,可以对天图架构做如下推测。

6nm 制程的定位

台积电 6nm(N6)是 N7 的 EUV 光学收缩版本,与 N7 设计规则兼容,逻辑密度提升约 18%,功耗降低约 8%。它在成本、良率、产能三个维度上是当前国产 GPU 最务实的落点:

维度 N6 (6nm) N5 (5nm) N4 (4nm)
EUV
相对 N7 密度 +18% +80% +100%+
成熟度 高,量产多年
流片成本
产能可得性 充足 受限 受限

N6 不追求极致密度,但能让砺算在合理的流片成本下塞入足够的计算单元,同时规避先进制程的产能与地缘风险。AMD RDNA2 的 Navi 23(RX 6600)、联发科天玑系列均采用 N6,是一条被充分验证过的工艺线。

192 TMU + 96 ROP 配置分析

这是 LX-7G100 最"反直觉"的参数。把纸面规格与同价位对手放在一起:

纹理 / 光栅单元纸面对比:

                 TMU    ROP    显存位宽    显存
砺算 LX-7G100    192    96     192bit     12GB GDDR6
RTX 3060         112    48     192bit     12GB GDDR6   (GA106, 28 SM)
RX 6600          112    64     128bit     8GB GDDR6    (Navi 23, 28 CU)
Arc A750         224    64     256bit     8GB GDDR6    (ACM-G10, 28 Xe Core)

仅看 TMU/ROP,LX-7G100 的纹理填充率与像素填充率纸面值甚至高于 RTX 3060 一倍左右。但实测综合性能却只有 RTX 3060 的 2/3。这个"纸面强、实测弱"的反差,恰恰是理解 GPU 性能构成的关键——TMU 和 ROP 只是渲染管线的末端单元,真正决定性能的是更上游的 SM/CU 数量、时钟频率、架构 IPC、以及把三角形喂给光栅器的几何处理能力。

与主流 GPU 架构对比

维度 砺算 TrueGPU NVIDIA Ada Lovelace AMD RDNA3 Intel Xe HPG
制程 6nm 4nm (TSMC 4N) 5nm + 6nm 芯粒 6nm
调度模型 自研 SIMT SIMT + Warp Scheduler Wavefront (32) SIMT + Xe Vector/SIMD
矩阵加速 未公开 第 4 代 Tensor AI 加速器 (XDNA 风格) XMX 矩阵引擎
光追单元 未公开 第 3 代 RT Core 第 2 代 RT Core 第 1 代 RT Unit
显存接口 192bit GDDR6 128~384bit GDDR6X/LPDDR 96~256bit GDDR6 256bit GDDR6
编译器后端 自研 PTX/SASS GCN/RDNA ISA VISA

可以看到,TrueGPU 在制程上落后 Ada 一代(6nm vs 4nm),在矩阵加速、光追单元等关键模块的公开度上仍处于早期。这也解释了为何它"画质光栅基础能力不弱,但 AI 加速与光追暂未形成竞争力"。

1.3 指令集自主设计的技术挑战

GPU 指令集设计远不止"定义几条汇编助记符"那么简单。一套可用的 GPU ISA 需要同时回答以下问题:

GPU 指令集设计的核心要素:

1. 执行模型
   - SIMT 线程束宽度(NVIDIA Warp=32 / AMD Wavefront=32/64)
   - 分支发散处理策略(predication vs mask)
   - Warp 内同步原语

2. 寄存器文件组织
   - 每线程可用寄存器数量(影响占用率 occupancy)
   - 寄存器 bank 化与 bank conflict 规避
   - 标量寄存器 vs 向量寄存器划分

3. 内存一致性模型
   - 弱一致 / 释放一致 / RC11 风格
   - 显式 fence/barrier 指令
   - 共享内存 / L1 / L2 / VRAM 层次访问语义

4. 纹理 / 采样指令
   - 硬件纹理过滤的指令暴露方式
   - 各向异性过滤、LOD bias 的指令编码

5. 特殊函数单元 (SFU)
   - sin/cos/log/exp/rsqrt 的硬件实现与精度
   - 是否暴露近似版本与精确版本双指令

自研 ISA 的真正成本不在"定义",而在"配套"。一套新 ISA 必须同时交付:

  • 编译器后端:把 HLSL/GLSL/SPIR-V 编译为 TrueGPU 机器码的 shader compiler,需要支持指令调度、寄存器分配、软件流水线。
  • 驱动中的 JIT/编译路径:现代 GPU 驱动在运行时把中间表示编译为目标码,编译质量直接决定游戏帧率。
  • 调试与性能分析工具:没有 PIX/Nsight 级别的工具,开发者就无法定位瓶颈,优化就变成黑盒试错。
  • 文档与社区:CUDA 之所以成为护城河,不是因为 PTX 多优雅,而是因为十几年的文档、教程、StackOverflow 问答、库生态。

与 CUDA 生态的兼容性是绕不开的问题。CUDA 的运行时基于 NVIDIA 的 SASS/PTX,砺算无法原生执行 CUDA。可行的路径只有两条:一是通过 OpenCL 3.0 / SYCL / Vulkan Compute 这类开放规范承接通用计算负载;二是在上层框架(PyTorch 后端、ONNX Runtime execution provider)做翻译。这意味着短期内砺算无法直接复用任何依赖 nvcc/cuda.h 的现有代码,AI 推理场景的生态迁移成本不可低估。


2. 硬件规格深度对比

2.1 规格参数表

参数 砺算 LX-7G100 RTX 3060 RX 6600 Intel Arc A750
架构 TrueGPU 天图 Ampere (GA106) RDNA2 (Navi 23) Xe HPG (ACM-G10)
制程 6nm 8nm (Samsung) 7nm (TSMC) 6nm (TSMC)
显存 12GB GDDR6 12GB GDDR6 8GB GDDR6 8GB GDDR6
显存位宽 192bit 192bit 128bit 256bit
显存带宽 ~360 GB/s(推算) 360 GB/s 224 GB/s 512 GB/s
PCIe 4.0 x16 4.0 x16 4.0 x8 4.0 x16
纹理单元 192 112 112 224
光栅单元 96 48 64 64
视频输出 4× DP 1.4a 3× DP 1.4a + 1× HDMI 3× DP + 1× HDMI 3× DP + 1× HDMI
参考价格 2688 元(自营) ~2000 元(二手) ~1500 元 ~1300 元

2.2 纹理与光栅单元分析

纸面参数与实测性能的反差,是这一代 LX-7G100 最值得玩味的工程现象。

为什么纸面强、实测弱? 关键在于 GPU 性能的"木桶效应"不在 TMU/ROP 这一段,而在更上游:

GPU 渲染管线性能瓶颈分布:

几何处理 → 顶点着色 → 曲面细分 → 光栅化 → 像素着色 → 纹理采样 → ROP 输出
   ▲           ▲           ▲          ▲          ▲           ▲         ▲
   │           │           │          │          │           │         │
SM/CU 数量与时钟决定上游吞吐,TMU/ROP 只是末端执行单元

砺算的瓶颈更可能位于:
  ① SM 等效数量 / 时钟频率(决定能喂多少三角形给光栅器)
  ② 内存子系统延迟与带宽利用率(决定纹理采样是否喂得饱 192 个 TMU)
  ③ 驱动对 Draw Call 的开销(CPU 侧提交效率)
  ④ 着色器编译器质量(指令调度、寄存器占用率)

打个比方:192 个 TMU 相当于 192 个收银台,但如果上游只派得出 60 个顾客(SM 吞吐不足),或者库存补货跟不上(带宽利用率低),收银台再多也空转。RTX 3060 虽然只有 112 个 TMU,但 Ampere 架构的 SM 调度效率、360 GB/s 带宽的利用率、以及十余年打磨的驱动,能持续把数据喂满这些单元。

驱动成熟度对硬件性能释放的影响是决定性的。 NVIDIA 每款游戏发布前会做 profile 优化,针对特定引擎调整着色器编译策略、显存分配、异步队列调度。砺算作为新进入者,缺少这些 per-title 优化,在复杂引擎(虚幻 5、寒霜)下的性能损耗会被放大。这也是为什么"优化完善的网游能实现更高帧率"——网游引擎相对简单、着色器模式固定,对驱动 profile 的依赖低,硬件本身的吞吐能更直接地转化为帧率。

2.3 8K 输出与多屏能力

LX-7G100 标配四路 DP 1.4a,支持四屏同步输出、8K 60Hz、10bit 广色域。这里需要做一个带宽账:

DP 1.4a 带宽账:

单端口原始带宽:8.1 Gbps × 4 lane = 32.4 Gbps
8b/10b 编码后有效数据率:25.92 Gbps

8K (7680×4320) 分辨率带宽需求:
  @ 60Hz, 8bit RGB (24bit)   = 7680 × 4320 × 60 × 24 / 8 ≈ 5.97 GB/s ≈ 47.7 Gbps
  @ 60Hz, 10bit RGB (30bit)  ≈ 7.46 GB/s ≈ 59.7 Gbps

结论:单口 DP 1.4a 的 25.92 Gbps 无法直传 8K 60Hz,
      必须依赖 DSC(Display Stream Compression)。

DSC 3:1 压缩后:
  8K 60Hz 8bit  → 47.7 / 3 ≈ 15.9 Gbps  ✓ 可用
  8K 60Hz 10bit → 59.7 / 3 ≈ 19.9 Gbps  ✓ 可用

DSC 是 VESA 制定的视觉无损压缩算法(基于预测编码 + Delta PCM),压缩比通常 2:1~3:1,对画质影响在专业色准评测中几乎不可见。所以"8K 60Hz + 10bit"在 DP 1.4a 上是工程可行的,关键在于显示端是否支持 DSC 解码——目前主流 8K 电视与高端显示器均支持。

四屏同步输出的应用场景主要集中在:

  • 金融交易多屏工作站(行情 + 委托 + 风控 + 资讯)
  • 工业控制 / 监控大屏拼接
  • 信创办公多窗口并行

这些场景对 GPU 3D 性能要求不高,但对多口稳定输出、长时稳定性要求高,恰好是国产 GPU 在政企信创市场的差异化点。


3. 软件生态兼容性分析

3.1 图形 API 支持矩阵

API 支持版本 对应功能 行业最新版本
DirectX 12 主流 Windows 游戏 / 应用 DX12 Ultimate
Vulkan 1.2 跨平台图形 / 计算 Vulkan 1.4
OpenGL 4.6 遗留应用 / 专业软件 OpenGL 4.6
OpenCL 3.0 通用计算 OpenCL 3.0

整体看,API 覆盖面是完整的,主流游戏与应用的"准入门槛"已迈过。但有几个细节值得注意:

  • Vulkan 1.2 vs 1.4:1.3 引入了动态渲染(VK_KHR_dynamic_rendering)、同步对象 2(VK_KHR_synchronization2),1.4 进一步强制了管线优化。落后两个大版本意味着无法使用最新的渲染性能特性,依赖这些特性的引擎(如新版 Source / id Tech)可能需要回退路径。
  • DirectX 12 是否覆盖 12_1 Feature Level 与 DX12 Ultimate(含 VRS、Mesh Shader、DXR)未公开。如果未支持 DXR,则光线追踪在 Windows 侧无法通过 DX12 路径调用,这与"暂不建议追求光追的玩家购买"是一致的。
  • OpenCL 3.0 是当前最新,但 OpenCL 在 AI 领域已被 CUDA/ROCm/HIP 边缘化,砺算更现实的方向是把通用计算压在 Vulkan Compute 与自研 AI 后端上。

3.2 驱动生态的挑战

"纸面性能亮眼、实测只有 RTX 3060 的 2/3"——这个差距里,驱动的权重远大于硬件本身。可以从四个维度拆解:

第一,驱动团队规模差距。 NVIDIA 的图形驱动团队规模在数千人量级,长期投入 per-game profile、着色器缓存、异步编译、内存压缩策略优化。砺算作为初创公司,驱动团队规模与之相比是数量级差距。这不是靠"招人"能短期补平的——驱动优化是典型的经验积累型工程,很多性能 hack 需要在真实游戏 bug 库中沉淀。

第二,着色器编译质量。 现代 GPU 在运行时把 HLSL/GLSL 编译为机器码,编译器的指令调度、寄存器分配、占用率优化直接决定帧率。一套新 ISA 的编译器从"能跑"到"优化得好"通常需要 3~5 年迭代。LX-7G100 处于这条曲线的早期段。

第三,游戏兼容性测试维度。 GPU 兼容性不是"能启动"就算通过,而是要在以下维度逐一验证:

  • 渲染正确性(无花屏、无伪影、无 Z-fighting 异常)
  • 着色器精度(HDR / 高精度 alpha 混合)
  • 异步计算队列兼容
  • 多显示器 / 多窗口下的资源调度
  • 长时运行稳定性(无显存泄漏、无 TDR 超时)

每款游戏都是一次独立的工程验证,Steam 顶部 100 款游戏就是 100 个独立工程任务。

第四,持续推送驱动更新的承诺与执行难度。 NVIDIA 平均每月推送 1~2 次游戏就绪驱动,每次针对新发售游戏做优化。砺算需要建立类似的 QA 与发布流水线,这对一家从零起步的公司是组织能力考验,而不仅是技术能力考验。

3.3 信创系统兼容

LX-7G100 兼容 Windows 与多套国产信创操作系统。信创适配是国产 GPU 相对进口卡最确定的差异化优势,也是政策红利所在:

信创操作系统 GPU 适配栈:

┌──────────────────────────────────────────────┐
│  应用层:WPS / 永中 Office / 国产浏览器 / 信创 ERP │
├──────────────────────────────────────────────┤
│  图形 API 层:OpenGL 4.6 / Vulkan 1.2          │
├──────────────────────────────────────────────┤
│  驱动层:砺算自研内核态 + 用户态驱动             │
├──────────────────────────────────────────────┤
│  OS 内核:统信 UOS / 银河麒麟 / openKylin       │
├──────────────────────────────────────────────┤
│  硬件:LX-7G100 (PCIe 4.0 x16)                │
└──────────────────────────────────────────────┘

在 Linux 侧,NVIDIA 的专有驱动是闭源二进制 blob,长期与主线内核存在兼容摩擦(如 ABI 变更导致驱动失效)。砺算有机会走"上游开源 + 厂商签名"的中间路线:把 DRM/KMS 驱动贡献到 Linux 主线,让信创发行版开箱即用,同时在用户态 Mesa 中维护 gallium 驱动。这条路 Intel 与 AMD 已经验证可行,但需要持续投入开源社区资源。

与 NVIDIA 专有驱动的生态差距,短期内难以抹平,但在信创这个"封闭市场"内,砺算的对手不是 NVIDIA,而是同样在追赶的摩尔线程、天数智芯。


4. NRSS 画面超分技术

砺算自研了 NRSS(推测为 Native Resolution Super Scaling 之类命名)画面超分技术。要理解它的工程定位,需要先厘清主流超分方案的技术谱系。

4.1 与 DLSS / FSR / XeSS 的定位对比

方案 厂商 技术路径 硬件依赖 游戏集成
DLSS NVIDIA 时域 + AI(Tensor Core 推理) 必须 Tensor Core SDK 集成
FSR 1 AMD 空间域(EASU + RCAS) SDK 集成
FSR 2/3 AMD 时域(运动矢量 + 重建) 无(推荐 DP4a) SDK 集成
XeSS Intel AI(XMX 或 DP4a 回退) 推荐 XMX,可回退 SDK 集成
NRSS 砺算 未公开(推测时域或 AI) 推测依赖自研计算单元 推测 SDK 集成

4.2 超分技术的实现路径

超分技术三大路径:

路径 A:空间域(Spatial)
  - 仅用当前帧低分辨率图像,通过边缘自适应插值放大
  - 优点:无需运动矢量,集成简单,无延迟
  - 缺点:高频细节重建能力弱,易糊
  - 代表:FSR 1、CAS

路径 B:时域(Temporal)
  - 利用历史帧 + 运动矢量(Motion Vector)重建高频细节
  - 优点:细节重建质量高,接近原生分辨率
  - 缺点:需要游戏提供精确运动矢量,对鬼影/闪烁需专门处理
  - 代表:DLSS 2+、FSR 2/3、TAAU

路径 C:AI 驱动(Neural)
  - 用神经网络从低分辨率 + 时序信息推断高分辨率
  - 优点:质量上限最高,能恢复训练分布内的纹理
  - 缺点:需要专用矩阵加速单元,推理有延迟,需大量训练数据
  - 代表:DLSS(Tensor Core)、XeSS(XMX)

4.3 自研超分的技术挑战

NRSS 若走时域路径,核心挑战在于抖动采样(jittered sampling)与运动矢量的精确性——这需要游戏引擎侧配合,意味着砺算必须说服引擎厂商(Epic、Unity、CRI 等)在其 SDK 中加入 NRSS 路径,而新方案的接入意愿天然低于已有标准。

若走 AI 驱动路径,则有三重门槛:

  1. 训练数据:DLSS 用 NVIDIA 内部海量游戏画面 + 超算做训练,数据规模与算力成本对新进入者是巨大门槛。砺算需要自建训练集,或采用公开数据集做迁移学习,质量上限受限。
  2. 推理性能:在没有公开 Tensor Core 级矩阵单元的前提下,神经网络推理要落在通用计算单元上,开销可能吃掉超分带来的帧率收益,形成"为了提帧反而掉帧"的悖论。
  3. 画质调优:超分网络的视觉质量是主观与客观指标的混合体,需要在鬼影、闪烁、细节恢复三者间做大量 case-by-case 调参,这是典型的"时间换质量"工程。

4.4 在低分辨率游戏中的实际效果预期

基于 LX-7G100 综合性能约为 RTX 3060 的 2/3 这一基线,NRSS 的现实价值在于:把"1080p 中画质勉强 30~45 帧的 3A"提升到"1080p 超分到 1440p、稳定 45~55 帧"的可玩区间。它不会让这张卡变成 4K 显卡,但能拓宽中低画质下的可玩游戏范围。质量能否逼近 FSR 2 级别,是判断 NRSS 工程化程度的试金石。


5. 性能定位与性价比分析

5.1 游戏性能实测定位

以"综合性能约为 RTX 3060 的 2/3"为锚点,结合 RTX 3060 在主流分辨率下的公开基准,可以推算 LX-7G100 的帧率预期区间:

分辨率 画质 RTX 3060 典型帧率 LX-7G100 推算(2/3) 可玩性
1080p 中高,3A 大作 60~80 40~53 可玩,部分场景吃紧
1080p 高,优化完善网游 120~180 80~120 流畅
1440p 中,3A 大作 45~60 30~40 勉强可玩
4K 中,3A 大作 25~35 17~23 不建议

关键观察:

  • 1080p 是这张卡的主战场。在这个分辨率下,硬件吞吐与显存带宽能较好匹配,2/3 RTX 3060 的性能对应主流网游可流畅、3A 大作可玩。
  • 1440p 开始吃力。像素量比 1080p 多 78%,对带宽与 ROP 压力陡增,3A 大作需降画质或开 NRSS。
  • 4K 不在适用范围。即便有 12GB 显存撑得起纹理,计算吞吐不足以支撑 4K 帧率。
  • 优化完善的网游帧率更高。网游(LOL、CS2、Valorant、永劫无间等)引擎负载模式稳定,对驱动 profile 依赖低,硬件能力能更直接释放,这是国产 GPU 性价比最能体现的场景。

5.2 性价比计算

把"性能/价格"做一个粗略的归一化(RTX 3060 性能记为 1.0):

场景 砺算 LX-7G100 RTX 3060(二手) RX 6600
相对性能 0.67 1.0 ~0.75
价格(元) 2688 ~2000 ~1500
每元性能 0.000248 0.000500 0.000500
相对性价比 1.0× 2.0× 2.0×
国产自研溢价 +34%(相对 RX 6600 同性能价位推算) 基准
12GB 显存价值 高(AI 推理 / 内容创作) 中(8GB 限制)

从纯游戏性价比看,LX-7G100 的每元性能约为同价位进口卡的 50%,存在明显的"国产自研溢价"。但这个账要分场景算:

  • 纯游戏玩家:性价比确实偏低,进口二手卡或 RX 6600 更划算。
  • AI 推理入门用户:12GB 显存是稀缺资源。同价位的 RX 6600 只有 8GB,跑 Stable Diffusion XL、7B 量化的 LLM 会捉襟见肘;RTX 3060 12GB 二手虽也能跑,但货源不稳定。LX-7G100 在"12GB + 全新 + 国产"三个标签叠加下,对这部分用户有独特价值。
  • 信创办公用户:性价比不是首要考量,合规与稳定才是,进口卡在此场景出局。

5.3 内容创作场景评估

4K 视频剪辑:12GB 显存对 4K H.265/AV1 时间线预览、多轨叠加、调色 LUT 实时预览有实质帮助。Premiere Pro / DaVinci Resolve 在 12GB 卡上的代理切换频率显著低于 8GB 卡。但需注意,砺算是否提供对应编码器加速(NVENC / AMF / QSV 的等价物)未公开,若仅靠通用计算做编码,效率会低于有专用编码单元的卡。

3D 渲染:OpenCL 3.0 支持意味着 Blender Cycles、Octane(如适配)等支持 OpenCL 后端的渲染器理论可调用。但渲染器对 GPU 的优化深度依赖驱动质量与厂商合作,砺算在这条路上的成熟度仍需观察。Blender 的 Cycles 在新 GPU 上的适配通常以年为单位迭代。

AI 推理:12GB 显存对消费级 AI 推理是黄金容量:

模型 显存占用(推算) 8GB 可行性 12GB 可行性
Stable Diffusion 1.5(FP16) 4~6GB 可,留余量
Stable Diffusion XL(FP16) 10~12GB 紧张/需 offload
LLaMA-7B(Q4 量化) 4~6GB
LLaMA-13B(Q4 量化) 8~10GB 紧张
Qwen-14B(Q4 量化) 9~11GB 紧张

与 RTX 3060 在 AI 推理场景的对比:RTX 3060 12GB 依赖成熟的 CUDA 生态,PyTorch / diffusers / vLLM 开箱即用;LX-7G100 需要等待砺算提供对应推理后端(OpenCL 或自研 EP),短期内生态成熟度差距明显。但显存容量的硬件基础已经具备,是未来生态完善后的潜在优势点。


6. 散热设计分析

LX-7G100 采用三风扇五热管一体式方案,配隐藏式双辅扇与大面积均热板,尺寸 294 × 120 × 49mm。

三风扇五热管方案的定位。这是中端到中高端显卡的标准配置——RTX 3060 公版为双风扇双热管,非公版才上三风扇。砺算直接给到三风扇五热管,说明散热冗余设计较保守,目标是把芯片温度压在较低区间以换取稳定性,这与新架构对温度敏感、需要留足余量做长时稳定性验证的工程逻辑一致。

隐藏式双辅扇的设计意图。辅扇通常指辅助气流的风扇,隐藏式设计可能指风扇置于护罩内、不外露,兼顾风道与外观。双辅扇配合主扇,可在 294mm 长卡上形成贯穿式风道,兼顾 GPU 核心与供电模块(VRM)散热。

大面积均热板的散热效率。均热板(Vapor Chamber)相比传统热管,导热效率高一个数量级,能把 GPU 热点的热量快速均布到散热鳍片全域。这对于 6nm 制程、可能存在局部热点(hot spot)的新架构尤其重要——均热板能避免因单点过热触发的降频。

294mm 长度的机箱兼容性。294mm 属于标准中长卡,主流中塔 ATX 机箱(显卡限长 320~360mm)可兼容,但紧凑型机箱(限长 280mm 以下)需特别注意。双槽厚度(49mm 接近双槽上限)意味着不会遮挡更多 PCIe 插槽,对需要扩展卡的用户友好。

与 RTX 3060 公版散热的对比:RTX 3060 公版为双风扇鼓风式,噪音与散热表现中规中矩;非公版三风扇版本噪音更低但更长。LX-7G100 的三风扇五热管 + 均热板,在绝对散热能力上应优于 RTX 3060 公版,这对长时游戏与 AI 推理持续负载下的稳定性是正向贡献。


7. 国产 GPU 赛道全景

7.1 消费级与数据中心 GPU 厂商

厂商 产品 架构 制程 定位
砺算 LX-7G100 TrueGPU 天图 6nm 消费级独显
摩尔线程 MTT S80 MUSA 春晓 7nm 消费级独显
天数智芯 BI-V150 天垓 7nm 数据中心
壁仞 BR100 BR 7nm 数据中心
景嘉微 JM9 系列 JM 14/7nm 信创 / 专业图显

砺算 LX-7G100 的独特定位在于:它是国内少有的"消费级 + 全自研 ISA"组合。摩尔线程 MTT S80 虽也面向消费级,但其 MUSA 架构的 ISA 自主程度与 TrueGPU 是否同档,需更深入的技术披露才能比较;天数智芯、壁仞聚焦数据中心,不直接面向 C 端;景嘉微侧重信创图显,游戏性能不是主要目标。

7.2 技术路线对比

国产 GPU 技术路线坐标系:

              全自研 ISA
                  ▲
                  │
        砺算 ●    │
                  │
                  │
   ───────────────┼──────────────── 授权/二次开发 →
                  │
                  │      ● 摩尔线程(部分自研)
                  │
                  │      ● 部分信创 SoC(IP 授权)
                  ▼
              消费级                数据中心
  • 全自研架构(砺算)vs 基于授权:全自研路线前期投入大、生态起点低,但长期可控;授权路线起步快、能复用部分生态,但天花板被授权方锁死。两条路没有绝对优劣,取决于公司战略周期。
  • 消费级 vs 数据中心:消费级 GPU 的工程难度不在峰值算力,而在"驱动适配数千款游戏的工程量";数据中心 GPU 的难度在集群互联与算子库。两者技术栈差异巨大,难以复用。
  • 软件生态的差距与追赶策略:数据中心 GPU 可通过适配 PyTorch/TensorFlow 后端、提供 ONNX EP 等方式承接 AI 负载,追赶路径相对清晰;消费级 GPU 必须做 per-game 优化,没有捷径。

7.3 与 NVIDIA 的差距分析

维度 NVIDIA 砺算 差距性质
架构积累 25 年+(Riva 128 至 Ada) 第 1 代消费级 10 年+ 的迭代积累
驱动团队 数千人 初创规模 数量级差距
生态护城河 CUDA / cuDNN / TensorRT / Nsight 自研工具链起步 10 年+ 的开发者社区
制程工艺 4N(4nm 级) 6nm 1~2 代差距
光追 / Tensor 第 3 代 RT Core / 第 4 代 Tensor 未公开 暂未形成竞争力
游戏优化 profile 数千款游戏 起步阶段 per-game 工程量

需要清醒认识到:在游戏 GPU 这条赛道上,与 NVIDIA 的差距是系统性的、多维度的,不是单点突破能抹平的。砺算的合理策略不是"全面对标 NVIDIA",而是"在国产替代与特定场景(信创办公、AI 推理入门、网游)建立可用的产品力"。


8. 购买建议与使用场景

8.1 适合购买的群体

  • 支持国产自研的极客玩家:愿意为"全自研 ISA"的技术路线付费,能接受驱动早期的不完善,享受参与生态建设的过程。
  • 需要大显存的内容创作者:12GB 显存在 4K 视频剪辑、多轨时间线场景下有实质价值,且预算卡在 3000 元内、不愿冒险买二手 3060 12GB 的用户。
  • 信创环境下的办公用户:政企、央国企信创替换场景,国产 GPU 是合规刚需,LX-7G100 的多屏输出与国产 OS 适配是核心卖点。
  • AI 推理入门用户:12GB 显存能跑 SDXL、13B 量化 LLM,且希望硬件全新、有售后保障的用户。前提是能接受当前 AI 推理后端生态仍在完善中。

8.2 暂不建议的群体

  • 追求极致游戏性能的玩家:2/3 RTX 3060 的性能在 1440p/4K 3A 大作下吃力,同价位二手 3060 或 RX 6600 游戏体验更好。
  • 依赖 CUDA 生态的开发者:所有依赖 nvcccuda.h、cuDNN、TensorRT 的现有代码无法直接运行,迁移成本高,建议等生态成熟后再评估。
  • 专业 3D 渲染用户:Blender Cycles、Octane 等渲染器对新 GPU 的适配周期长,短期内生产力无法保障。
  • 需要 Ray Tracing 的玩家:当前未公开 RT Core 级光追单元,DXR 路径支持情况不明,光追游戏不是适用场景。

8.3 长期价值评估

  • 驱动持续优化的可能性:取决于砺算的工程投入与现金流。创始限量版两批售罄、零售版降价放量,说明有正向现金流支撑驱动迭代,但能否坚持 3~5 年的 per-game 优化节奏是关键变量。
  • 生态建设的时间窗口:信创政策窗口与 AI 推理本地化趋势给了国产 GPU 2~3 年的喘息期,能否在窗口期内把驱动打磨到"主流游戏无大坑"是分水岭。
  • 国产替代的政策红利:政企信创采购是确定性需求,这块市场对价格不敏感、对合规敏感,是砺算最稳的现金牛。
  • 二手保值率预期:取决于驱动迭代是否兑现承诺。若 1~2 年内驱动显著改善,二手价可能坚挺;若迭代停滞,二手价会快速下滑。购买时建议把它当作"消费 + 支持国产"而非"投资"。

9. 国产 GPU 的未来展望

驱动优化的 roadmap。合理的预期是:第一年解决"主流游戏无大坑"(兼容性与基础性能),第二年做"主流游戏 per-game 优化"(帧率提升),第三年逼近"同规格硬件的理论性能上限"。NRSS 等自研技术也应在第二年进入可用阶段。这条曲线与当年 Intel Arc 重启 GPU 业务时的轨迹类似——硬件先到位,驱动用两三年补齐。

下一代架构的技术方向。基于 6nm 这一制的后续优化空间有限,下一代产品大概率会向更先进制程(5nm/4nm 国产或台积电)与专用加速单元(矩阵引擎、光追单元)演进。TrueGPU 作为自研 ISA,有灵活性把"AI 推理加速"做成一等公民,而非像 NVIDIA 那样在图形 GPU 上叠加 Tensor Core——这可能是国产 GPU 在架构哲学上的差异化机会。

与 AI 算力需求的协同。消费级 GPU 的 12GB 显存与本地 AI 推理需求天然契合。若砺算能在驱动层提供高质量的 ONNX Runtime / 自研推理 EP,LX-7G100 有潜力成为"国产版 RTX 3060 12GB + 本地 AI"的复合定位卡,打开游戏之外的第二增长曲线。

突破 CUDA 生态垄断的可能性。CUDA 的护城河不在 ISA 本身,而在十余年沉淀的库(cuDNN/cuBLM/TensorRT)、文档、教程与开发者心智。单靠一家国产厂商难以正面突破,可行路径是"开放标准联盟"——通过 OpenCL / SYCL / Vulkan Compute / OneAPI 这类跨厂商规范,把生态从"绑定单一厂商 ISA"逐步迁移到"绑定开放标准"。砺算作为全自研 ISA 的厂商,反而没有历史包袱,可以纯粹地押注开放标准路线。这条路上 Intel(OneAPI)、AMD(ROCm/HIP)已是同盟,国产 GPU 加入开放阵营是顺势而为。


结语

砺算 LX-7G100 的 2688 元,买的不是一张"性价比显卡",而是一张"国产全自研 GPU 的入场券"。从 TrueGPU 天图架构的全自研 ISA、到 192 TMU / 96 ROP 的纸面规格、再到实测 2/3 RTX 3060 的现实性能,它的工程画像清晰:硬件基础扎实但架构效率待提升,软件生态完整但驱动成熟度处于早期,信创与 AI 推理是确定性的差异化场景,游戏性能是当前短板。

对个人用户,是否购买的判断标准很简单:如果你买的是"显卡性能",同价位有更好选择;如果你买的是"参与国产 GPU 从 0 到 1 的过程",这张卡值得入手。对行业,LX-7G100 的意义不在于它今天能跑多少帧,而在于它证明了"全自研消费级 GPU"这条路在商业上可行——这才是 2688 元背后真正的技术博弈。


声明:本文性能预期基于"约为 RTX 3060 的 2/3"的公开实测数据合理推算,架构推测基于公开规格(6nm / 192 TMU / 96 ROP / 192bit / DP 1.4a)的工程化推导,未涉及任何未公开的内部资料。具体性能以官方驱动迭代后的实测为准。