被炒到 35000 的 DGX Spark,正在让本地大模型玩家陷入狂热

最近硬件圈和本地大模型社区里,NVIDIA DGX Spark 的价格已经涨到了 35000 元左右。

按理说,价格被推到这个区间,很多人理应选择观望。

但不少折腾本地 Agent 的同行依然在盯这台机器。我也在犹豫。导火索正是 Mia Lab 最新的实测数据。

1、Mia Lab 的实测数据

Mia Lab 公布了针对单卡 NVIDIA DGX Spark 的优化方案,测试模型为 Qwen3.8-Flash-Next。

实测包含三项核心改动:

  1. 8k 预填提速 24.7%:吞吐从 1764 tok/s 提升到 2200 tok/s,首字延迟(TTFT)降至 3.74 秒。
  2. 单流解码提速:文本输出提升至 47 tok/s(此前为 44 tok/s)。
  3. 修复投机采样缺陷:排除了此前导致特定场景解码下降 24% 的起草算法 bug。

8k 到 256k 的完整上下文测试数据如下:

上下文长度 首字延迟 (TTFT) 预填吞吐 (3次均值) 9月5日旧版本 变化幅度
8k 3.74 秒 2200 tok/s 1764 tok/s +24.7%
16k 7.13 秒 2304 tok/s 2265 tok/s +1.7%
32k 14.18 秒 2314 tok/s 2265 tok/s +2.2%
64k 29.05 秒 2257 tok/s 2222 tok/s +1.6%
128k 61.09 秒 2146 tok/s 2110 tok/s +1.7%
256k 134.89 秒 1944 tok/s 1913 tok/s +1.6%

2、拿我的真实工作流来看这组数据

预填速度在短问答里感知不明显,但在本地编程 Agent 里是核心瓶颈。

我日常用 pi coding agent 写代码。工具和技能插件精简后,冷启动上下文约 15K。

即便底座压到这个体积,只要显卡预填慢,每次交互等首字都会很难受。

而一旦让 Agent 读取长文档或大型模块,上下文迅速膨胀到数万 token,预填如果跟不上,等待首字的时间就会打断开发节奏。

对照 Mia Lab 的实测:

在 16k 上下文(接近我的基础环境)下,DGX Spark 预填达到 2304 tok/s,TTFT 仅 7.13 秒。

上下文扩展到 32k、64k 时,预填依然稳定在 2250 tok/s 以上。

即使拉到 256k,预填仍有 1944 tok/s。结合 47 tok/s 的解码速率,大文档下的交互不会出现明显停顿。

3、软硬协同的生态红利

Mia Lab 的更新说明开源团队正将 DGX Spark 视作重点适配目标。底层内核重写与投机算法修复,都在挖掘这块芯片的物理极限。

硬件能持续享受到算法优化红利,是吸引开发者的重要原因。

4、35000 元背后的理性权衡

35000 元的价格包含了明显的市场炒作与溢价。

等等党能迎来一次胜利么?

posted on 2026-09-08 17:02  shmiluyu  阅读(106)  评论(0)    收藏  举报