被炒到 35000 的 DGX Spark,正在让本地大模型玩家陷入狂热
最近硬件圈和本地大模型社区里,NVIDIA DGX Spark 的价格已经涨到了 35000 元左右。
按理说,价格被推到这个区间,很多人理应选择观望。
但不少折腾本地 Agent 的同行依然在盯这台机器。我也在犹豫。导火索正是 Mia Lab 最新的实测数据。
1、Mia Lab 的实测数据
Mia Lab 公布了针对单卡 NVIDIA DGX Spark 的优化方案,测试模型为 Qwen3.8-Flash-Next。
实测包含三项核心改动:
- 8k 预填提速 24.7%:吞吐从 1764 tok/s 提升到 2200 tok/s,首字延迟(TTFT)降至 3.74 秒。
- 单流解码提速:文本输出提升至 47 tok/s(此前为 44 tok/s)。
- 修复投机采样缺陷:排除了此前导致特定场景解码下降 24% 的起草算法 bug。
8k 到 256k 的完整上下文测试数据如下:
| 上下文长度 | 首字延迟 (TTFT) | 预填吞吐 (3次均值) | 9月5日旧版本 | 变化幅度 |
|---|---|---|---|---|
| 8k | 3.74 秒 | 2200 tok/s | 1764 tok/s | +24.7% |
| 16k | 7.13 秒 | 2304 tok/s | 2265 tok/s | +1.7% |
| 32k | 14.18 秒 | 2314 tok/s | 2265 tok/s | +2.2% |
| 64k | 29.05 秒 | 2257 tok/s | 2222 tok/s | +1.6% |
| 128k | 61.09 秒 | 2146 tok/s | 2110 tok/s | +1.7% |
| 256k | 134.89 秒 | 1944 tok/s | 1913 tok/s | +1.6% |
2、拿我的真实工作流来看这组数据
预填速度在短问答里感知不明显,但在本地编程 Agent 里是核心瓶颈。
我日常用 pi coding agent 写代码。工具和技能插件精简后,冷启动上下文约 15K。
即便底座压到这个体积,只要显卡预填慢,每次交互等首字都会很难受。
而一旦让 Agent 读取长文档或大型模块,上下文迅速膨胀到数万 token,预填如果跟不上,等待首字的时间就会打断开发节奏。
对照 Mia Lab 的实测:
在 16k 上下文(接近我的基础环境)下,DGX Spark 预填达到 2304 tok/s,TTFT 仅 7.13 秒。
上下文扩展到 32k、64k 时,预填依然稳定在 2250 tok/s 以上。
即使拉到 256k,预填仍有 1944 tok/s。结合 47 tok/s 的解码速率,大文档下的交互不会出现明显停顿。
3、软硬协同的生态红利
Mia Lab 的更新说明开源团队正将 DGX Spark 视作重点适配目标。底层内核重写与投机算法修复,都在挖掘这块芯片的物理极限。
硬件能持续享受到算法优化红利,是吸引开发者的重要原因。
4、35000 元背后的理性权衡
35000 元的价格包含了明显的市场炒作与溢价。
等等党能迎来一次胜利么?
浙公网安备 33010602011771号