DeepSeek-V4-Flash-DSpark 配置报告 ---当前最大速度

 DeepSeek-V4-Flash-DSpark 配置报告

生成时间:2026-08-02 | DGX Spark (GB10) | spark-da04


一、运行命令

ds4-server --cuda -m ~/gguf/DeepSeek-V4-Flash-IQ2XXS-...-v2-imatrix.gguf \
  -c 135168 --host 0.0.0.0 --port 8000 --no-mtp \
  --kv-disk-dir ~/ds4-kv --kv-disk-space-mb 8192 \
  --kv-cache-cold-max-tokens 135168

二、环境变量

变量作用
DS4_SESSION_LAZY_GRAPH=0 预分配 启动时分配 session graph,避免请求时内存碎片失败
DS4_BATCH_VMM_BUDGET_MB=2000 2GB 压缩缓存预算护栏,超限拒绝而非崩溃
DS4_SERVER_PIN_MIN_TOKENS=30000 30K deep 会话可被 evict(默认 64K)
DS4_CONT_DSPARK=1 启用 DSpark 投机解码
DS4_CONT_MTP_MODE=2 模式 2 MTP 连续批处理模式
DS4_DSPARK_MODEL=~/gguf/DSpark-drafter-Q2K-Q8.gguf DSpark 草稿模型路径

三、模型文件

文件大小
DeepSeek-V4-Flash-IQ2XXS-...-v2-imatrix.gguf(主模型) 86.72 GB
DSpark-drafter-Q2K-Q8.gguf(草稿模型) 6.5 GB
DeepSeek-V4-Flash-MTP-Q4K-Q8_0-F32.gguf(MTP,未使用) 3.6 GB

四、服务状态

指标
上下文 135,168 (132K)
max_seq 13
运行时长 4.1 小时
请求完成 140
请求失败 4
graph_fit_refusals 0
投机解码接受率 81.0%
磁盘缓存大小 8.0 GB / 29 个 checkpoint
预填充缓存命中 4,246,686 tokens 🚀
内存可用 2.3 GB

五、磁盘缓存详情

指标
目录 ~/ds4-kv
预算 8 GB
cold_max 135,168(保存所有 132K 前缀)
已写入 8.0 GB / 29 文件
缓存命中 424 万 tokens(大幅减少重复预填充)

六、硬件状态

指标
GPU NVIDIA GB10 (SM121)
GPU 时钟 2411 MHz(最大 3003)
GPU 温度 42°C
GPU 功耗 10.65 W(空闲)
系统内存 121 GB LPDDR5X(已用 119 GB)
磁盘 3.7 TB NVMe(2.0 TB 空闲)

七、引擎版本

项目
引擎 Entrpi/ds4 v0.5.0
后端 CUDA sm_121a (MXF4)
构建 直接加载(in-process artifacts, 474 artifacts)
投机 DSpark block drafter(3 层,Q2K)

八、OpenClaw 配置

{
  "providers": {
    "ds4": {
      "baseUrl": "http://192.168.31.33:8000/v1",
      "api": "openai-completions",
      "apiKey": "not-needed",
      "models": [{"id": "deepseek-v4-flash", "name": "DeepSeek V4 Flash"}]
    }
  },
  "agents": {
    "defaults": {
      "model": "ds4/DeepSeek V4 Flash"
    }
  }
}

九、启动脚本

# ~/ds4-128k-start.sh(已保存,-c 参数调为 135168)
bash ~/ds4-128k-start.sh

十、关键参数地图

├── 上下文大小: -c 135168 (132K,覆盖 133K 需求)
├── 投机解码: --no-mtp (DSpark 唯一)
├── 内存护栏: DS4_BATCH_VMM_BUDGET_MB=2000 (防崩溃)
├── 预分配: DS4_SESSION_LAZY_GRAPH=0 (防内存碎片)
├── 磁盘缓存: --kv-disk-dir ~/ds4-kv (424 万命中)
├── 直接加载: unset DS4_CUDA_WEIGHT_IPC_MANIFEST (防 VMM 崩溃)
└── GPU 锁频: sudo nvidia-smi --gpu=0 --lock-gpu-clocks=3003,3003 (重启后失效)

重启后速度恢复正常:

  • MATH 500 首轮 25.7(warmup),3 轮后稳定 39.5 tok/s
  • CODE 500: 25.4 tok/s
  • QA 500: 25.3 tok/s

内存充足时 MATH 达到 39.5 tok/s,接近 40 目标。之前速度低是因为内存打满后的降速。

posted @ 2026-08-02 23:10  张永全-PLM顾问  阅读(112)  评论(0)    收藏  举报