摘要:
本文由 GPUStack 社区用户实测分享整理。DeepSeek-V4-Flash-DSpark 是在 DeepSeek-V4-Flash 基础上挂载了投机解码(Speculative Decoding)模块的增强版本——同一份权重,额外的投机模块,让吞吐和首 Token 时延同时变好。 社区用户拿 阅读全文
posted @ 2026-07-02 15:31
GPUStack
阅读(782)
评论(0)
推荐(1)
MiniMax-M3 是 MiniMax 最新开源的原生多模态大模型,约428B 总参数/23B激活参数,原生支持1M上下文。本文基于 GPUStack 与VLLM,演示从镜像与权重准备、模型部署、对话实测到基准测试的完整流程,并实测了基于 EAGLE3 的投机解码加速。 阅读全文
NVIDIA H200/H20 141GB 环境部署 DeepSeek-V4-Pro 的实践教程、压测性能表现,以及针对压测表现提供的稳定性配置建议。 阅读全文
在昇腾 910B 环境部署 DeepSeek-V4 的实践教程。 阅读全文