摘要:
在大模型推理的下半场,GPUStack v2 不再是简单的模型服务平台,而是高性能推理生态的协调者与赋能者。 阅读全文
在大模型推理的下半场,GPUStack v2 不再是简单的模型服务平台,而是高性能推理生态的协调者与赋能者。 阅读全文
posted @ 2025-11-25 17:35
GPUStack
阅读(1794)
评论(0)
推荐(0)
在大模型推理的下半场,GPUStack v2 不再是简单的模型服务平台,而是高性能推理生态的协调者与赋能者。 阅读全文
昇腾多机推理太复杂?易出错?试试 GPUStack 阅读全文
在 45 分钟内搭建 GPUStack 模型服务平台并运行生产级的 Qwen3 模型服务。 阅读全文
GPUStack 正式发布并开源,一个用于运行 LLM(大型语言模型)的开源 GPU 集群管理器。 阅读全文
本文实测 GPUStack 在 H20 与昇腾 910B 上部署 DeepSeek-V4-Flash-0731,解析 DSpark 加速、长上下文性能及生产配置建议。 阅读全文
本文以单台 8×B300 服务器为例,演示如何在 GPUStack 中接入 TileRT 定制 vLLM 后端,完成 GLM-5.1 的 Prefill / Decode(PD)分离部署、路由配置与性能验证。 阅读全文
本文记录 Kimi-K3 在单机 8×NVIDIA B300 环境中的部署与压测过程,并对 vLLM、SGLang 两套推理引擎在 64K 与 200K 长上下文场景下的表现进行拆解。测试显示:64K 输入下 vLLM 更快,200K 输入下 SGLang + DCP 反超;真正拉开差距的不是 Pr 阅读全文
本文由 GPUStack 社区用户投稿整理,介绍如何将 MinerU Fast API 接入 GPUStack,通过自定义推理后端实现复杂 PDF 解析服务的部署与调用。 阅读全文
Inkling 是由 Thinking Machines Lab 发布的新一代开源多模态大语言模型,采用 Mixture-of-Experts(MoE)Transformer 架构,支持文本、图像和音频等多模态输入,并生成文本输出。模型拥有约 975B 总参数、41B 激活参数,并支持最长 1M t 阅读全文
本文由 GPUStack 社区用户实测分享整理。GLM-5.2-FP8-DSpark 是在 GLM-5.2-FP8 基础上,通过挂载 RedHatAI 提供的外置草稿模型(Speculator)做投机解码(Speculative Decoding)的增强方案——同一份主模型权重,额外加载一个草稿模型,用来提升解码吞吐。社区用户在模型放出当天(Day 0)就在 **8 卡 H20-141G** 环境上,通过 GPUStack 完成了部署,并和原生 GLM-5.2-FP8 做了同硬件对比压测。 阅读全文
MiniMax-M3 是 MiniMax 最新开源的原生多模态大模型,约428B 总参数/23B激活参数,原生支持1M上下文。本文基于 GPUStack 与VLLM,演示从镜像与权重准备、模型部署、对话实测到基准测试的完整流程,并实测了基于 EAGLE3 的投机解码加速。 阅读全文