摘要: GPUStack v2:推理加速释放算力潜能,开源重塑大模型推理下半场 在大模型推理的下半场,GPUStack v2 不再是简单的模型服务平台,而是高性能推理生态的协调者与赋能者。 阅读全文
posted @ 2025-11-25 17:35 GPUStack 阅读(1865) 评论(0) 推荐(0)
摘要: 昇腾多机推理极速上手:10倍简化的 DeepSeek R1 超大规模模型部署 昇腾多机推理太复杂?易出错?试试 GPUStack 阅读全文
posted @ 2025-09-27 10:55 GPUStack 阅读(966) 评论(1) 推荐(0)
摘要: 45分钟从零搭建私有MaaS平台和生产级的Qwen3模型服务 在 45 分钟内搭建 GPUStack 模型服务平台并运行生产级的 Qwen3 模型服务。 阅读全文
posted @ 2025-04-29 17:07 GPUStack 阅读(1750) 评论(0) 推荐(0)
摘要: GPUStack正式发布: 为大模型而生的开源GPU集群管理器 GPUStack 正式发布并开源,一个用于运行 LLM(大型语言模型)的开源 GPU 集群管理器。 阅读全文
posted @ 2024-07-26 16:15 GPUStack 阅读(10671) 评论(0) 推荐(0)
摘要: GPUStack 实战:一行配置开启 DeepSeek-V4.1 DSpark,JSON 吞吐提升 3.8 倍 DeepSeek-V4.1 原生支持 DSpark 投机解码,但不同任务的加速收益差异显著。本文基于 GPUStack 和 4 张 H200,实测 JSON、代码、散文、长上下文及并发场景,分析草稿接受率、吞吐与显存代价,并给出可直接复用的配置方法、验证指标、避坑建议和回滚流程。 阅读全文
posted @ 2026-09-23 15:50 GPUStack 阅读(33) 评论(0) 推荐(0)
摘要: GPUStack 部署实战:8 卡 H20 跑通 GLM-5.3-Flash,解锁 512K 长上下文与多模态 本文实测使用 GPUStack 在 8 张 H20 上部署 320B 参数的 GLM-5.3-Flash,完整介绍专用 vLLM 镜像、后端配置与避坑要点,并验证多模态及 512K 长上下文能力。基准测试总吞吐量达 7907.54 Tokens/s,为企业构建私有化多模态 Agent 服务提供参考。 阅读全文
posted @ 2026-09-15 10:18 GPUStack 阅读(196) 评论(0) 推荐(0)
摘要: DeepSeek-V4-Flash-Vision-Exp 部署实战:用 GPUStack 搭建多模态 Agent 服务 DeepSeek-V4-Flash-Vision-Exp 正式开源,多模态 Agent 能力进一步升级。本文基于 4 卡 H20-96G 环境,实测如何通过 GPUStack 完成模型部署,并验证图像理解、工具调用及推理性能,带你快速跑通 DeepSeek V4 首个多模态版本。 阅读全文
posted @ 2026-09-10 11:19 GPUStack 阅读(112) 评论(0) 推荐(0)
摘要: GPUStack 部署 DeepSeek-V4-Flash-0731 双平台实测:H20 单并发 600+ TPS,昇腾 910B 表现如何? 本文实测 GPUStack 在 H20 与昇腾 910B 上部署 DeepSeek-V4-Flash-0731,解析 DSpark 加速、长上下文性能及生产配置建议。 阅读全文
posted @ 2026-08-06 11:15 GPUStack 阅读(655) 评论(0) 推荐(0)
摘要: GPUStack × TileRT × B300:GLM-5.1 高速版复现,解码吞吐 500+ TPS 本文以单台 8×B300 服务器为例,演示如何在 GPUStack 中接入 TileRT 定制 vLLM 后端,完成 GLM-5.1 的 Prefill / Decode(PD)分离部署、路由配置与性能验证。 阅读全文
posted @ 2026-08-04 17:48 GPUStack 阅读(59) 评论(0) 推荐(0)
摘要: GPUStack Day 0 支持 Kimi-K3:8×B300 上 vLLM 与 SGLang 推理实测 本文记录 Kimi-K3 在单机 8×NVIDIA B300 环境中的部署与压测过程,并对 vLLM、SGLang 两套推理引擎在 64K 与 200K 长上下文场景下的表现进行拆解。测试显示:64K 输入下 vLLM 更快,200K 输入下 SGLang + DCP 反超;真正拉开差距的不是 Pr 阅读全文
posted @ 2026-07-30 15:23 GPUStack 阅读(251) 评论(0) 推荐(0)
摘要: 怎么优雅地在GPUStack上使用minerU? 本文由 GPUStack 社区用户投稿整理,介绍如何将 MinerU Fast API 接入 GPUStack,通过自定义推理后端实现复杂 PDF 解析服务的部署与调用。 阅读全文
posted @ 2026-07-24 18:23 GPUStack 阅读(225) 评论(0) 推荐(0)
摘要: Day 0 实测|在 GPUStack 上部署 Inkling-BF16:8 卡 H20-141G 推理性能测试 Inkling 是由 Thinking Machines Lab 发布的新一代开源多模态大语言模型,采用 Mixture-of-Experts(MoE)Transformer 架构,支持文本、图像和音频等多模态输入,并生成文本输出。模型拥有约 975B 总参数、41B 激活参数,并支持最长 1M t 阅读全文
posted @ 2026-07-21 11:26 GPUStack 阅读(154) 评论(0) 推荐(1)
摘要: Day 0 实测|在 GPUStack 上部署 GLM-5.2-FP8-DSpark 本文由 GPUStack 社区用户实测分享整理。GLM-5.2-FP8-DSpark 是在 GLM-5.2-FP8 基础上,通过挂载 RedHatAI 提供的外置草稿模型(Speculator)做投机解码(Speculative Decoding)的增强方案——同一份主模型权重,额外加载一个草稿模型,用来提升解码吞吐。社区用户在模型放出当天(Day 0)就在 **8 卡 H20-141G** 环境上,通过 GPUStack 完成了部署,并和原生 GLM-5.2-FP8 做了同硬件对比压测。 阅读全文
posted @ 2026-07-14 22:59 GPUStack 阅读(316) 评论(0) 推荐(1)
摘要: GPUStack 全新的 用量统计(Usage) 功能正式上线了——Token 消耗、GPU/CPU 实例运行时长、存储容量占用,三类资源的消耗一目了然。谁在用、用了多少、花在了哪个模型上,再也不用靠猜。 阅读全文
posted @ 2026-07-07 11:32 GPUStack 阅读(212) 评论(0) 推荐(2)