摘要: GPUStack v2:推理加速释放算力潜能,开源重塑大模型推理下半场 在大模型推理的下半场,GPUStack v2 不再是简单的模型服务平台,而是高性能推理生态的协调者与赋能者。 阅读全文
posted @ 2025-11-25 17:35 GPUStack 阅读(1762) 评论(0) 推荐(0)
摘要: 昇腾多机推理极速上手:10倍简化的 DeepSeek R1 超大规模模型部署 昇腾多机推理太复杂?易出错?试试 GPUStack 阅读全文
posted @ 2025-09-27 10:55 GPUStack 阅读(868) 评论(1) 推荐(0)
摘要: 45分钟从零搭建私有MaaS平台和生产级的Qwen3模型服务 在 45 分钟内搭建 GPUStack 模型服务平台并运行生产级的 Qwen3 模型服务。 阅读全文
posted @ 2025-04-29 17:07 GPUStack 阅读(1714) 评论(0) 推荐(0)
摘要: GPUStack正式发布: 为大模型而生的开源GPU集群管理器 GPUStack 正式发布并开源,一个用于运行 LLM(大型语言模型)的开源 GPU 集群管理器。 阅读全文
posted @ 2024-07-26 16:15 GPUStack 阅读(9775) 评论(0) 推荐(0)
摘要: 怎么优雅地在GPUStack上使用minerU? 本文由 GPUStack 社区用户投稿整理,介绍如何将 MinerU Fast API 接入 GPUStack,通过自定义推理后端实现复杂 PDF 解析服务的部署与调用。 阅读全文
posted @ 2026-07-24 18:23 GPUStack 阅读(61) 评论(0) 推荐(0)
摘要: Day 0 实测|在 GPUStack 上部署 Inkling-BF16:8 卡 H20-141G 推理性能测试 Inkling 是由 Thinking Machines Lab 发布的新一代开源多模态大语言模型,采用 Mixture-of-Experts(MoE)Transformer 架构,支持文本、图像和音频等多模态输入,并生成文本输出。模型拥有约 975B 总参数、41B 激活参数,并支持最长 1M t 阅读全文
posted @ 2026-07-21 11:26 GPUStack 阅读(119) 评论(0) 推荐(1)
摘要: Day 0 实测|在 GPUStack 上部署 GLM-5.2-FP8-DSpark 本文由 GPUStack 社区用户实测分享整理。GLM-5.2-FP8-DSpark 是在 GLM-5.2-FP8 基础上,通过挂载 RedHatAI 提供的外置草稿模型(Speculator)做投机解码(Speculative Decoding)的增强方案——同一份主模型权重,额外加载一个草稿模型,用来提升解码吞吐。社区用户在模型放出当天(Day 0)就在 **8 卡 H20-141G** 环境上,通过 GPUStack 完成了部署,并和原生 GLM-5.2-FP8 做了同硬件对比压测。 阅读全文
posted @ 2026-07-14 22:59 GPUStack 阅读(188) 评论(0) 推荐(1)
摘要: GPUStack 全新的 用量统计(Usage) 功能正式上线了——Token 消耗、GPU/CPU 实例运行时长、存储容量占用,三类资源的消耗一目了然。谁在用、用了多少、花在了哪个模型上,再也不用靠猜。 阅读全文
posted @ 2026-07-07 11:32 GPUStack 阅读(147) 评论(0) 推荐(2)
摘要: 本文由 GPUStack 社区用户实测分享整理。DeepSeek-V4-Flash-DSpark 是在 DeepSeek-V4-Flash 基础上挂载了投机解码(Speculative Decoding)模块的增强版本——同一份权重,额外的投机模块,让吞吐和首 Token 时延同时变好。 社区用户拿 阅读全文
posted @ 2026-07-02 15:31 GPUStack 阅读(309) 评论(0) 推荐(1)
摘要: MiniMax-M3 开源实测:部署、推理与基准测试全记录 MiniMax-M3 是 MiniMax 最新开源的原生多模态大模型,约428B 总参数/23B激活参数,原生支持1M上下文。本文基于 GPUStack 与VLLM,演示从镜像与权重准备、模型部署、对话实测到基准测试的完整流程,并实测了基于 EAGLE3 的投机解码加速。 阅读全文
posted @ 2026-06-18 10:22 GPUStack 阅读(386) 评论(0) 推荐(0)
摘要: 没有 GPU,还能跑大模型吗?vLLM vs llama.cpp 实测对比 在没有 GPU 的情况下,大模型还能不能“真正可用”?本文基于 GPUStack,对 vLLM-CPU 与 llama.cpp 进行完整实测,对比两者在纯 CPU 环境下的部署方式、推理性能、高并发表现与实际适用场景。 关注 阅读全文
posted @ 2026-06-01 12:10 GPUStack 阅读(404) 评论(0) 推荐(1)
摘要: MiniCPM-V 4.6 部署实战:基于 GPUStack 与 SGLang 的端侧多模态模型部署 MiniCPM-V 4.6 是 1.3B 参数的轻量级多模态模型,支持图像、视频理解。本文演示了基于 GPUStack 与 SGLang 的部署、测试与视觉 token 压缩配置流程。 关注🌟⌈G 阅读全文
posted @ 2026-05-25 18:32 GPUStack 阅读(311) 评论(0) 推荐(0)
摘要: NVIDIA H200/H20 DeepSeek-V4-Pro 部署指南、压测性能与稳定性调优建议 NVIDIA H200/H20 141GB 环境部署 DeepSeek-V4-Pro 的实践教程、压测性能表现,以及针对压测表现提供的稳定性配置建议。 阅读全文
posted @ 2026-04-28 10:16 GPUStack 阅读(3764) 评论(3) 推荐(2)
摘要: Day 0 部署:昇腾 910B DeepSeek-V4 部署指南与压测表现 在昇腾 910B 环境部署 DeepSeek-V4 的实践教程。 阅读全文
posted @ 2026-04-27 13:05 GPUStack 阅读(3929) 评论(3) 推荐(5)