摘要: 通过选择 GPU 类型、计算框架版本、推理后端、服务器架构等条件,动态生成对应的 GPUStack 容器镜像列表,并提供镜像准备与离线部署参考命令。 阅读全文
posted @ 2026-03-13 17:42 GPUStack 阅读(923) 评论(0) 推荐(0)
摘要: 通过 GPUStack 提供高效的模型部署与管理能力,并将模型接入 MaxKB,即可轻松构建具备知识库检索 + 智能问答能力的 AI 助手。 阅读全文
posted @ 2026-03-10 09:49 GPUStack 阅读(134) 评论(0) 推荐(0)
摘要: 随着大模型进入生产环境,AI推理基础设施的复杂度快速上升。GPUStack v2.1 重点增强六大核心能力,为企业构建统一、高性能的AI模型服务平台 阅读全文
posted @ 2026-03-09 14:49 GPUStack 阅读(404) 评论(0) 推荐(0)
摘要: 随着大模型应用规模持续扩张,如何在有限算力条件下提升推理效率,已成为 AI 基础设施建设的核心课题。 GPUStack 致力于统一管理异构 GPU 资源,实现高性能、稳定且可扩展的 AI 模型服务。在这一背景下,GPUStack 与 SOAR 2026 合作,为开发者提供了一个探索硬件潜能、突破架构 阅读全文
posted @ 2026-03-06 14:51 GPUStack 阅读(29) 评论(0) 推荐(0)
摘要: 本文基于 AI Max 395(搭载 AMD Ryzen AI Max+ 395 处理器)硬件平台,完整记录了通过 GPUStack 开源集群管理平台,本地部署 AgentCPM 系列模型并接入 DeepResearch 能力的全流程实践。 阅读全文
posted @ 2026-03-04 10:53 GPUStack 阅读(1595) 评论(0) 推荐(0)
摘要: Token 不再焦虑:用 GPUStack + OpenClaw 搭一个“无限用”的本地 AI 助手 关注🌟⌈GPUStack⌋ 💻一起学习 AI、GPU 管理与大模型相关技术实践。 这两年,越来越多团队把 AI 接入了日常工作流。 但很快,一个现实问题摆在了面前: 模型用得越多,Token 花得越快,成本和心理压力也随之上涨。 很多人一边依赖 AI 提效,一边又不得不「省着用」「少让它多想」。 阅读全文
posted @ 2026-03-02 16:56 GPUStack 阅读(1573) 评论(2) 推荐(0)
摘要: 最近,推理引擎领域出现了两件具有标志意义的事件:vLLM 和 SGLang 相继走向公司化。vLLM 核心团队成立 Inferact,完成 1.5 亿美元融资,估值达 8 亿美元: 图源:Inferact SGLang 团队也成立了 RadixArk,同样获得融资,估值达到 4 亿美元: 图源:Ra 阅读全文
posted @ 2026-02-03 11:25 GPUStack 阅读(206) 评论(0) 推荐(0)
摘要: GPUStack 实战:n8n 接入本地模型,零成本打造 AI 资讯助手 通过 n8n 接入 GPUStack 本地模型,构建一个自动抓取 RSS、生成摘要并邮件推送的 AI 资讯助手。全流程本地运行,零 API 成本,数据不出域,快速体验私有化 AI 自动化。 阅读全文
posted @ 2026-01-23 12:28 GPUStack 阅读(234) 评论(0) 推荐(0)
摘要: GPUStack 自定义后端系列 | MinerU:打造超强 PDF 文档解析服务 GPUStack v2 自定义后端功能实战!本文以 MinerU 为例,手把手教你快速接入并运行超强 PDF 解析工具,轻松构建私有化文档提取服务。 阅读全文
posted @ 2026-01-09 11:48 GPUStack 阅读(1138) 评论(0) 推荐(0)
摘要: 释放H200全部潜力:DeepSeek-V3.2推理性能提升161%的优化秘籍 相比于未优化的 vLLM 基线,经过针对性调优的 DeepSeek-V3.2 在 NVIDIA H200 集群上实现了 57.8% 至 153.6% 的吞吐量提升。 阅读全文
posted @ 2026-01-06 15:38 GPUStack 阅读(526) 评论(0) 推荐(1)