Slurm 由 SchedMD LLC (现隶属于 NVIDIA) 的工程师开发并维护,这些工程师具备深厚的高性能计算 (HPC) 和 AI 专业知识。
SchedMD LLC,Slurm 工作负载管理器的主要开发维护公司,HPC/AI 集群调度领域的核心厂商,2025‑12‑15 被 NVIDIA 收购NVIDIA
基础信息
- 成立:2010 年,创始人 Morris Jette、Danny Auble(Slurm 原始核心开发者)
- 总部:美国犹他州 Lehi
- CEO:Danny Auble
- 官网:https://www.schedmd.com/
- 商业模式:Slurm 完全开源免费;公司靠商业技术支持、咨询、培训、定制开发盈利抖音百科。
核心产品
- Slurm(Simple Linux Utility for Resource Management) 开源 HPC/AI 集群作业调度与资源管理器。
- 全球超半数 TOP500 超算在用;大模型训练集群广泛使用,管理 GPU、CPU 节点任务排队、资源分配、记账、配额、抢占。
- 起源:2001 年 LLNL 实验室发起,2010 年后 SchedMD 接管主导开发。
- Slinky:开源项目,打通 Slurm ↔ Kubernetes,允许在 K8s 环境运行 Slurm 集群,面向异构 GPU 算力集群SchedMD。
收购事件(2025‑12‑15,NVIDIA)NVIDIA
- NVIDIA 收购 SchedMD,承诺 Slurm 继续保持开源、厂商中立,不闭源,继续支持 Intel/AMD 等其他硬件。
- 收购目的:补齐 AI 算力栈,从芯片、网络(Mellanox)、K8s 调度(run:ai)再到传统 HPC 调度 Slurm,完成垂直软件栈布局。交易金额未对外披露。
Slurm 典型能力
- 可扩展至百万 CPU 核、数万 GPU;支持作业排队、资源预留、记账统计、权限配额、故障容错;插件架构高度可定制NVIDIA。
- 常用命令:
sbatch/srun/sacct/scontrol/sinfo。
行业地位
超算中心、科研机构、AI 大模型训练集群的事实标准调度器;国内很多超算、智算中心都部署 Slurm,同时也有国产调度器做替代。
- [SchedMD · GitHub](https://github.com/SchedMD)
- [GitHub - SchedMD/slurm: Slurm: A Highly Scalable Workload Manager · GitHub](https://github.com/SchedMD/slurm)
- [Slurm Workload Manager - Documentation](https://slurm.schedmd.com/documentation.html)
- [Slurm:开源的 HPC 和 AI 工作负载管理器 | NVIDIA](https://www.nvidia.cn/software/slurm/)
- [HPC-搭建Slurm计算集群--GPU云服务器-火山引擎](https://docs.volcengine.com/docs/6419/114305?lang=zh)
- [Slurm 作业调度系统 - 上海交大超算平台用户手册](https://docs.hpc.sjtu.edu.cn/job/slurm.html)
- [ARM 节点使用文档 - 上海交大超算平台用户手册](https://docs.hpc.sjtu.edu.cn/job/arm.html)

浙公网安备 33010602011771号