在云原生与AI大模型浪潮交汇的2025年,如何高效、统一地管理日益复杂的异构AI算力,成为企业构建智能基础设施的核心挑战。开源项目HAMi,在这一年完成了从单一的GPU虚拟化调度器到云原生AI基础设施中流砥柱的华丽蜕变。它不仅解决了多厂商硬件兼容的难题,更在生产环境中证明了其作为异构AI计算虚拟化中间件的巨大价值,为云平台实现算力资源的高效云部署与云服务提供了关键支撑。
年度飞跃:从社区认可到生产级验证
2024年进入CNCF沙箱是HAMi的“入场券”,而2025年则是其用硬核实力证明自己的“舞台”。这一年,HAMi的定位从“GPU调度器”升级为“异构AI计算虚拟化中间件”,其支持范围从NVIDIA GPU扩展到华为昇腾、寒武纪MLU、沐曦、天数智芯等11种以上的AI加速器,实现了真正的统一管理与调度。
更关键的是,HAMi经受住了大规模生产环境的考验。贝壳找房、DaoCloud、顺丰科技等企业的AI平台基于HAMi稳定运行,处理着千万级的日请求,服务数百家企业用户。社区数据同样亮眼:97位贡献者,433次代码提交,版本从v2.5.0迭代至v2.8.0,下半年社区活跃度显著攀升。这标志着HAMi已从一个技术项目,成长为支撑企业级云原生AI平台的关键组件。

技术内核:构建统一的异构算力抽象层
2025年HAMi最核心的技术演进,是构建了一个不绑定任何单一硬件的、统一的异构算力抽象层。这为中国AI基础设施的自主可控提供了切实可行的云原生技术路径。
- 广泛的硬件生态:支持NVIDIA、华为昇腾、沐曦、燧原、昆仑芯、海光、寒武纪等主流及国产AI芯片,形成了业界最全面的支持列表。
- 深度特性适配:不仅支持基础设备插件,更实现了如华为昇腾的vNPU(虚拟NPU)切分、沐曦MetaX sGPU的应用级隔离、燧原GCU的完整虚拟化等高级特性。
- 打破调度壁垒:通过与清程极智Bagualu软件栈等合作,实现了对海光DCU等多架构算力的统一池化管理,有效解决了“硬件割裂”导致的调度难题。
这使得用户可以在同一个Kubernetes集群中混合部署不同品牌的AI加速卡,并通过HAMi获得一致的虚拟化与调度体验,极大提升了云平台资源管理的灵活性和效率。

️ 夯实基石:生产级可靠性与可观测性
要成为企业云服务的可靠基石,稳定性和可运维性至关重要。2025年,HAMi在生产级可靠性上做了大量加固:
- 高可用架构:基于leader-election实现调度器的高可用,避免单点故障。
- 安全与配额管控:在webhook加入资源配额检查,防止超额申请;在调度路由增加防护,抵御潜在DoS攻击。
- 智能运维:提供详细的调度失败原因和标准化错误码,并引入两级日志系统,帮助运维人员快速定位问题。
在监控与可观测性方面,HAMi完善了与云原生监控栈的集成:
- 为scheduler和device-plugin新增ServiceMonitor支持,便于接入Prometheus生态。
- 在监控指标中增加设备类型标签,实现多厂商异构集群的精细化监控分析。
- 优化指标,防止标签组合过多导致的“基数爆炸”问题,保障监控系统稳定。
同时,HAMi引入了对容器设备接口(CDI)模式的支持,通过 deviceListStrategy 配置项提供更规范、可移植的设备管理方式,为与Kubernetes生态深度集成铺平道路。
性能与体验:为开发者与大规模集群赋能
面对日益增长的大规模AI计算需求,HAMi在性能和开发者体验上持续优化:
- 性能提升:将节点锁从全局锁优化为细粒度锁,显著减少大规模集群下的锁竞争,提升并发调度性能。
- 开发测试友好:集成Mock设备插件,解决了特定资源名无法上报的问题,为开发和测试环境提供了完整的设备模拟能力,加速迭代周期。
- 部署简化:在Helm Chart中新增DRA(动态资源分配)安装选项,并支持证书热加载,提升了云部署和运维的灵活性。
- 质量保障:引入staticcheck等工具进行代码质量检查,确保持续交付的稳定性。
版本信息指标 hami_build_info 的实现,也让运维管理一目了然。这些改进共同降低了使用门槛,让开发者能更专注于AI应用本身,而非底层基础设施的复杂性。
生态融合:从独立项目到云原生AI调度核心
2025年,HAMi积极向上游云原生生态集成,从一个独立解决方案演变为生态中的关键调度组件:
- 与Kubernetes标准对齐:实现Kubernetes DRA标准的支持,深度集成原生动态资源分配机制。
- 调度器生态打通:与Volcano批量调度器深度集成,支持vNPU模式;被Koordinator纳入官方GPU共享方案;积极适配Kueue批调度系统。
- 主流AI框架兼容:修复与vLLM框架的兼容性问题,确保LLM任务资源合理分配;通过Helm Chart原生支持Xinference推理框架,实现多模型安全共享GPU。
这些集成工作意味着,用户可以在熟悉的Kubernetes生态和AI框架(如vLLM)中,无缝使用HAMi提供的异构算力管理能力,例如通过 nvidia.com/gpucores、nvidia.com/gpumem-percentage 等参数传递GPU资源。HAMi已深深嵌入云原生AI的技术栈,成为连接底层异构硬件与上层AI应用的关键桥梁。

社区驱动:开放治理与多元共荣
HAMi的快速发展离不开其活跃、开放的社区。项目采用开放治理模式,最初由密瓜智能与NVIDIA工程师推动,随后第四范式等企业开发者加入维护,形成了多核心协作的治理体系。
2025年,社区在上海和北京成功举办了以“不卷算力卷效率”为主题的Meetup,汇聚了来自CNCF、蔚来、沐曦、星环科技、海光信息、贝壳等公司的实战专家,分享了大量LLMOps平台适配、vGPU推理集群实践等宝贵经验。同时,多位贡献者凭借在调度健壮性、设备管理、Web UI、官网建设等方面的突出贡献,晋升为Maintainer、Approver或Reviewer,社区角色体系日益完善。
这种由多元企业共同建设、基于真实生产需求驱动的模式,确保了HAMi技术的实用性和生态的可持续性,为其从CNCF Sandbox迈向Incubation阶段奠定了坚实的社区基础。
[AFFILIATE_SLOT_2]价值验证:企业级落地与效率革命
技术的价值最终由落地效果衡量。2025年,多家企业通过CNCF案例研究分享了使用HAMi带来的切实收益:
- 贝壳找房:AI平台GPU利用率从13%提升至37%,超万Pod同时运行,处理千万级日请求。
- DaoCloud:在超10个数据中心管理万张GPU卡,平均利用率超80%,运营成本降低20-30%。
- 顺丰科技:基于HAMi构建方案,实现57%的GPU资源节省率,大幅降低硬件与运营成本。
这些案例证明,HAMi通过高效的虚拟化、调度和资源共享,能够显著提升昂贵的AI算力利用率,直接转化为企业的经济效益和竞争优势,是构建高效、经济云原生AI基础设施的必然选择。
回顾过去一年,HAMi 项目如何从单一 GPU 虚拟化方案成长为支持 11+ 厂商异构 AI 加速器的统一平台。
总结与展望
回顾2025年,HAMi社区完成了一次深刻的进化:技术上,从支持单一GPU到统一调度十余种异构AI加速器;定位上,从独立调度器成长为云原生AI基础设施的核心组件;生态上,深度融入Kubernetes及主流AI框架生态;价值上,在众多企业生产环境中验证了其提升算力效率、降低成本的巨大能力。
展望未来,随着AI算力需求持续爆发和硬件生态进一步多元化,像HAMi这样能够提供统一、高效、开放的异构算力管理能力的云原生中间件,其重要性将愈发凸显。它不仅是解决当前算力管理痛点的利器,更是构建下一代敏捷、智能云平台的关键基石。HAMi的旅程,正是云原生技术赋能AI基础设施现代化的一个精彩缩影。
浙公网安备 33010602011771号