VCF 9.1 实验室 AI 落地方案:基于 OCuLink 外置 eGPU 直通 VKS 容器集群完整实操
搭建小型 VCF 私有 AI 实验室时,迷你主机 Minisforum MS-A2 凭借紧凑机身成为主流选型,但机箱内部空间受限,仅支持半高矮版 GPU,高端大显存显卡无法内置安装,极大限制 VMware Private AI Services(PAIS)、大模型推理等 AI 负载部署。VCF 9.1 原生支持 OCuLink 高速外置 PCIe 链路,搭配 DEG1 扩展坞可外接全尺寸 NVIDIA 高端 eGPU,并通过 DirectPath I/O 硬件直通交付给 vSphere Kubernetes Service(VKS)工作节点承载 AI 容器。本文完整梳理全套硬件物料清单、底层 ESXi 直通启用流程、VKS 专属 GPU 虚拟机类(VM Class)定制配置,重点拆解极易踩坑的 VKS 控制平面 / 工作节点资源隔离约束,给出标准化部署流程与故障规避要点,为预算有限的小型私有 AI 云提供低成本迷你硬件扩展方案。
一、方案背景与 OCuLink eGPU 技术优势
1.1 Minisforum MS-A2 主机原生硬件局限
MS-A2 是面向虚拟化实验室的紧凑型服务器,原生 PCIe 插槽仅兼容单槽半高显卡,可选型号仅有 RTX A2000、RTX 3050 等低显存规格,无法满足大参数 LLM、图像训练等高显存 AI 任务需求。此前内置 RTX 4000 Ada(20GB)仅能满足轻量 AI 测试,算力与显存上限很低。
而 OCuLink 作为原生外置 PCIe 4.0 x4 标准,区别于雷电协议封装转发,直接输出 PCIe 总线通道,带宽可达 64Gbps,几乎无传输损耗,能够外接完整尺寸桌面级 NVIDIA 显卡,完美解决迷你机箱内部硬件扩容瓶颈,大幅拓宽 AI 算力硬件选择范围。
1.2 方案业务价值
- 硬件成本压缩:无需采购标准 4U 机架 GPU 服务器,单台迷你主机即可搭建小型 AI VKS 集群;
- 算力灵活拓展:按需更换外置 eGPU,从推理卡升级至训练卡无需更换虚拟化主机;
- VCF 全栈兼容:直通硬件可交付原生 VKS 集群,无缝运行 VM 私有 AI 服务 PAIS、开源大模型容器;
- 轻量化运维:整机占地极小,适合研发实验室、小型企业测试环境。
二、整套 OCuLink eGPU 硬件 BOM 完整清单
部署该直通架构必须配齐全套专用硬件,缺一不可:
- 核心主机:Minisforum MS-A2 迷你虚拟化服务器(运行 VCF 9.1 ESXi)
- PCIe 4.0 x4 OCuLink 半高扩展卡:配套原装 OCuLink 高速数据线,插入主机内置 PCIe 插槽实现总线引出
rym {"type":"ImageRefCard","refs":["includegraphics22-1"],"titles":["OCuLink 扩展卡"]} 3. Minisforum DEG1 eGPU 外置扩展坞:OCuLink 信号转标准 PCIe 显卡插槽,承载桌面独显
rym {"type":"ImageRefCard","refs":["includegraphics22-2"],"titles":["DEG1 eGPU 扩展坞"]} 4. 独立供电单元:ATX/SFX 标准电源,为大功率 eGPU 单独供电,迷你主机内置电源无法支撑显卡功耗 5. AI 加速显卡:推荐 NVIDIA RTX 4000 Ada 20GB、RTX 4090 等大显存型号,适配 VCF PAIS 私有 AI 服务
硬件上电识别说明
完整接线顺序:先连接 OCuLink 线缆、接好显卡供电,再开启 DEG1 扩展坞电源,最后启动 MS-A2 主机;ESXi 开机后可自动识别外置 eGPU 硬件,无需额外底层驱动安装。若先开机后接坞站,主机无法热识别显卡,必须重启 ESXi 主机。
三、ESXi 底层:开启 eGPU DirectPath I/O 硬件直通
想要将外置显卡透传给 VKS 虚拟机,第一步需在 ESXi 主机层开启 PCI 直通功能,这是所有上层 VKS 配置的基础:
- 登录 vSphere Client,进入对应 MS-A2 ESXi 主机「配置→硬件→PCI 设备」;
- 在设备列表筛选识别 OCuLink 挂载的 NVIDIA eGPU 硬件条目;
- 选中目标显卡,点击「切换直通(Toggle Passthrough)」开启 DirectPath 模式;
- 重启 ESXi 主机使直通硬件配置永久生效。
校验命令(SSH 登录 ESXi 执行):
输出中显卡设备状态标注Passthrough Enabled即代表底层直通就绪。
四、VCF 9.1 VKS 核心配置:定制 GPU 专属 VM Class
VKS 集群不会自动识别直通 PCIe 硬件,必须创建包含 eGPU 直通设备的自定义虚拟机类(VM Class),VM Class 是 VCF 管控 VKS 节点资源分配的核心模板:
4.1 新建 GPU 专用 VM Class 操作步骤
- vSphere 客户端进入「工作负载管理→服务→VM 服务→VM 类」;
- 点击创建 VM 类,填写名称如
vks-gpu-worker-rtx4000; - 基础资源配置:匹配显卡负载预留充足 CPU、内存,内存必须 100% 全量预留(GPU 直通硬性要求,内存不预留会导致直通失败);
- PCI 直通配置项选择「是」,添加已开启直通的 eGPU 硬件(通过厂商 ID、设备 ID 匹配外置显卡);
- 保存 VM Class 模板,完成资源定义。
4.2 关键避坑:VKS 部署规范 —— 仅 Worker 节点绑定 GPU VM Class
VKS 集群分为控制平面节点与工作负载节点,系统默认会为两类节点同时匹配 VM Class,若不做部署规格覆盖,集群部署直接失败:
- 控制平面节点:仅负责 K8s 集群调度、管控,无需 GPU 硬件,必须使用普通无 GPU 标准 VM Class;
- Worker 工作节点:承载 AI 推理、训练容器,绑定上一步创建的
vks-gpu-worker-rtx4000带 GPU VM Class。
部署 VKS 集群时,必须修改部署规范进行覆盖,仅将自定义 GPU VM Class 应用至 Worker 实例组,控制平面保持通用资源模板,避免系统尝试为无 GPU 硬件的控制平面主机分配 PCI 设备,引发创建任务报错终止。
五、完整端到端部署执行流程
步骤 1 硬件链路搭建
依次安装 OCuLink 扩展卡、连接 DEG1 扩展坞、安装 NVIDIA 显卡并接通独立电源,上电顺序严格遵循先坞站后主机。
步骤 2 ESXi 底层直通配置
vSphere 开启 eGPU DirectPath I/O,重启主机,通过 esxcli 命令校验硬件直通状态。
步骤 3 构建 GPU 专用 VM Class
在 VM 服务中创建绑定 eGPU PCI 设备的虚拟机类,全量预留内存保障直通稳定性。
步骤 4 下发 VKS 集群,隔离节点资源模板
新建 VKS 工作负载集群,分别指定控制平面普通 VM Class、Worker GPU 专用 VM Class,完成部署规格覆盖。
步骤 5 集群验证与 AI 负载部署
- VKS 集群创建完成后登录 Worker 节点虚拟机,执行
nvidia-smi识别外置 OCuLink eGPU 显存与算力; - 部署 VMware Private AI Services(PAIS)私有 AI 平台,或运行 LLM、图像生成等 GPU 加速容器;
- 监控显卡算力调度,验证 OCuLink 链路无带宽瓶颈。
六、落地运维关键注意事项
- 上电顺序不可颠倒 先开 eGPU 扩展坞电源,再启动 ESXi 主机;热插拔 OCu 线缆、先开机后上电坞站均会导致 ESXi 无法识别显卡,必须重启整机恢复识别。
- 供电配套不可缩减 高端 NVIDIA eGPU 功耗高,DEG1 坞站必须搭配足额 ATX/SFX 电源,仅依靠迷你主机供电会出现显卡掉电、算力异常。
- VKS 节点模板隔离是核心故障点 绝大多数 OCuLink eGPU VKS 部署失败,根源是未区分控制平面与 Worker 的 VM Class,系统为控制平面请求 GPU 硬件,主机无对应设备直接终止部署,部署前务必确认实例组覆盖配置。
- 内存全量预留硬性约束 创建 GPU VM Class 时必须勾选「预留所有客户机内存」,未预留内存的虚拟机无法加载 PCI 直通硬件,启动直接蓝屏或硬件丢失。
- OCuLink 带宽适配场景 PCIe 4.0 x4 带宽足以支撑中小规模 AI 推理,大规模多轮训练建议选用原生内置 PCIe x16 机架主机;实验室测试、小模型推理场景 OCuLink 外置方案完全够用。
- 版本兼容性限制 该外置 eGPU 直通 VKS 完整功能仅 VCF 9.1 及配套 vSphere 9.1 支持,VCF 9.0 及旧版本无 VM Class 差异化覆盖能力,无法实现仅 Worker 节点分配 GPU。
七、方案适用场景总结
- 研发实验室私有 AI 测试环境:预算有限、空间狭小,不想采购标准 GPU 机架服务器,基于迷你主机快速搭建 VKS AI 集群;
- VMware PAIS 私有 AI 验证:用于企业内部大模型微调、AI 服务功能预演;
- 短期 AI 项目临时算力扩容:通过插拔 eGPU 扩展坞灵活增减显卡算力,无需重构 VCF 集群;
- 虚拟化技术教学环境:演示 PCIe 外置总线、硬件直通、Tanzu GPU 容器全链路技术。
八、方案总结
VCF 9.1 结合 Minisforum MS-A2 + OCuLink DEG1 外置扩展坞,突破迷你主机内置显卡规格限制,通过 DirectPath I/O 硬件直通将全尺寸 NVIDIA 高端 eGPU 交付 VKS 容器工作节点,是小型实验室搭建私有 AI 云轻量化最优方案。
整套落地核心分为三层:硬件 OCuLink 总线扩展、ESXi 主机 PCI 直通底层开关、VKS 差异化 VM Class 资源管控,其中区分控制平面与 Worker 节点虚拟机模板是保障部署成功的关键操作。该方案硬件投入低、部署灵活,完美适配轻量化 AI 推理、模型测试场景,填补小型 VCF 环境 GPU 算力扩容的技术空白。
注·部分内容为AI辅助生成
浙公网安备 33010602011771号