随笔分类 - GPU
摘要:环境:腾讯云 TKE,北京区,RTX 5090D 8 卡节点;nvidia-device-plugin 从 v0.14.5 对比到 v0.18.2-tke.1。 目标:验证 2 卡 Pod 是否能稳定拿到拓扑关系更近的 GPU,避免跨 NUMA 的 SYS 组合。 结论先放前面 这次升级解决的是“2
阅读全文
摘要:Kubernetes GPU Deployment 没有空闲 GPU 时如何快速重启所有 Pod 环境和问题 环境假设: Kubernetes 集群 Deployment 里的 Pod 申请 GPU,例如 nvidia.com/gpu: 1 集群里没有空闲 GPU 目标是快速重启这个 Deploym
阅读全文
摘要:在一个跑 GPU 推理的 Kubernetes 集群里,所有工作负载都是手工固定副本数:忙时副本不够、请求排队,闲时一堆 GPU 空转。GPU 又是整个集群最贵的资源,这种"按峰值常备"的浪费很扎眼。 要解决它,绕不开三个名字:原生 HPA、事件驱动的 KEDA、以及云厂商的预测式弹性(以阿里云 A
阅读全文
摘要:一句话结论:GPU "掉卡 / 冻卡"(Xid 119 GSP Timeout)发生时,指标层会集体说谎——kube_node_status_capacity 还是满的、DCGM_FI_DEV_XID_ERRORS 恒 0、功耗 / 温度 / 利用率冻在"空闲档"。唯一没被骗的是宿主机内核日志里的
阅读全文
摘要:一句话:给 GPU 集群做"掉卡"告警,我先想用"卡数变少"和"报错码"来发现坏卡,结果都失灵;改用"指标冻住不动"来判断,又被"其实是没采到数据"坑了误报;最后发现把测试环境排掉,告警就干净了。 下面讲清这三步。文中 IP、Pod 名均为占位。 环境 每节点 8 张 GPU,跑在 k8s 上; d
阅读全文
摘要:Kubernetes 节点 GPU 显示 13 卡可用实际 0 卡可调度:vcluster fake-node 标签丢失定位 结论先放上:当 kubectl top 或自己写 jq 算出来的"GPU 节点利用率"显示某个集群还有 10+ 张卡可用、但业务 pod 就是调不上去时,不要急着扩容、不要急
阅读全文
摘要:ACK 节点 NodeHasDiskPressure / EvictionThresholdMet 告警排查:磁盘压力自愈,为何没有 Pod 被驱逐 半夜收到一条「高级」告警:集群驱逐事件 / Attempting to reclaim ephemeral-storage,节点 NodeHasDis
阅读全文
摘要:Kubernetes GPUAllocatableError 排查:Pod 内 nvidia-smi Unable to determine the device handle ... Unknown Error + 安全 drain 迁移(RTX 5090 / torch 2.8 / CUDA 1
阅读全文
摘要:https://www.nvidia.cn/geforce/drivers/ wget -c https://us.download.nvidia.com/XFree86/Linux-x86_64/550.90.07/NVIDIA-Linux-x86_64-550.90.07.run wget -c
阅读全文

浙公网安备 33010602011771号