随笔分类 -  GPU

摘要:环境:腾讯云 TKE,北京区,RTX 5090D 8 卡节点;nvidia-device-plugin 从 v0.14.5 对比到 v0.18.2-tke.1。 目标:验证 2 卡 Pod 是否能稳定拿到拓扑关系更近的 GPU,避免跨 NUMA 的 SYS 组合。 结论先放前面 这次升级解决的是“2 阅读全文
posted @ 2026-07-29 16:01 Hello_worlds 阅读(30) 评论(0) 推荐(0)
摘要:Kubernetes GPU Deployment 没有空闲 GPU 时如何快速重启所有 Pod 环境和问题 环境假设: Kubernetes 集群 Deployment 里的 Pod 申请 GPU,例如 nvidia.com/gpu: 1 集群里没有空闲 GPU 目标是快速重启这个 Deploym 阅读全文
posted @ 2026-07-27 11:55 Hello_worlds 阅读(24) 评论(0) 推荐(0)
摘要:在一个跑 GPU 推理的 Kubernetes 集群里,所有工作负载都是手工固定副本数:忙时副本不够、请求排队,闲时一堆 GPU 空转。GPU 又是整个集群最贵的资源,这种"按峰值常备"的浪费很扎眼。 要解决它,绕不开三个名字:原生 HPA、事件驱动的 KEDA、以及云厂商的预测式弹性(以阿里云 A 阅读全文
posted @ 2026-06-26 20:45 Hello_worlds 阅读(68) 评论(0) 推荐(0)
摘要:一句话结论:GPU "掉卡 / 冻卡"(Xid 119 GSP Timeout)发生时,指标层会集体说谎——kube_node_status_capacity 还是满的、DCGM_FI_DEV_XID_ERRORS 恒 0、功耗 / 温度 / 利用率冻在"空闲档"。唯一没被骗的是宿主机内核日志里的 阅读全文
posted @ 2026-06-11 11:14 Hello_worlds 阅读(166) 评论(0) 推荐(0)
摘要:一句话:给 GPU 集群做"掉卡"告警,我先想用"卡数变少"和"报错码"来发现坏卡,结果都失灵;改用"指标冻住不动"来判断,又被"其实是没采到数据"坑了误报;最后发现把测试环境排掉,告警就干净了。 下面讲清这三步。文中 IP、Pod 名均为占位。 环境 每节点 8 张 GPU,跑在 k8s 上; d 阅读全文
posted @ 2026-06-08 16:38 Hello_worlds 阅读(128) 评论(0) 推荐(0)
摘要:Kubernetes 节点 GPU 显示 13 卡可用实际 0 卡可调度:vcluster fake-node 标签丢失定位 结论先放上:当 kubectl top 或自己写 jq 算出来的"GPU 节点利用率"显示某个集群还有 10+ 张卡可用、但业务 pod 就是调不上去时,不要急着扩容、不要急 阅读全文
posted @ 2026-06-01 14:40 Hello_worlds 阅读(39) 评论(0) 推荐(0)
摘要:ACK 节点 NodeHasDiskPressure / EvictionThresholdMet 告警排查:磁盘压力自愈,为何没有 Pod 被驱逐 半夜收到一条「高级」告警:集群驱逐事件 / Attempting to reclaim ephemeral-storage,节点 NodeHasDis 阅读全文
posted @ 2026-05-28 14:51 Hello_worlds 阅读(42) 评论(0) 推荐(1)
摘要:Kubernetes GPUAllocatableError 排查:Pod 内 nvidia-smi Unable to determine the device handle ... Unknown Error + 安全 drain 迁移(RTX 5090 / torch 2.8 / CUDA 1 阅读全文
posted @ 2026-05-28 10:32 Hello_worlds 阅读(61) 评论(0) 推荐(1)
摘要:https://www.nvidia.cn/geforce/drivers/ wget -c https://us.download.nvidia.com/XFree86/Linux-x86_64/550.90.07/NVIDIA-Linux-x86_64-550.90.07.run wget -c 阅读全文
posted @ 2025-07-08 11:00 Hello_worlds 阅读(63) 评论(0) 推荐(0)