随笔分类 -  Prometheus

摘要:在一个跑 GPU 推理的 Kubernetes 集群里,所有工作负载都是手工固定副本数:忙时副本不够、请求排队,闲时一堆 GPU 空转。GPU 又是整个集群最贵的资源,这种"按峰值常备"的浪费很扎眼。 要解决它,绕不开三个名字:原生 HPA、事件驱动的 KEDA、以及云厂商的预测式弹性(以阿里云 A 阅读全文
posted @ 2026-06-26 20:45 Hello_worlds 阅读(40) 评论(0) 推荐(0)
摘要:一句话结论:GPU "掉卡 / 冻卡"(Xid 119 GSP Timeout)发生时,指标层会集体说谎——kube_node_status_capacity 还是满的、DCGM_FI_DEV_XID_ERRORS 恒 0、功耗 / 温度 / 利用率冻在"空闲档"。唯一没被骗的是宿主机内核日志里的 阅读全文
posted @ 2026-06-11 11:14 Hello_worlds 阅读(100) 评论(0) 推荐(0)
摘要:想在自建监控里读阿里云 ARMS 托管 Prometheus 的指标,如果监控和 ARMS 不在同一个地域,你大概率会踩到这个坑:ARMS 的内网域名跨地域根本连不上,但它不是 CEN 没打通,而是这个内网域名是"地域级 anycast"——每个地域都把它解析到本地的服务 VIP。真正能跨地域直读的 阅读全文
posted @ 2026-06-08 17:15 Hello_worlds 阅读(25) 评论(0) 推荐(0)
摘要:一句话:给 GPU 集群做"掉卡"告警,我先想用"卡数变少"和"报错码"来发现坏卡,结果都失灵;改用"指标冻住不动"来判断,又被"其实是没采到数据"坑了误报;最后发现把测试环境排掉,告警就干净了。 下面讲清这三步。文中 IP、Pod 名均为占位。 环境 每节点 8 张 GPU,跑在 k8s 上; d 阅读全文
posted @ 2026-06-08 16:38 Hello_worlds 阅读(78) 评论(0) 推荐(0)
摘要:Kubernetes 上做日志收集,EFK(Elasticsearch + Fluentd + Kibana)很重,存储和运维成本都高。如果你的诉求是「把各 Pod 的 stdout/stderr 集中起来、能在 Grafana 里按标签查」,Loki + Promtail 是更轻的一套:不全文索引 阅读全文
posted @ 2026-06-03 18:40 Hello_worlds 阅读(54) 评论(0) 推荐(0)
摘要:Loki 报 ingestion rate limit exceeded、日志开始丢,要止血很简单——把限流调大就行。但调大之前得先回答一个更难的问题:到底是谁在疯狂刷日志? Loki 不像 Prometheus 有现成的 per-target 抓取量统计,你面对的只是一句 org_id=fake 阅读全文
posted @ 2026-06-03 15:11 Hello_worlds 阅读(20) 评论(0) 推荐(0)
摘要:夜莺 Nightingale 告警时间比实际晚 30 分钟:自定义 5xx exporter 时间窗"只跟不追"的根因排查 以下涉及的域名、主机名、IP、token 等均已替换为占位值,照搬到你自己的环境时换成实际值即可。 先把结论摆前面:告警通知里的"告警时间"不一定是事故发生时间。 当告警链路里 阅读全文
posted @ 2026-06-03 15:07 Hello_worlds 阅读(16) 评论(0) 推荐(0)
摘要:CPU 打满 99% 却不告警:node_exporter 过载失联(up==0)导致阈值告警静默失明 以下涉及的主机名、IP、域名等均已替换为占位值,照搬到你自己的环境时换成实际值即可。 先把结论摆前面:基于阈值的告警,隐含了一个你没意识到的前提——“数据还在”。 一旦机器过载到把采集器(node 阅读全文
posted @ 2026-06-02 15:36 Hello_worlds 阅读(30) 评论(0) 推荐(0)
摘要:一、项目目标 通过 Prometheus + Grafana 实现对阿里云账号下所有一级域名的自动监控,涵盖以下内容: 获取一级域名列表及其解析记录 监控域名注册到期时间 监控域名对应 SSL 证书到期时间 指标统一采集至 Prometheus Grafana 实现可视化和告警 二、版本信息 阅读全文
posted @ 2025-06-28 00:23 Hello_worlds 阅读(180) 评论(0) 推荐(0)
摘要:exporter 指标 说明 示例 示例说明 gpu-exporter nvidia_gpu_num_devices 节点上GPU总数量 gpu-exporter nvidia_gpu_allocated_num_devices 节点已经分配的GPU数量 节点 nvidia_gpu_allocate 阅读全文
posted @ 2025-05-27 17:47 Hello_worlds 阅读(180) 评论(0) 推荐(0)
摘要:需求拆解 1.我们在kubernetes集群中部署了n多个go服务 2.我们已经有了一套在kubernetes集群之外部署的Prometheus 3.现在我们需要监控所有服务去qps 4.监控起来之后需要在grafana上通过不通的研发部门{北京 上海两个研发部门}进行展示 5.现在想通过要将qps 阅读全文
posted @ 2024-12-10 11:36 Hello_worlds 阅读(293) 评论(0) 推荐(0)
摘要:对网络io的监控对磁盘的监控非常相似,主要包括以下指标 1、接受的总字节数 container_network_receive_bytes_total 2、发送的总字节数 container_network_transmit_bytes_total 这两个参数分别对应网络的下行(网络读)和上行(网络 阅读全文
posted @ 2021-11-29 21:46 Hello_worlds 阅读(951) 评论(0) 推荐(0)
摘要:容器中的磁盘I/O监控指标主要包括 1、磁盘写总量 container_fs_writes_bytes_total 2、磁盘读总量 container_fs_reads_bytes_total 针对磁盘IO需要注意以下两点 1、读写是针对设备的,没有设备都有不同的读写速率 2、写速率监控智能获取直接 阅读全文
posted @ 2021-11-29 21:33 Hello_worlds 阅读(755) 评论(0) 推荐(0)
摘要:在容器内进行内存监控的常用指标包括 1、 内存中的cache用量 container_memory_cache 2、 常驻的内存用量 container_memory_rss 3、 交换分区用量 container_memory_swap 4、 内存的总占用量 container_memory_us 阅读全文
posted @ 2021-11-29 20:49 Hello_worlds 阅读(1880) 评论(0) 推荐(0)
摘要:k8s通过request(下限)和limit(上限)限制容器的CPU和内存的使用范围 在容器运行的过程中需要实时监控容器对cpu的使用情况 1、 容器用户态占用CPU的时间总和 container_cpu_user_seconds_total 2、 容器内核态占用CPU的时间总和 container 阅读全文
posted @ 2021-11-29 20:12 Hello_worlds 阅读(3178) 评论(0) 推荐(0)