上一页 1 2 3 4 5 6 7 8 9 ··· 24 下一页
摘要: Loki 报 ingestion rate limit exceeded、日志开始丢,要止血很简单——把限流调大就行。但调大之前得先回答一个更难的问题:到底是谁在疯狂刷日志? Loki 不像 Prometheus 有现成的 per-target 抓取量统计,你面对的只是一句 org_id=fake 阅读全文
posted @ 2026-06-03 15:11 Hello_worlds 阅读(33) 评论(0) 推荐(0)
摘要: 夜莺 Nightingale 告警时间比实际晚 30 分钟:自定义 5xx exporter 时间窗"只跟不追"的根因排查 以下涉及的域名、主机名、IP、token 等均已替换为占位值,照搬到你自己的环境时换成实际值即可。 先把结论摆前面:告警通知里的"告警时间"不一定是事故发生时间。 当告警链路里 阅读全文
posted @ 2026-06-03 15:07 Hello_worlds 阅读(25) 评论(0) 推荐(0)
摘要: CPU 打满 99% 却不告警:node_exporter 过载失联(up==0)导致阈值告警静默失明 以下涉及的主机名、IP、域名等均已替换为占位值,照搬到你自己的环境时换成实际值即可。 先把结论摆前面:基于阈值的告警,隐含了一个你没意识到的前提——“数据还在”。 一旦机器过载到把采集器(node 阅读全文
posted @ 2026-06-02 15:36 Hello_worlds 阅读(43) 评论(0) 推荐(0)
摘要: Ubuntu 22.04 二进制部署 Pika 3.5.1(systemd 托管 + 密码认证 + 日志清理) Pika 是 360 开源、协议兼容 Redis 的磁盘型 KV 存储(底层 RocksDB),适合数据量超过内存、又想沿用 Redis 客户端的场景。本文给一套可直接照抄的单机部署方案: 阅读全文
posted @ 2026-06-02 15:23 Hello_worlds 阅读(39) 评论(0) 推荐(0)
摘要: Kubernetes 节点 GPU 显示 13 卡可用实际 0 卡可调度:vcluster fake-node 标签丢失定位 结论先放上:当 kubectl top 或自己写 jq 算出来的"GPU 节点利用率"显示某个集群还有 10+ 张卡可用、但业务 pod 就是调不上去时,不要急着扩容、不要急 阅读全文
posted @ 2026-06-01 14:40 Hello_worlds 阅读(38) 评论(0) 推荐(0)
摘要: Kafka InconsistentClusterIdException 导致容器无限重启,磁盘打满排查与修复 环境 组件 版本 OS Ubuntu 22.04 Docker 24.x Kafka bitnami/kafka:3.1 ZooKeeper bitnami/zookeeper:lates 阅读全文
posted @ 2026-06-01 11:37 Hello_worlds 阅读(118) 评论(0) 推荐(0)
摘要: Jenkins Git Parameter "The default value has been returned" 排查与修复 某天测试同学在 Jenkins 上构建 Android 包,参数页一打开就跳出一连串红色错误,分支下拉框是空的,只剩一个默认值 origin/master: The d 阅读全文
posted @ 2026-05-29 11:28 Hello_worlds 阅读(70) 评论(0) 推荐(0)
摘要: 结论 这次故障可以收敛成两个结论: 节点 Ready 不代表每张 GPU 都健康。 某张卡已进入 GPU requires reset、内核报 Xid 119 和 Xid 154,但 kubectl get node 仍是 Ready,CPU、内存、Pod 状态都正常。只看控制面会得到"节点没问题" 阅读全文
posted @ 2026-05-29 11:12 Hello_worlds 阅读(72) 评论(0) 推荐(0)
摘要: Sentry 客户端上报全部 403:event submission rejected with_reason: ProjectId 排查 环境:Sentry self-hosted 26.5.0、Relay 26.5.0、Postgres 14.22、ClickHouse 24.x;客户端 SD 阅读全文
posted @ 2026-05-28 18:56 Hello_worlds 阅读(45) 评论(0) 推荐(0)
摘要: ACK 节点 NodeHasDiskPressure / EvictionThresholdMet 告警排查:磁盘压力自愈,为何没有 Pod 被驱逐 半夜收到一条「高级」告警:集群驱逐事件 / Attempting to reclaim ephemeral-storage,节点 NodeHasDis 阅读全文
posted @ 2026-05-28 14:51 Hello_worlds 阅读(40) 评论(0) 推荐(1)
上一页 1 2 3 4 5 6 7 8 9 ··· 24 下一页