摘要:
很多 SRE 团队都有一个很微妙的变化。 过去大家最焦虑的是“没有监控”。 机器有没有指标? 服务有没有大盘? 接口有没有成功率? 日志能不能查? 链路有没有 Trace? 告警能不能发到群里? 这些问题在很多公司已经基本解决了。 Prometheus 有了,Grafana 有了,日志平台有了,AP 阅读全文
posted @ 2026-06-09 20:13
IT运维监控
阅读(31)
评论(0)
推荐(0)
摘要:
做过 on-call 的人都熟悉这几个瞬间: 半夜被一条告警吵醒,盯着手机想"这到底是真的挂了,还是又误报了",爬起来开电脑、翻指标、看邻居机器,二十分钟过去,结论是"虚惊一场"。 新接了一个业务,要给上百台机器配一套监控,PromQL、阈值、持续时间、通知规则一项项点,一两个小时就没了。 新人来值 阅读全文
posted @ 2026-06-09 10:33
IT运维监控
阅读(292)
评论(0)
推荐(0)

浙公网安备 33010602011771号