随笔分类 - 公有云-阿里云
摘要:ALB 日志里的 host 为什么不是负载均衡公网 IP 线上排查 Web 扫描日志时,经常会看到一个容易误判的现象:请求明明是从负载均衡公网 IP 进来的,但 ALB 或 Nginx 日志里的 host 却是另一个陌生 IP。 结论先说清楚:日志里的 host 记录的是 HTTP 请求头里的 Ho
阅读全文
摘要:环境和目标 这次要解决的是一个 PDF 下载头的问题:源站对象自带 Content-Disposition: Attachment,浏览器访问 PDF 时会下载;业务希望在 URL 带 query string 时删除这个响应头,让浏览器直接预览 PDF。 示例环境如下,真实落地时替换成自己的域名和
阅读全文
摘要:以下命令里的地域、VPC、TR、路由表、域名和 IP 都做了占位处理。为了让链路方向更容易读,本文用“杭州侧”表示 ACR 所在地域,用“泰国侧”表示 ACK 集群所在地域。落地时把 <REGION_A>、<REGION_B>、<CEN_ID>、<TR_*>、<VPC_*>、<ROUTE_TABLE
阅读全文
摘要:在一个跑 GPU 推理的 Kubernetes 集群里,所有工作负载都是手工固定副本数:忙时副本不够、请求排队,闲时一堆 GPU 空转。GPU 又是整个集群最贵的资源,这种"按峰值常备"的浪费很扎眼。 要解决它,绕不开三个名字:原生 HPA、事件驱动的 KEDA、以及云厂商的预测式弹性(以阿里云 A
阅读全文
摘要:一句话结论:这条「内存使用率超过 90%」的告警,是 DataWorks 的一个 ETL 任务反复跑同一条 insert,单条要吃 67 GiB(占满 60G 主机),把内存反复顶到 ~93% 触发的——其他所有来源加起来不到 1 GiB,可忽略。 下面是把它从「主机内存高」一层层追到「具体哪条 S
阅读全文
摘要:想在自建监控里读阿里云 ARMS 托管 Prometheus 的指标,如果监控和 ARMS 不在同一个地域,你大概率会踩到这个坑:ARMS 的内网域名跨地域根本连不上,但它不是 CEN 没打通,而是这个内网域名是"地域级 anycast"——每个地域都把它解析到本地的服务 VIP。真正能跨地域直读的
阅读全文
摘要:阿里云 CEN 与腾讯云 CCN 跨云专线打通:context deadline exceeded 超时排查 文中所有 IP、网段、资源 ID、域名、服务名均为占位示意,替换成你自己的即可。涉及两朵云的私网网段,统一约定:阿里云海外侧用 10.10.0.0/16,阿里云北京侧用 10.30.0.0/
阅读全文
摘要:CPU 打满 99% 却不告警:node_exporter 过载失联(up==0)导致阈值告警静默失明 以下涉及的主机名、IP、域名等均已替换为占位值,照搬到你自己的环境时换成实际值即可。 先把结论摆前面:基于阈值的告警,隐含了一个你没意识到的前提——“数据还在”。 一旦机器过载到把采集器(node
阅读全文
摘要:结论 这次故障可以收敛成两个结论: 节点 Ready 不代表每张 GPU 都健康。 某张卡已进入 GPU requires reset、内核报 Xid 119 和 Xid 154,但 kubectl get node 仍是 Ready,CPU、内存、Pod 状态都正常。只看控制面会得到"节点没问题"
阅读全文
摘要:ACK 节点 NodeHasDiskPressure / EvictionThresholdMet 告警排查:磁盘压力自愈,为何没有 Pod 被驱逐 半夜收到一条「高级」告警:集群驱逐事件 / Attempting to reclaim ephemeral-storage,节点 NodeHasDis
阅读全文
摘要:自托管 Sentry 安全加固实录:从 Google 钓鱼告警到 nginx 路径级白名单 一句话总结:阿里云 CLB 的 ACL 是绑在监听层的,按客户端 IP 一刀切。对自托管 Sentry 这种「admin 要严格白名单 + SDK 上报路径要公网开放」的混合场景,CLB 拦不住该拦的(搜索引
阅读全文
摘要:根因分析,域名的dns指向到了新的alb上,但是客户段本地有缓存(对应的dns还是指向了老的alb上) 解决方案:两套alb同时共存,指向同样的服务,dns上做负载权重。等客户段的缓存实效后根据dns上的权重自动切换到新的alb上
阅读全文
摘要:aws的cloudfront 可以把访问日志采集到s3,aws也有日志查看的功能,但是用起来不不好用,而且每次查看日志的时候还要登陆aws的账号去查看。 考虑到业务日志也在阿里云的sls上,所以就把日志放到sls上做统一展示和查看 大致的架构 cloudfront -> s3 -> ecs(和sls
阅读全文
摘要:https://www.nvidia.cn/geforce/drivers/ wget -c https://us.download.nvidia.com/XFree86/Linux-x86_64/550.90.07/NVIDIA-Linux-x86_64-550.90.07.run wget -c
阅读全文
摘要:一、项目目标 通过 Prometheus + Grafana 实现对阿里云账号下所有一级域名的自动监控,涵盖以下内容: 获取一级域名列表及其解析记录 监控域名注册到期时间 监控域名对应 SSL 证书到期时间 指标统一采集至 Prometheus Grafana 实现可视化和告警 二、版本信息
阅读全文
摘要:常见的收集方式 filebeat->kafka->logstash->es 阿里云ACK日志收集 ack->sls 这里要说的是我们传统意义上是通过收集pod或者node节点上的 .log日志文件进行收集日志,在ack里面可以不用通过收集.log的方式进行日志收集。具体的操作看下面的步骤 1 开始操
阅读全文

浙公网安备 33010602011771号