摘要: 概要 为什么要做监控 线上发布了服务,怎么知道它一切正常,比如发布5台服务器,如何直观了解是否有请求进来,访问一切正常。当年有一次将线上的库配置到了Beta,这么低级的错误,排错花了一个通宵,十几个人。某个核心服务挂了,导致大量报错,如何确定到底是哪里出了问题。SOA带来的问题,调用XX服务出问题, 阅读全文
posted @ 2017-09-11 08:45 欢醉 阅读(14470) 评论(3) 推荐(4)
摘要: 传统关系型数据库的分布式开发通常需要自己做,不仅耗时耗力而且效果不是很理想,当想快速搭建时,最初想到的是看有没有第三方,网上牛人还是很多的,做得比较好的其中之一Mycat,它是开源的分布式数据库系统,解决数据库的负载均衡,主备复制,读写分离,简单来说就是你只管直接与mycat通讯,至于分离什么的交给 阅读全文
posted @ 2017-02-21 08:58 欢醉 阅读(5576) 评论(8) 推荐(8)
摘要: 你真的会玩SQL吗?系列目录你真的会玩SQL吗?之逻辑查询处理阶段你真的会玩SQL吗?和平大使 内连接、外连接你真的会玩SQL吗?三范式、数据完整性你真的会玩SQL吗?查询指定节点及其所有父节点的方法你真的会玩SQL吗?让人晕头转向的三值逻辑你真的会玩SQL吗?EXISTS和IN之间的区别你真的会玩... 阅读全文
posted @ 2015-10-28 09:06 欢醉 阅读(15609) 评论(15) 推荐(32)
摘要: 昨天有个同事,甩了半页需求文档给 Claude Code,转身去接了杯热水的功夫,核心业务代码就写完了。 我凑过去扫了一眼,那段逻辑我前阵子刚做过类似的,前后调边界、改异常、跑测试,折腾了俩小时才收尾。 他前后加起来,十分钟。 那一下我真有点恍惚。 我这五年踩过的坑、摸出来的门道、踩雷踩出来的肌肉记 阅读全文
posted @ 2026-08-18 07:48 欢醉 阅读(270) 评论(0) 推荐(1)
摘要: 走管理还是走技术路线,其实一直都是程序员职业发展路上反复面对的选择——或主动,或被动。 一般在公司做得比较久的老员工,往往对业务非常熟悉,技术这块够用就行,技术难题有架构师或专人负责处理,从而做得比较多的是带几个新人、处理日常业务问题,这时也算是小小的组长或主管,但也不是纯管理。 然而业务体量越来越 阅读全文
posted @ 2026-08-11 07:31 欢醉 阅读(740) 评论(9) 推荐(1)
摘要: 事故现场 这次的背景是生产环境 Nacos 集群 3 个节点,其中一个节点因底层硬件问题需要重启。按理说,集群架构天然支持节点故障转移,但重启后大量服务开始报不健康告警,最终引发连锁反应——大面积服务重启。 问题的本质是:Nacos 服务端的一次短暂抖动,怎么就传导成了客户端的雪崩? 针对这次的na 阅读全文
posted @ 2026-08-04 08:31 欢醉 阅读(432) 评论(0) 推荐(1)
摘要: 问题现象 起因是用opencode使用kimi-webbridge,于是本机按官网步骤安装kimi-webbridge,但官网原生不支持opencode连接kimi-webbridge,于是让opencode自己装,结果它自己封装了一个skill,但恰巧在此过程中我又升级了opencode版本到最新 阅读全文
posted @ 2026-07-30 08:33 欢醉 阅读(168) 评论(0) 推荐(0)
摘要: 最近一直收到某个服务pod容器内存超过80%的告警,堆内存加上堆外内存目前看也只有1G左右,但pod内存却达到4G多,查来查去查到active_file对应的logs占用大量内存,目前现状是k8s中springboot服务日志挂载到宿主机/logs目录,/logs目录的所有日志大小有3G,容器内存显 阅读全文
posted @ 2026-07-27 08:29 欢醉 阅读(236) 评论(0) 推荐(0)
摘要: 现象 k8s调度pod时异常,会导致生成上百个失败的pod。 pod分配异常: The node had condition: [DiskPressure]. The node was low on resource: ephemeral-storage. Container join-servic 阅读全文
posted @ 2026-07-23 08:36 欢醉 阅读(96) 评论(0) 推荐(0)
摘要: 生产服务器告警:创建线程总数超过32000个故障。服务器的总线程数无法突破32000的问题在 “k8s的pod容器中微服务无法创建新线程unable to create new native thread” 文章中提过,现在再谈谈单个服务的线程数怎么优化。 目前统计到的节点上微服务的线程总数可达到5 阅读全文
posted @ 2026-07-20 08:35 欢醉 阅读(307) 评论(0) 推荐(0)
摘要: 问题 Caused by: java.lang.OutOfMemoryError: unable to create new native thread 这是困扰了我们一个很久的OOM问题,经常在一个节点上面多服务压力上来时出现,表面上是一个程序OOM,但具体又是里面的一个分支 线程问题。 出现的症 阅读全文
posted @ 2026-07-15 08:36 欢醉 阅读(129) 评论(0) 推荐(0)
摘要: 运行节点环境 8C 64G的节点是个虚拟机,CentOS7.9的系统里面装了k8s的节点。 k8s中启动服务时异常 unable to ensure pod container exists: failed to create container for [kubepods burstable po 阅读全文
posted @ 2026-07-13 08:38 欢醉 阅读(78) 评论(0) 推荐(0)
摘要: Hermes Web UI v0.4.0 升级到Hermes Web UI v0.5.35问题复盘 阅读全文
posted @ 2026-07-09 08:31 欢醉 阅读(202) 评论(0) 推荐(0)