1 2 3 4 5 ··· 31 下一页
摘要: 概要 为什么要做监控 线上发布了服务,怎么知道它一切正常,比如发布5台服务器,如何直观了解是否有请求进来,访问一切正常。当年有一次将线上的库配置到了Beta,这么低级的错误,排错花了一个通宵,十几个人。某个核心服务挂了,导致大量报错,如何确定到底是哪里出了问题。SOA带来的问题,调用XX服务出问题, 阅读全文
posted @ 2017-09-11 08:45 一个码农的日常 阅读(14484) 评论(3) 推荐(4)
摘要: 传统关系型数据库的分布式开发通常需要自己做,不仅耗时耗力而且效果不是很理想,当想快速搭建时,最初想到的是看有没有第三方,网上牛人还是很多的,做得比较好的其中之一Mycat,它是开源的分布式数据库系统,解决数据库的负载均衡,主备复制,读写分离,简单来说就是你只管直接与mycat通讯,至于分离什么的交给 阅读全文
posted @ 2017-02-21 08:58 一个码农的日常 阅读(5583) 评论(8) 推荐(8)
摘要: 你真的会玩SQL吗?系列目录你真的会玩SQL吗?之逻辑查询处理阶段你真的会玩SQL吗?和平大使 内连接、外连接你真的会玩SQL吗?三范式、数据完整性你真的会玩SQL吗?查询指定节点及其所有父节点的方法你真的会玩SQL吗?让人晕头转向的三值逻辑你真的会玩SQL吗?EXISTS和IN之间的区别你真的会玩... 阅读全文
posted @ 2015-10-28 09:06 一个码农的日常 阅读(15625) 评论(15) 推荐(32)
摘要: 有天下午生产群里甩进来一张截图:生产环境 http://10.3.87.23:8080/api/auth/getuserlist 接口返回异常:413 Request Entity Too Large。 做后端的人看到 413 的第一反应都是"请求体太大"。可我把报文要过来一看,body 就六十几字 阅读全文
posted @ 2026-09-08 08:00 一个码农的日常 阅读(185) 评论(0) 推荐(2)
摘要: 我们组有个同事,以前是那种闲不住的人。现在也闲不住 只不过是不敢动了。 去年部门空降了一位新总监,阿里P8,第一次全员会PPT上就八个大字:拥抱变化,永不言弃。 新领导上来搞流程改革,每个模块指定Owner,出事追责到人,A级事故罚款500起步,B级300 依次类推,发版上线改配置全走审批。说实话之 阅读全文
posted @ 2026-09-02 07:59 一个码农的日常 阅读(3077) 评论(30) 推荐(18)
摘要: 用户反馈请求生产网关springcloud gateway突然偶发性返回500异常,赶紧上线检查服务,发现有个别实例日志里开始零星出现 OutOfDirectMemoryError,频率还有逐渐升高的趋势,过不了一会服务基本不可用了,出现健康检测异常。完整报错信息是这样的: io.netty.uti 阅读全文
posted @ 2026-08-25 07:42 一个码农的日常 阅读(196) 评论(5) 推荐(0)
摘要: 昨天有个同事,甩了半页需求文档给 Claude Code,转身去接了杯热水的功夫,核心业务代码就写完了。 我凑过去扫了一眼,那段逻辑我前阵子刚做过类似的,前后调边界、改异常、跑测试,折腾了俩小时才收尾。 他前后加起来,十分钟。 那一下我真有点恍惚。 我这五年踩过的坑、摸出来的门道、踩雷踩出来的肌肉记 阅读全文
posted @ 2026-08-18 07:48 一个码农的日常 阅读(573) 评论(8) 推荐(3)
摘要: 走管理还是走技术路线,其实一直都是程序员职业发展路上反复面对的选择——或主动,或被动。 一般在公司做得比较久的老员工,往往对业务非常熟悉,技术这块够用就行,技术难题有架构师或专人负责处理,从而做得比较多的是带几个新人、处理日常业务问题,这时也算是小小的组长或主管,但也不是纯管理。 然而业务体量越来越 阅读全文
posted @ 2026-08-11 07:31 一个码农的日常 阅读(807) 评论(9) 推荐(1)
摘要: 事故现场 这次的背景是生产环境 Nacos 集群 3 个节点,其中一个节点因底层硬件问题需要重启。按理说,集群架构天然支持节点故障转移,但重启后大量服务开始报不健康告警,最终引发连锁反应——大面积服务重启。 问题的本质是:Nacos 服务端的一次短暂抖动,怎么就传导成了客户端的雪崩? 针对这次的na 阅读全文
posted @ 2026-08-04 08:31 一个码农的日常 阅读(453) 评论(0) 推荐(1)
摘要: 问题现象 起因是用opencode使用kimi-webbridge,于是本机按官网步骤安装kimi-webbridge,但官网原生不支持opencode连接kimi-webbridge,于是让opencode自己装,结果它自己封装了一个skill,但恰巧在此过程中我又升级了opencode版本到最新 阅读全文
posted @ 2026-07-30 08:33 一个码农的日常 阅读(196) 评论(0) 推荐(0)
摘要: 最近一直收到某个服务pod容器内存超过80%的告警,堆内存加上堆外内存目前看也只有1G左右,但pod内存却达到4G多,查来查去查到active_file对应的logs占用大量内存,目前现状是k8s中springboot服务日志挂载到宿主机/logs目录,/logs目录的所有日志大小有3G,容器内存显 阅读全文
posted @ 2026-07-27 08:29 一个码农的日常 阅读(251) 评论(0) 推荐(0)
摘要: 现象 k8s调度pod时异常,会导致生成上百个失败的pod。 pod分配异常: The node had condition: [DiskPressure]. The node was low on resource: ephemeral-storage. Container join-servic 阅读全文
posted @ 2026-07-23 08:36 一个码农的日常 阅读(108) 评论(0) 推荐(0)
摘要: 生产服务器告警:创建线程总数超过32000个故障。服务器的总线程数无法突破32000的问题在 “k8s的pod容器中微服务无法创建新线程unable to create new native thread” 文章中提过,现在再谈谈单个服务的线程数怎么优化。 目前统计到的节点上微服务的线程总数可达到5 阅读全文
posted @ 2026-07-20 08:35 一个码农的日常 阅读(312) 评论(0) 推荐(0)
1 2 3 4 5 ··· 31 下一页