摘要:
从一次RAG上生产性能骤降事故出发,拆解向量索引HNSW/IVF原理、混合过滤痛点与压测数据,给出生产选型框架 阅读全文
从一次RAG上生产性能骤降事故出发,拆解向量索引HNSW/IVF原理、混合过滤痛点与压测数据,给出生产选型框架 阅读全文
posted @ 2026-09-15 14:54
底层玩家老张
阅读(24)
评论(0)
推荐(0)
从一次RAG上生产性能骤降事故出发,拆解向量索引HNSW/IVF原理、混合过滤痛点与压测数据,给出生产选型框架 阅读全文
从一次夜里的求助电话切入,把数据库"长期稳定运行"这件事往下拆三层:事务号为什么会耗尽、Oracle兼容为什么要分四层、查询优化为什么不能只靠调参,顺带讲透金仓KES V9R2C16这次发布动了哪些底层。 阅读全文
各位,我是老张。今天从一次实战出发,往下拆一层。 上个月陪一个朋友看他们的容器化改造。业务服务全部迁上K8s了,跑得挺顺,唯独数据库卡在原地。那哥们跟我吐槽:老张,代码都能容器化,怎么一到了数据库这儿,运维反而比以前更累了?我上去看了眼环境,果然,数据库还是手工搭的,跟K8s一点关系没有,扩容要半夜 阅读全文
各位,我是老张。今天从一次实战出发,往下拆一层。 周二晚上九点,下单系统的报警群炸了。ERROR 1213刷屏,Deadlock found when trying to get lock。库存服务10分钟攒了一千多条死锁日志,订单创建失败率冲到4%。运维重启实例,症状才消停。我盯着SHOW ENG 阅读全文
各位,我是老张。今天从一次实战出发,往下拆一层。 上个月帮客户做双活选型。核心交易系统要替换Oracle,数据量不大,两三百G。客户提了三个要求。两个机房同时对外服务,故障切换不能丢数据,容量要撑五年。供应商给的两套方案吵起来了。做存储的方案推Shared-Disk,做分库分表的推Shared-No 阅读全文
从开发环境授权痛点出发,拆解数据库授权机制的设计逻辑,分析KES自助授权通道的5大权益和运维影响 阅读全文
各位,我是老张。今天从一次实战出发,往下拆一层。 上周排查一个线上问题。电商系统做秒杀,Java服务报事务提交成功。订单号返回给前端,用户付款了。结果机房跳电,数据库重启后发现那笔订单没了。应用层的事务明明返回了成功。日志里也打了commit done。数据却凭空消失。我顺着配置翻了一遍,才发现这个 阅读全文
上周做了一次压测。三个MySQL节点跑Group Replication。目标是10万TPS写入。 压到7万的时候,延迟开始抖动。压到10万,P99直接飙到20毫秒。 当时第一反应是网络带宽不够。换了万兆网卡还是抖。 后来才搞明白,真正的瓶颈在Raft日志复制这一层。日志追不上写入速度,节点间com 阅读全文