2026年8月28日

k8s iptables-nft vs iptables-legacy

摘要: kube-proxy 不是直接“调用内核模块”,而是一个 Go 进程,把 Service 和 EndpointSlice 转成内核转发/NAT 规则。不同模式调用的用户态工具不同: kube-proxy 模式它实际怎么下发规则内核最终执行 iptables 执行容器内的 iptables-resto 阅读全文

posted @ 2026-08-28 19:12 小镇-做题家 阅读(2) 评论(0) 推荐(0)

2026年8月26日

挂载进程

摘要: # 先获取 Ceph 挂载点MOUNT_POINT=$(mount | grep "10.252.128.54:6789" | awk '{print $3}')echo "挂载点: $MOUNT_POINT" # 查找所有打开该挂载点文件的进程for pid in /proc/[0-9]*; do 阅读全文

posted @ 2026-08-26 15:30 小镇-做题家 阅读(1) 评论(0) 推荐(0)

2026年8月25日

硬盘性能测试

摘要: 参考:https://help.aliyun.com/zh/ecs/user-guide/test-the-performance-of-block-storage-devices 机器 tikv01 配置:4210*2/镁光16G-Rankx2-DDR4-2933*16/希捷600G(SAS)*2 阅读全文

posted @ 2026-08-25 11:55 小镇-做题家 阅读(3) 评论(0) 推荐(0)

io_analyzer

摘要: #include <stdio.h> #include <stdlib.h> #include <string.h> #include <unistd.h> #include <dirent.h> #include <ctype.h> #define MAX_PROC 65536 #define T 阅读全文

posted @ 2026-08-25 11:38 小镇-做题家 阅读(3) 评论(0) 推荐(0)

分析s3超时

摘要: 2026-08-25dsv鉴定器反馈访问s3超时 /* * fasttcping.c * * TCP ping + payload + HTTP CONNECT proxy * * Build: * gcc -O2 -Wall -Wextra -o fasttcping fasttcping.c * 阅读全文

posted @ 2026-08-25 11:23 小镇-做题家 阅读(3) 评论(0) 推荐(0)

neigh & bridge

摘要: 知道了 Pod 的 IP,找到它对应的宿主机 `veth` 设备,最靠谱的方法是利用内核给它们分配的**唯一接口索引(iflink)**。因为 `veth` 设备总是成对出现,一端在 Pod 的网络命名空间里,另一端在宿主机上,它们通过相同的索引值关联。同时,Pod IP 和 MAC 的对应关系也会 阅读全文

posted @ 2026-08-25 10:03 小镇-做题家 阅读(5) 评论(0) 推荐(0)

2026年8月24日

k8s租约 && containerd status上报

摘要: 从kube-controller-manager 和kube-scheduler 租约看 平面本身正常。从event看 部分node离线了default 10m 要判断 Kubernetes 控制平面是否曾发生过异常,不能仅看当前状态,而应通过历史事件、组件日志、租约续期记录、节点心跳中断等多维度进 阅读全文

posted @ 2026-08-24 23:46 小镇-做题家 阅读(3) 评论(0) 推荐(0)

wchan统计排序

摘要: 对,问题在这里: sort -t'|' -k1,1 -k2,2 -k4,4nr 这是按: COMMAND STAT THREADS 排序。 所以 THREADS 只是在同一个 COMMAND + STAT 内部排序,不会让整个输出按 THREADS 从大到小排列。 如果你的要求是: 所有 COMMA 阅读全文

posted @ 2026-08-24 21:16 小镇-做题家 阅读(3) 评论(0) 推荐(0)

ai部署3

摘要: 可以。针对你的场景,我建议把目标明确成: 2 台 CentOS 9 NVIDIA GPU 服务器,每台 8×A100 80GB PCIe,共 16×A100,裸机部署,不使用 Docker、不使用 Kubernetes,实现:GPU 基础环境 → 分布式训练 → LoRA/Full Fine-tun 阅读全文

posted @ 2026-08-24 17:31 小镇-做题家 阅读(3) 评论(0) 推荐(0)

ai部署1

摘要: 可以。下面给你一份从裸机 CentOS 9 到单机训练、8 GPU DDP、4×8=32 GPU 分布式语言模型训练的完整文档,并且每个关键操作都增加: 做什么 为什么做 作用 验证方法 异常时看什么 4 台机器哪些操作完全一样 哪些参数必须每台不同 另外,我会把之前容易混淆的 Driver / C 阅读全文

posted @ 2026-08-24 17:10 小镇-做题家 阅读(3) 评论(0) 推荐(0)

导航