Linux服务器宕机排查RAID卡roc异常故障

journalctl --since "2026-08-11 20:30:00" --until "2026-08-11 20:50:00" --no-pager

定时任务(20:30)→ 访问 /dataX(在 /dev/sda 上) │
│ 读取到坏扇区 → 内核 I/O 重试 → 进程卡住(D 状态) │
│ 系统负载持续升高 → 无法调度其他进程 │
│ → 系统日志无法写入(因为系统盘 I/O 也被拖累) │
│ → 看门狗超时 → 硬件复位 → 整个服务器重启

[root@log cloud]# dmesg | grep -E "I/O error|Buffer I/O|sd.*Error|timeout|reset|abort" | tail -50
[ 2.470102] TAA CPU bug present and SMT on, data leak possible. See https://www.kernel.org/doc/html/latest/admin-guide/hw-vuln/tsx_async_abort.html for more details.
[ 40.183775] megaraid_sas 0000:07:00.0: FW provided TM TaskAbort/Reset timeout : 0 secs/0 secs
[ 40.197724] igb 0000:03:00.1: PHY reset is blocked due to SOL/IDER session.

 

启用持久化日志(非常重要!)
在解决重启问题之前,先启用持久化日志,这样下次重启后才能看到原因:

bash
# 1. 创建持久化日志目录
mkdir -p /var/log/journal

# 2. 修改 systemd-journald 配置
sed -i 's/#Storage=auto/Storage=persistent/' /etc/systemd/journald.conf

# 3. 重启 journald 服务
systemctl restart systemd-journald

# 4. 验证
journalctl --list-boots

journalctl -b -1 --no-pager | tail -200

 

ROC 温度 102°C

RAID 卡进入过热保护状态

RAID 卡 I/O 处理异常/降频/卡顿

磁盘 I/O 超时 → 进程进入 D 状态

负载飙升 → 系统无响应 → 看门狗超时

系统强制重启(保护硬件)

 

./storcli-linux /c0 show all | grep -E "Controller|Product|Firmware|Version|Serial|Package|Driver"

f0f83afcbce60079691f803dbcc19ddf

 

06e532fd1d1a48fd5d083ebff2a1041e

 

posted @ 2026-08-12 20:55  LB_运维技术  阅读(6)  评论(0)    收藏  举报