SIEM告警一天3000条,真正有用的不到5%——我的安全运营踩坑实录
SIEM告警一天3000条,真正有用的不到5%——我的安全运营踩坑实录
上个月帮一家中型企业做安全运营优化,他们安全团队3个人,每天第一件事就是打开SIEM看告警。我问了一嘴"一天大概多少条告警",安全主管苦笑了一下:"保守估计3000条。"
我一开始以为他在夸张,后来自己盯了一天大屏,好家伙,从早上9点到下午6点,告警滚动得跟弹幕似的。一条条看过去,绝大多数是误报——正常的端口扫描被标记成"入侵行为",内网的合法连接被标记成"横向移动",备份任务被标记成"数据外泄"。
3个人每天花4个小时在"看告警"上,真正有用的告警不到150条。这不是安全运营,这是人工筛垃圾。
为什么告警会泛滥
在动手优化之前,先搞清楚告警泛滥的根因。排查下来,发现三个问题:
问题一:检测规则是厂商默认的,一条没动
SIEM部署之后,直接用了厂商预置的500多条检测规则。这些规则是"通用"的,不会考虑你的具体业务场景。
举个例子:规则"检测SSH暴力破解",默认阈值是5分钟内失败10次。但这家公司有自动化运维平台,Ansible批量执行任务的时候,5分钟内SSH连接上百台服务器,触发告警的频率比真正的攻击还高。
问题二:日志源没做分类
所有日志都往SIEM里灌——防火墙、WAF、EDR、IDS、服务器日志、应用日志,全混在一起。规则没区分日志源类型,导致WAF拦截了攻击,IDS又告了一次,EDR再告一次,同一条攻击触发3条告警。
问题三:没有告警分级
所有告警都是一个级别——"高危"。打开SIEM,满屏的红色,安全团队产生了"告警疲劳",看到红色都麻木了。真正高危的告警混在里面,反而被忽略了。
优化方案:从3000条降到200条
第一步:规则调优(效果最明显)
把500多条规则逐条过了一遍,分成三类:
分类数量处理方式 业务适配规则120条调整阈值和白名单 无效规则280条直接禁用 保留规则100条原样保留具体调优案例:
SSH暴力破解规则——把阈值从"5分钟10次"改成"单IP对单目标5分钟5次",排除运维IP段:
# Splunk SPL示例
index=syslog sourcetype=linux_secure "Failed password"
| bin _time span=5m
| stats count as fail_count by src_ip, dest_ip
| where fail_count > 5
| lookup exclude_ips src_ip OUTPUT is_excluded
| where isnull(is_excluded)
加了白名单之后,这条规则的告警量从日均200条降到日均5条。
第二步:告警去重合并
用SIEM的告警聚合功能,把同一攻击链触发的多条告警合并成一条事件:
原始告警(3条):
1. IDS: 检测到SQL注入攻击特征
2. WAF: 拦截恶意请求 /api/users?id=1' OR 1=1--
3. 应用日志: 异常SQL查询
合并后(1条事件):
事件: SQL注入攻击尝试
来源: IDS + WAF + 应用日志
关联时间窗口: 1分钟内
光这一步,告警量直接砍掉40%。
第三步:告警分级
建立四级告警体系:
- P0 紧急:确认入侵、数据泄露、勒索软件——15分钟内响应
- P1 高危:疑似攻击成功、异常横向移动——1小时内响应
- P2 中危:攻击尝试被拦截、可疑行为——4小时内确认
- P3 低危:信息性告警、合规检查——每日汇总处理
分级之后,安全团队只需要实时关注P0和P1,P2和P3可以批量处理,效率提升至少3倍。
第四步:自动化响应剧本
对高频低风险告警配置自动化响应:
# SOAR自动化剧本示例
- name: SSH暴力破解自动封禁
trigger: P2_ssh_bruteforce
conditions:
- fail_count > 10
- src_ip not in whitelist
actions:
- firewall_block_ip(src_ip, duration=24h)
- create_ticket(priority=P2)
- notify_slack(channel="#security-ops", message="自动封禁SSH暴力破解IP")
这种低风险高频告警,交给自动化处理就行,人不用介入。
优化结果
指标优化前优化后 日均告警量3000条200条 需人工处理3000条50条 告警准确率5%60% 平均响应时间4小时30分钟安全主管后来跟我说:"以前每天上班第一件事是看告警,现在第一件事是喝咖啡。"
三个踩坑教训
- 不要一开始就上SOAR:先把规则调优做好,再考虑自动化。规则垃圾,自动化只是更快地产生垃圾
- 白名单比黑名单重要:花时间梳理业务流量的正常模式,比加攻击特征库有用得多
- 告警不是越多越安全:3000条告警里95%是噪音,真正的攻击反而被淹没了。少而精的告警才是好告警
写在后面
安全运营的核心不是"看到所有攻击",而是"在正确的时间看到正确的告警"。SIEM只是工具,规则才是灵魂。花两天时间调优规则,比多买两个安全设备有效10倍。
关注「安全值班室」公众号
每天AI安全早报 + 实战攻防案例 + 网安学习路线连载
浙公网安备 33010602011771号