2026年7月2日 · 深度技术研究


导语

2026年6月22日,知名代码安全公司 Semgrep 发布了一份引发行业地震的基准测试报告:《We have Mythos at Home: GLM 5.2 beats Claude in our Cyber Benchmarks》。报告显示,智谱 AI 的开源模型 GLM 5.2 在 IDOR(不安全的直接对象引用)漏洞检测任务上,以 39% 的 F1 分数击败了 Anthropic 的 Claude Code(最高 37%)。

这不仅仅是一个 benchmark 分数的变化。这是开源模型首次在网络安全任务上超越闭源巨头,被 Databricks 研究员称为"开源领域的 Claude 时刻"。


一、GLM 5.2:7500 亿参数的 MoE 开源模型

GLM 5.2 是智谱 AI 于 2026年6月13日发布的旗舰开源模型,三天后以 MIT 许可证公开权重。

关键技术参数

维度 规格
架构 MoE(混合专家)
总参数 ~7500 亿
激活参数 ~400 亿(每个 token)
上下文窗口 1M tokens
开源协议 MIT License
编程能力 Terminal-Bench 2.1: 81.0;SWE-bench Pro: 62.1

安全审计能力

  • 可检测 SQL 注入、XSS、权限绕过、接口越权、密码明文存储、日志泄露等多类安全漏洞
  • 输出漏洞风险等级、攻击原理、修复方案、加固代码
  • 训练阶段纳入了大量包含 RBAC、ABAC 权限控制逻辑的代码数据,对"权限检查"模式有更强敏感性

1M tokens 的上下文窗口在安全审计中尤为关键——跨文件分析权限模型需要追踪多个文件之间的调用关系和数据流,长上下文让模型能够一次性加载整个项目的代码。


二、Semgrep 基准测试:严格控制的实验

2.1 测试方法

Semgrep 团队设计了严格的对照实验:

固定变量:

  • 同一 IDOR 数据集(来自真实开源应用)
  • 同一评估方法(F1 分数)
  • 同一系统提示词

变化变量:

  • 模型及其 harness(脚手架)

2.2 IDOR:为什么选这个漏洞类型?

IDOR(Insecure Direct Object Reference,不安全的直接对象引用)是 OWASP Top 10 排名第 4 的常见漏洞,也是 HackerOne 漏洞悬赏平台上的高频漏洞。

检测 IDOR 极其困难,因为:

  • 它不是传统的污点流漏洞——没有明显危险函数可标记
  • 它是"本该存在但缺失的校验"——需要理解整个应用的权限模型
  • 传统 SAST(静态分析)工具和 LLM 都难以处理这种"缺失逻辑"的检测

IDOR 检测考验的是模型能否理解"这段代码应该做权限检查但没有做"——这是代码审计中最高阶的任务之一。

2.3 测试条件的不对等性

值得注意的是,GLM 5.2 在测试中处于明显劣势

  • GLM 5.2 仅使用简单的 Pydantic AI harness(裸提示词),没有任何端点发现脚手架支持
  • Claude Code 则通过 Claude Code SDK(完整 SDK 加持)运行,享有工具调用、文件系统访问等全部能力

尽管条件不对等,GLM 5.2 仍然胜出。


三、完整排名:数据说话

Semgrep IDOR 漏洞检测基准(F1 分数排名)

排名 模型配置 Harness F1
1 Semgrep Multimodal (GPT 5.5) Semgrep Multimodal 61%
2 Semgrep Multimodal (Opus 4.8) Semgrep Multimodal 53%
3 GLM 5.2 Pydantic AI(裸提示词) 39%
4 Claude Code (Opus 4.6) Claude Code SDK 37%
5 Claude Code (Opus 4.8/4.7) Claude Code SDK 28%
6 MiniMax M3 Pydantic AI(裸提示词) 23%
7 Kimi K2.7 Code Pydantic AI(裸提示词) 22%
8 GPT-5.5 Codex 20%
9 Nemotron Super 3 120B Pydantic AI(裸提示词) 18%
10 DeepSeek V4 Pydantic AI(裸提示词) 17%

核心对比

指标 GLM 5.2 Claude Code(综合)
F1 分数 39% ~32%
每漏洞发现成本 ~$0.17 约为其 6 倍
与第二名开源模型差距 +16 个百分点(vs MiniMax M3 23%)
Harness 支持 裸提示词 完整 SDK

四、Semgrep 团队的核心结论

Semgrep 在报告中给出了一个非常重要的洞察:

"最大的性能差距不在于模型之间,而在于配置之间——那些做了端点发现的和没做的之间。"

这意味着:

  1. Harness(脚手架)比模型本身更重要:排名第一的 Semgrep Multimodal (GPT 5.5) 达到 61% F1,远超裸模型的水平。关键差异在于 Semgrep 的端点发现工具能自动识别应用的所有 API 端点,让模型知道"哪些地方需要检查权限"。

  2. GLM 5.2 的优势在于模型本身的能力:即使没有任何脚手架支持,GLM 5.2 仅靠"裸提示词"就能达到 39% F1,超越了拥有完整 SDK 的 Claude Code。这暗示 GLM 5.2 在代码理解和权限模型推理方面具有真正的优势。

  3. 给 GLM 5.2 加上合适的 harness,理论上可以达到更高水平。当提供引导提示后,GLM 5.2 和 Opus 4.8 的漏洞发现能力可进一步追平 Anthropic 的顶级安全模型 Mythos。


五、行业影响:开源模型的"安全突围"

5.1 "开源领域的 Claude 时刻"

Databricks 研究员将此称为"开源领域的 Claude 时刻"。一个开源模型在特定安全任务上超越了最好的闭源模型,这意味着:

  • 安全团队有了真正的备选方案:不再必须依赖闭源 API,本地部署成为可能
  • 成本门槛大幅降低:GLM 5.2 的每漏洞发现成本约为 Claude Code 的 1/6
  • 数据主权得到保障:企业可以将代码审计完全在内部完成,无需将代码发送到外部 API

5.2 中美 AI 能力差距收窄

Stanford 2026 AI Index 数据显示,美中两国最强模型之间的综合能力差距已收窄到 2.7 个百分点。GLM 5.2 在安全领域的突破进一步印证了这一趋势。

曾领导 Google 安全团队的 Niels Provos 指出,这种局面正把全球用户推向更便宜但同样强大的中国开源模型。《华尔街日报》评论"中国重置了 AI 竞赛"。

5.3 "Bugmageddon"时代的工具升级

AI 发现漏洞的速度已经超过人类打补丁的速度。漏洞从发现到被利用的窗口从 8 年前的 847 天缩短到现在的一天以内。在这种背景下:

  • 更便宜但同样强大的开源模型正在获得市场青睐
  • 安全团队需要评估"模型 + harness"的组合方案,而非只看模型本身
  • Semgrep 的测试表明,工具链的工程化程度可能比模型选择更重要

六、冷静看待:数据背后的注意事项

6.1 单一任务不代表全面优势

Semgrep 的测试聚焦在 IDOR 这一种漏洞类型上。GLM 5.2 在 SQL 注入、XSS、内存安全等其他漏洞类型上的表现尚未有同等严谨的公开对比数据。

6.2 Harness 差距是真实存在的

GLM 5.2 在"裸提示词"条件下胜出,但在实际部署中,Claude Code 的 SDK 赋能(工具调用、文件访问、多步推理)可能带来不同的结果。Semgrep 的数据也表明,好的 harness 可以让 F1 从 39% 提升到 61%——这是 22 个百分点的差距

6.3 快速迭代的持续性

智谱在过去四个月里连续发布了 GLM-5、5-Turbo、5.1、5.2 四个前沿级 coding 模型。这种迭代速度令人印象深刻,但也需要观察其长期持续性。闭源厂商(Anthropic、OpenAI)的安全模型(如 Mythos)仍在持续演进。


七、我的观点:安全 AI 的真正竞争才刚开始

7.1 安全正在成为 AI 竞争的新维度

过去两年的 AI 竞争焦点是"谁能生成更好的代码"。GLM 5.2 的突破表明,"谁能更好地审查代码"正在成为同等重要的竞争维度。随着 AI 编程助手的普及,AI 驱动的代码审计将成为安全基础设施的关键组成部分。

7.2 "模型 + Harness"是正确的产品形态

Semgrep 的测试结果最核心的启示不是"GLM 5.2 比 Claude 好",而是安全 AI 产品应该是"模型 + 领域工具链"的组合。纯靠模型推理(裸提示词)的上限是 39%,加上端点发现等工具后可以到 61%。这个差距远大于模型之间的差距。

7.3 开源安全 AI 的战略价值

GLM 5.2 的 MIT 许可证意味着任何企业都可以本地部署、定制微调。对于安全合规要求严格的行业(金融、政府、国防),闭源 API 的数据外发风险一直是阻碍。开源安全 AI 模型的出现,可能从根本上改变这个行业的工具格局。

7.4 给安全团队的实用建议

  1. 不要只看模型选择:评估安全 AI 工具时,重点考察其 harness 能力(端点发现、调用图构建、权限模型提取等)
  2. 考虑开源方案:GLM 5.2 的成本优势和本地部署能力使其成为安全团队的可行选择
  3. 建立自己的基准:Semgrep 的 IDOR 基准是一个好的起点,但每个企业的代码库和安全需求不同,需要建立定制化的评估流程
  4. 保持关注:这个领域迭代极快,今天的排名可能三个月后就过时了

免责声明

本文仅供网络安全技术研究和教育目的,所有评测数据来源于 Semgrep 官方公开的基准测试报告。本文不包含任何漏洞利用代码或攻击技术,所有内容均以安全工具评估和行业分析为导向。读者应遵守所在国家/地区的法律法规,仅将本文内容用于合法合规的安全研究和学习用途。


参考资料