GLM-5
GLM-5
一、论文基础信息
- 标题:GLM-5: from Vibe Coding to Agentic Engineering
中文翻译:GLM-5:从直觉式编码到智能体工程
- 作者:GLM-5 团队(智谱 AI & 清华大学)
- 来源:arXiv 预印本(cs.LG,机器学习方向)
- 发布时间:2026 年 2 月 24 日
二、研究背景与问题
(一)研究动机(现有技术不足)
- 能力与成本矛盾:大语言模型从被动知识库转向主动问题求解器,但计算成本高、现实场景适配性差,复杂软件工程场景成为核心瓶颈。
- 前代模型局限:GLM-4.5 虽融合智能体、推理、编码(ARC)能力,但训练 / 推理效率不足,长上下文理解与复杂长周期交互学习能力有限。
- 范式缺陷:传统 “直觉式编码(vibe coding)” 依赖人工提示,无法实现 AI 自主完成端到端软件工程。
- 训练框架短板:同步强化学习存在 GPU 空闲、迭代慢的问题,长周期智能体任务训练受同步瓶颈制约。
- 注意力机制缺陷:滑动窗口、线性注意力等高效方案存在信息丢失,长上下文细粒度检索性能下降。
- 生态适配不足:开源模型对国产 GPU 硬件生态适配性差,部署成本高。
(二)研究问题
- 如何在提升 ARC 能力的同时,大幅降低训练与推理成本?
- 如何设计高效异步强化学习框架,提升长周期复杂交互的学习效率与质量?
- 如何优化预训练架构、数据与流程,强化长上下文、编码、推理能力?
- 如何实现模型对国产 GPU 生态的全栈适配?
- 如何完成从 “直觉式编码” 到 “智能体工程” 的范式转变,让 AI 自主完成端到端软件工程?
1 Introduction
1.1 研究开篇:AGI 发展的核心诉求
- AGI 的核心方向:追求通用人工智能不仅需要模型参数规模化,更要从本质上重新思考智能效率与自主进化架构。
- 范式转变背景:大语言模型(LLM)正从被动的知识存储库转向主动的问题求解器,能力定位发生根本性变化。
1.2 前代模型(GLM-4.5)的成果与局限
1.2.1 前代成果
GLM-4.5 验证了将智能体(Agentic)、推理(Reasoning)、编码(Coding)即 ARC 能力融合进混合专家(MoE)架构,可在多类基准测试中取得 SOTA 表现。
1.2.2 核心局限
- 计算成本瓶颈:训练与推理的算力开销过高,效率不足。
- 现实适配短板:在复杂软件工程等真实场景的适配能力差,无法满足落地需求。
- 能力边界:长上下文理解、复杂长周期交互的学习能力有限,难以支撑自主智能体任务。
1.3 GLM-5 的模型定位与核心目标
- 产品定位:智谱 AI 下一代旗舰基座模型,旨在突破前代的计算成本与现实适配双重壁垒。
- 核心目标
- 实现性能与效率的双重跃迁,登顶主流开源评测榜单。
- 重新定义真实场景编码能力,突破 SWE-bench 等传统静态基准的局限。
- 支撑 AI 完成端到端复杂软件开发,完成从 “直觉式编码” 到 “智能体工程” 的范式升级。
1.4 GLM-5 核心性能结果
1.4.1 基准测试整体表现

在8 项 ARC(智能体、推理、编码)基准(Humanity’s Last Exam、SWE-bench Verified、Terminal-Bench 2.0 等)中:
- 较前代 GLM-4.7平均提升约 20%;
- 性能比肩 Claude Opus 4.5、GPT-5.2 (xhigh),优于 Gemini 3 Pro。
1.4.2 权威指数表现
在Artificial Analysis Intelligence Index v4.0中得分 50,成为开源权重模型榜首,较 GLM-4.7 提升 8 分,是首个在该指数突破 50 分的开源模型。
1.4.3 真实人机交互评测
在 UC 伯克利发起的LMArena(百万级真实任务、人工评判)中:
- 位列文本竞技场、代码竞技场开源模型双第一;
- 整体表现与 Claude Opus 4.5、Gemini 3 Pro 持平。
1.4.4 长周期任务表现
- Vending-Bench 2:开源模型中排名第一,账户余额 $4,432,接近 Claude Opus 4.5,长周期规划与资源管理能力突出。
- CC-Bench-V2:在前、后端及长周期任务上大幅超越 GLM-4.7,缩小与闭源模型差距。
1.5 GLM-5 训练流程总览
采用三段式训练 pipeline,全程用同策略跨阶段蒸馏防止灾难性遗忘,保留推理能力的同时兼顾通用性:
- 基础预训练:27 万亿 token 语料,优先代码与推理数据。
- 中期训练:将上下文长度从 4K 逐步扩展至 200K,聚焦长上下文智能体数据。
- 后训练:超越标准 SFT,采用序列式强化学习—— 推理 RL→智能体 RL→通用 RL。

1.6 GLM-5 四大核心技术贡献
- 采用 DSA(DeepSeek Sparse Attention)
动态分配注意力资源,显著降低训练与推理成本;模型参数扩至 744B,训练 token 达 28.5T,不损失长上下文与推理深度。
- 全新异步强化学习基础设施
解耦生成与训练环节,最大化 GPU 利用率,消除同步瓶颈,大幅提升后训练效率。
- 新型异步智能体 RL 算法
优化自主决策、规划与自纠错能力,让模型从复杂长周期交互中高效学习,支撑真实编码场景。
- 国产 GPU 生态全栈适配
从底层内核到上层推理框架深度优化,适配华为昇腾、摩尔线程等7 大主流国产芯片平台。
1.7 模型价值与开源意义
- 核心价值:GLM-5 不仅是性能更强的模型,更是高效、实用的下一代 AI 智能体基座。
- 开源初衷:向社区开放模型,推动高效智能体通用人工智能的前沿发展,加速从直觉式编码到智能体工程的行业转型。
2 Pre-Training
预训练分为通用语言与编码能力预训练、智能体与长上下文能力中期训练两阶段,总训练 token 规模达28.5 万亿。
2.1 Architecture(模型架构)
核心优化点
- 模型规模缩放
- 总参数扩至744B,激活参数 40B(GLM-4.5 为 355B 总 / 32B 激活)。
- 专家数增至 256 个,层数降至 80 层,降低专家并行通信开销。
- 多隐层注意力(MLA)优化
- 原始 MLA 在 Muon 优化器下性能弱于 GQA-8,提出Muon Split方法:将注意力头的投影矩阵拆分后独立正交化,使 MLA 性能追平 GQA-8。
- 解码计算成本高:将头维度从 192 提至 256,注意力头数减 1/3,推出MLA-256变体,保持训练参数与计算量不变,降低解码开销。
- 参数共享多 token 预测(MTP)
- 传统 MTP 需 n 层预测 n 个 token,内存占用高;GLM-5 训练时共享 3 层 MTP 参数,推理时 speculative steps=4,接受长度达 2.76,优于 DeepSeek-V3.2 的 2.55。
2.1.1 Continued Pre-Training with DeepSeek Sparse Attention (DSA)
核心内容
- DSA 核心思想
替代传统 O (L²) 稠密注意力,基于 token 内容动态筛选重要 token,长序列注意力计算量降低1.5-2 倍,128K 上下文成本减半。
- 两阶段训练策略
- 稠密预热:从中期训练结束的基模型开始,1000 步预热,冻结基础权重仅训练索引器。
- 稀疏适配:仅 20B token 训练,即可让 DSA 模型性能匹配原始 MLA 模型。
- 实验验证
- 长上下文基准(MQ-NIAH-128k、SQuAD-128k 等)上,DSA 与 MLA 性能接近,SFT 损失曲线一致。
- 优势:无需从头训练,从稠密模型持续预训练即可适配,成本极低。
2.1.2 Ablation Study of Efficient Attention Variants(高效注意力变体消融)
实验设置
基线 GLM-9B ,对比滑动窗口注意力(SWA)、门控 DeltaNet(GDN) 及改进方案,评估长上下文性能。
核心改进与结果
- 滑动窗口类:SWA Interleave(固定交替):一层全注意力、一层窗口注意力交替排列、SWA Pattern(搜索优化):束搜索自动找 “哪些层用窗口、哪些保留全注意力”
基于 PostNAS 搜索最优全注意力 / 窗口注意力层组合,替代固定交替模式,RULER@128K 从 6.51 提升至 53.95,长度泛化性强。
- 线性注意力 GDN(Gated DeltaNet):GDN、SimpleGDN:砍掉 GDN 的 Conv1d 和门控
移除 GDN 的 Conv1d 与门控模块,直接复用预训练权重,平衡效率与性能,HELMET-ICL@128K 较基线提升 4.48。
- DSA 绝对优势
所有高效注意力均存在精度损失,而DSA 无信息丢失,token 级稀疏化保留长程依赖,可应用于所有层无性能下降。
2.2 Pre-training Data(预训练数据)
四大数据维度优化
- 网页数据
新增 DCLM 分类器与世界知识分类器,从低质数据中蒸馏长尾知识,提升数据质量。
- 代码数据
- 代码语料 unique token 增加 28%,修复 Software Heritage 元数据对齐问题。
- 优化低资源编程语言(Scala、Swift 等)采样策略,提升小语种代码能力。
- 数理科学数据
- 从网页、书籍、论文采集高质量数据,优化 PDF / 网页抽取流程。
- 用 LLM 评分筛选教育性内容,禁用 AI 合成数据,避免噪声。
- 数据原则
严格去重、过滤,优先高质量、高教育价值、非合成的真实数据。
2.3 Mid-Training(中期训练)
核心目标
强化推理、长上下文、智能体能力,上下文窗口从 4K 扩展至 200K。
关键优化
- 上下文与规模扩展
分三阶段递进:32K(1T token)→128K(500B token)→200K(50B token),200K 阶段大幅提升超长文档与多文件代码库处理能力。
- 软件工程数据
放宽仓库筛选条件,获取约 1000 万 Issue-PR 对,单 Issue 级质量过滤降噪,相关文件检索更全面,覆盖真实工程场景。
- 长上下文数据
- 自然数据:书籍、论文、文档多阶段过滤(PPL、去重、长度),上采样知识密集域。
- 合成数据:用 NextLong、EntropyLong 方法构建长程依赖,缓解 “中间丢失” 问题;200K 阶段加入 MRCR 类数据,强化多轮对话召回。
2.4 Training Infrastructure(训练基础设施)
2.4.1 Memory Efficiency(内存效率)
- 灵活 MTP 部署:MTP 输出层与主输出层同阶段共享参数,嵌入层 / Transformer 层放前一阶段,降低内存压力。
- Pipeline ZeRO2 梯度分片:梯度在数据并行秩间分片,仅保留 2 个全量缓冲,减少持久梯度内存。
- Muon 优化器零冗余通信:仅聚合参数分片,重叠计算与通信,降低峰值内存。
- Pipeline 激活卸载:前向后将激活卸载至主机内存,反向时重载,结合细粒度重计算,消除 GPU 内存占用。
- 序列分块输出投影:分块计算输出投影与损失,降低峰值内存,保持性能。
2.4.2 Parallelism Efficiency(并行效率)
- 高效延迟权重梯度计算:延迟关键路径梯度计算,优化存储与通信重叠,提升吞吐量。
- 长序列高效训练: workload 感知序列重排序、注意力计算动态重分配、上下文并行组灵活划分,解决负载不均衡。
- 分层 All-to-All 通信:重叠节点内 / 间 QKV 张量通信,降低延迟。
2.4.3 INT4 Quantization-aware training(INT4 量化感知训练)
- SFT 阶段采用 INT4 QAT,提升低精度下的准确率。
- 研发训练 / 推理通用量化内核,保证行为位一致,降低训练开销。
3 后训练(整体总览)
核心目标
将预训练基础模型转化为具备强推理、编码、智能体能力的对话模型,采用渐进式对齐策略,全程通过同策略跨阶段蒸馏避免能力退化。
整体流程
多任务监督微调(SFT)→ 推理强化学习(Reasoning RL)→ 智能体强化学习(Agentic RL)→ 通用强化学习(General RL)→ 同策略跨阶段蒸馏
3.1 Supervised Fine-Tuning(监督微调)
核心定位
后训练的起点环节,大幅扩充智能体与编码数据规模,奠定模型基础能力。
1. 数据规模与上下文
- 最大上下文长度扩展至202752 tokens
- 语料覆盖三大类:
- 通用对话:问答、写作、角色扮演、翻译、多轮对话、长上下文交互
- 推理:数学、编程、科学推理
- 编码 & 智能体:前后端工程代码、工具调用、编码 / 搜索 / 通用智能体
2. 三大思维特性(核心创新)
- Interleaved Thinking(交错思维)
模型在每次回复与工具调用前先思考,提升指令遵循与生成质量。
- Preserved Thinking(保留思维)
编码智能体场景下,自动保留多轮对话的所有思维块,复用推理逻辑,减少信息丢失与不一致,适配长周期复杂任务。
- Turn-level Thinking(轮次级思维)
支持单轮会话的推理开关:轻量请求关闭思维降低延迟,复杂任务开启提升精度。

3. 各任务专项优化
- 通用对话:回复风格更逻辑、简洁,扩充多语言角色扮演数据,通过自动 + 人工筛选保障质量。
- 推理任务:构建可验证问题,用拒绝采样合成高质量数据;按难度过滤,仅保留 GLM-4.7 难以解决的难题。
- 编码 & 智能体:搭建大量执行环境获取高质量轨迹,用专家 RL 与拒绝采样优化数据;掩码轨迹中的错误片段,让模型学习纠错行为。
3.2 Reasoning RL(推理强化学习)
核心目标
专项提升模型数学、科学、代码、工具集成推理能力,解决训练 - 推理分布不匹配问题。
1. 算法 backbone
- 基于GRPO算法,融合IcePop技术,移除 KL 正则项加速收敛。
- 显式区分训练策略(梯度更新)与推理策略(轨迹采样),解决训练 - 推理不匹配。

2. DSA RL 关键洞察
- DSA 索引器的top-k 选择是 RL 稳定性关键,非确定性 top-k 会导致 RL 性能暴跌。
- 解决方案:全程使用torch.topk(确定性算子),RL 阶段默认冻结索引器参数,保障训练稳定。
3. 混合领域推理 RL
覆盖四大领域,混合训练稳定涨点:
- 数学:开源数据集 + 外部标注,过滤 GLM-4.7 难解问题
- 科学:同数学数据策略,聚焦高难度知识点
- 代码:竞赛编程(Codeforces)+ 科学编码,最小化实现逻辑
- 工具集成推理(TIR):高难度 STEM 问题,需外部工具解答
- 奖励机制:领域专属评估模型 / 系统产出二元结果奖励。
3.3 Agentic RL(智能体强化学习)
核心目标
提升编码、搜索智能体性能,解决同步 RL 长周期 Rollout 的 GPU 空闲问题。
1. 核心框架:全异步解耦 RL
- 解耦推理引擎(生成智能体轨迹:一步步调用工具、写代码、执行操作)与训练引擎(更新参数),通过多任务 Rollout 编排器实现高吞吐量联合训练。
- 权重定期同步,保障训练近似同策略;每次同步后重置优化器,缓解离策略问题。
2. 训练稳定性两大机制
- Token-in-Token-out(TITO)网关
直接使用推理引擎的 token 序列,避免重分词导致的边界 / 截断不匹配,保留动作 - 奖励精准对应。
- 直接双边重要性采样
token 级裁剪([1-εℓ,1+εh]),屏蔽极端策略偏差的 token;复用 Rollout 对数概率,无需跟踪历史策略,降低计算开销→ 防止策略偏差太大导致训练崩溃。
3. 加速优化:DP 感知路由
- 强制同一智能体的所有请求路由到固定数据并行秩,最大化 KV 缓存复用,长上下文推理速度大幅提升。
4. 样本过滤
- 丢弃过于陈旧的离策略轨迹,剔除环境崩溃导致的噪声样本,提升训练信号纯度。
3.4 General RL(通用强化学习)
核心目标
完成人类对齐,让模型输出更贴合人类使用习惯,兼顾正确性与体验。
1. 三维优化目标
- 基础正确性:最小化指令失败、逻辑矛盾、事实错误、幻觉、语言不流畅。
- 情绪智能:输出更共情、自然,贴近人类沟通风格。
- 任务特定质量:针对写作、翻译、角色扮演等任务,做细粒度优化。
2. 混合奖励系统(三大奖励互补)
- 规则奖励:精准可解释,仅适配确定性规则场景。
- 结果奖励模型(ORM):方差低、训练快,易被奖励黑客攻击。
- 生成奖励模型(GRM):抗攻击能力强,方差较高。
- 三者结合,平衡精度、效率、鲁棒性。
3. 人在环对齐
- 引入人类专家撰写的回复作为风格与质量锚点,避免模型生成刻板、公式化的 “模型文风”。
3.5 On-Policy Cross-Stage Distillation(同策略跨阶段蒸馏)
核心问题
多阶段 RL 依次优化不同目标,会导致前期习得能力退化(灾难性遗忘)。
核心方案
- 以SFT、推理 RL、通用 RL的最终 checkpoint 为教师模型。
- 采用同策略蒸馏算法,用教师模型的推理 logits 计算优势函数,快速恢复前期能力。
训练配置
- GRPO 组大小设为1,提升数据吞吐量;batch size=1024。
- 优势函数直接由学生模型与教师模型的对数概率差计算,无需大规模样本组。
3.6 RL Training Infrastructure: The slime Framework
核心定位
GLM-5统一的后训练基础设施,支撑大规模端到端强化学习,复用并升级 GLM-4.5 的 slime 框架。
3.6.1 Scaling Out: 灵活训练(高度定制化 Rollout轨迹生成)
- 定制化 Rollout:无需修改底层架构,即可实现多轮交互、工具调用、环境反馈等任务专属逻辑,能支持推理 RL、智能体 RL、通用 RL 等所有场景。
- 服务化 Rollout:通过 HTTP API 暴露 Rollout 服务器,外部智能体框架直接调用,解耦 Rollout 逻辑与训练流程。
3.6.2 Scaling Up: 尾部延迟优化(RL Rollout 核心)
- RL 优化目标是端到端延迟,单个慢样本会阻塞整个训练步骤。
- 无队列服务:多节点推理 + DP 注意力,提供充足分布式 KV 缓存,避免排队延迟。
- FP8 Rollout+MTP:FP8 降低单 token 延迟,MTP 提升小批量解码效率,大幅优化尾部延迟。
- PD 解耦(Prefill-Decode):预填充与解码分离部署,避免长前缀预填充干扰解码,稳定长周期样本进度。
3.6.3 Rollout 鲁棒性:心跳驱动容错
- Rollout 服务器定期发送心跳,编排器监控健康状态;故障服务器主动剔除,重试路由至健康节点,保障训练连续不中断。
4 智能体工程
核心定位
实现从直觉式编码(vibe coding,人工提示 AI 写代码)到智能体工程(agentic engineering,AI 自主规划、实现、迭代完成任务)的范式跃迁;
通过异步强化学习框架提升训练效率,规模化构建可验证智能体环境,支撑编码、搜索、幻灯片生成等长周期智能体任务。
4.1 Asynchronous RL for Agentic Tasks(智能体任务的异步强化学习)
核心目标
设计全异步、解耦的 RL 框架,高效处理长周期智能体轨迹生成,支持多任务 RL 联合训练。
核心算法
采用分组策略优化算法,每个问题采样 K 条智能体轨迹,基于平均奖励优化模型,仅用模型生成 token 计算损失。
4.1.1 Asynchronous RL Design for Agentic Training(智能体训练的异步 RL 设计)
1. 异步训练核心范式(解决同步 RL 痛点)
- 彻底解耦引擎:推理引擎(生成轨迹)、训练引擎(更新参数)部署在不同 GPU,消除同步等待。
- 工作流程
- 推理引擎不间断生成智能体轨迹;
- 轨迹达到阈值→推送训练引擎更新模型;
- 训练引擎每 K 次梯度更新→同步权重给推理引擎;
- 权重同步后重置优化器,缓解离策略偏差。
2. 服务化多任务训练设计-
- 多任务 Rollout 编排器:中央调度器管理各类智能体任务(编码、搜索等),任务以独立微服务注册。
- 统一轨迹格式:将异构任务轨迹标准化为消息列表,支持多任务联合训练。
- 规模化能力:支持1000 + 并发 Rollout,动态调整任务采样比例,精细化监控进度。
4.1.2 Optimizing Asynchronous Training Stability(优化异步训练稳定性)
1. Token-in-Token-out(TITO)网关
- 问题:重分词会导致 token 边界、截断错位,破坏动作 - 奖励对应关系。
- 方案:直接复用推理引擎的原始 token 序列,避免重分词误差,保障训练对齐。
2. 直接双边重要性采样(Token 级裁剪)
- 问题:异步训练中轨迹由不同模型版本生成,无法跟踪历史策略。
- 方案
- 复用 Rollout 对数概率作为旧策略代理;
- token 级双边裁剪
[1-εℓ,1+εh],超出区间的 token 屏蔽梯度; - 简化计算,避免历史策略 checkpoint 存储,提升稳定性。
3. 样本过滤机制
- 丢弃离策略样本:剔除模型版本过旧的轨迹,避免严重偏差。
- 剔除噪声样本:移除环境崩溃(非模型能力)导致的失败样本。
- 组填充策略:有效样本过半则重复填充,不足则丢弃整组,减少训练噪声。
4. DP-aware Routing(DP 感知路由)
- 方案:同一智能体的所有请求固定路由到同一 DP 秩,最大化KV 缓存复用。
- 效果:长上下文推理避免重复预填充,端到端延迟大幅降低,吞吐量提升。
4.2 Environment Scaling for Agents(智能体环境规模化)
核心目标
构建可验证、可执行的智能体训练环境,为编码、搜索、内容生成提供接地式反馈。
4.2.1 Software Engineering (SWE) Environments(软件工程环境)
1. 数据基础
- 收集海量真实 Issue-PR 对,经规则 + LLM 双重过滤,分类为 bug 修复、功能实现、重构等任务。
2. 环境构建流程
- 基于RepoLaunch 框架,自动分析仓库依赖、构建可执行环境、生成测试指令。
- LLM 实现日志解析,提取 Fail-to-Pass、Pass-to-Pass 测试用例。
3. 规模与覆盖
- 构建10k + 可验证环境,覆盖9 种编程语言(Python、Java、Go、C/C++、JS/TS、PHP、Ruby)。
4.2.2 Terminal Environments(终端环境)
提供两种规模化构建 Pipeline,均支持 Docker 化验证:
1. 种子数据合成 Pipeline
- 三阶段流程:任务草稿生成→ concrete 任务实现→迭代优化;
- 输出 Harbor 格式任务,包含描述、Docker 环境、测试脚本;
- Docker 构建准确率超 90%。
2. 网络语料合成 Pipeline
- 闭环设计:筛选高质量技术网页→编码 Agent 生成终端任务→自校验修正;
- 仅通过自验证的任务入库,保证任务质量与可执行性。
4.2.3 Search Tasks(搜索任务)
核心目标
构建高难度多跳 QA数据集,评估搜索智能体的多步骤推理与信息获取能力。
1. 网页知识图谱(WKG)构建
- 采集 200 万 + 高信息密度网页,做实体识别、信息抽取、图谱迭代更新。
2. 问题生成
- 以低频实体为种子,拓展多跳子图,生成需多源信息聚合的高难度问题。
3. 三阶段过滤验证
- 剔除无工具模型可解的问题;
- 剔除基础搜索智能体可快速解的问题;
- 验证智能体双向校验,移除答案不唯一、证据不一致的样本;
- 最终产出高难度、高质量、高可靠性的多跳 QA 对。
4.2.4 Inference with Context Management for Search Agents(搜索智能体的上下文管理推理)
1. 评估标准化-
- 采用OpenAI 官方评判提示 + o3-mini作为评判模型,避免开源评判器的系统偏差。
2. Keep-recent-k 策略
- 保留最近 k 轮工具观测,折叠旧观测以控制上下文长度;
- 设k=5,BrowseComp 性能从 55.3% 提升至 62.0%。
3. 分层上下文管理(HCM)
- 结合Keep-recent-k + Discard-all:上下文超 32k 则清空工具历史,重启上下文;
- 最终 BrowseComp 得分达75.9,登顶开源模型。

4.2.5 Slide Generation(幻灯片生成)
1. 自提升训练 Pipeline
- SFT 初始化基础能力→RL 多级奖励优化→拒绝采样 + 掩码微调注入知识。
2. 三级奖励机制
- Level-1(静态标记):约束布局、颜色、排版,检测幻觉 / 重复图片;
- Level-2(运行时渲染):校验尺寸、边界框,修复奖励黑客(内容截断、间距滥用);
- Level-3(视觉感知):优化空白、构图,提升视觉美感。
3. 效果提升
- 16:9 比例合规率:40%→92%;
- 人类评估:综合胜率67.5%,内容质量 60%、布局 57.5%、视觉 65%。

5 Adapting GLM-5 to Chinese Chip Infrastructure(GLM-5 国产芯片生态适配)
核心总览
- 核心目标:解决国产硬件生态异构带来的高性能部署难题,实现 GLM-5 在国产芯片上的全栈适配。
- 适配范围:完成华为昇腾、摩尔线程、海光、寒武纪、昆仑芯、沐曦、燧原7 大主流国产芯片平台的深度优化。
- 优化案例:以昇腾 Atlas 系列为典型,从量化、算子、推理引擎三层全栈优化。
5.1 混合精度 W4A8 量化
- 核心方案
- 标准 Attention/MLP 模块:W8A8(INT8)
- MoE 专家层:W4A8(INT4),大幅降低内存占用
- 关键技术
- 引入QuaRot抑制异常值
- 使用Flex_AWQ_SSZ做缩放校准,保障低比特部署精度无损
- 部署效果
744B 参数的 GLM-5 可单卡部署在昇腾 Atlas 800T A3机型。
5.2 高性能融合算子
针对 DSA 稀疏注意力的算力瓶颈,定制三大融合核:
- Lightning Indexer
融合分数计算、ReLU、TopK 为单算子,实现计算与内存访问重叠。
- Sparse Flash Attention
并行处理 KV 缓存 TopK 筛选与稀疏注意力计算,适配 GLM-5 稀疏模式。
- MLAPO
融合 13 个预处理小算子为 “超算子”,利用向量 / 计算单元并行提升端到端效率。
5.3 专用推理引擎优化
适配vLLM-Ascend与SGLang两大推理引擎,最大化硬件利用率:
- 异步调度
重叠 “设备→主机” 采样拷贝与解码步骤,消除调度气泡。
- 上下文管理
用RadixCache 前缀共享、PrefixCache实现 KV 缓存高效复用。
- 并行策略
混合数据并行 DP + 专家并行 EP,FlashComm拆分通信操作隐藏延迟。
- 多 Token 预测(MTP)
单步生成多 Token,提升 NPU 计算密度,缩短序列生成时间。
5.4 适配成果
- 单节点国产硬件性能≈国际双 GPU 集群
- 长序列场景部署成本降低 50%
6 Evaluation(模型评估)
核心总览
- 评估维度:ARC(agentic, reasoning,coding) 能力基准、真实智能体工程、真实通用能力三大维度
- 对比对象:GLM-4.7、DeepSeek-V3.2、Kimi-K2.5、Claude Opus 4.5、Gemini 3 Pro、GPT-5.2 (xhigh)
- 核心结论:GLM-5 为开源模型 SOTA,与闭源顶尖模型差距大幅缩小
6.1 ARC Benchmarks(智能体 - 推理 - 编码基准评估)
在 8 大 ARC 基准平均领先 GLM-4.7 约 20%,性能比肩闭源顶尖模型。

6.1.1 推理与通用基准
- 核心评测集
Humanity’s Last Exam(HLE)、AIME 2026、HMMT 2025、IMO-AnswerBench、GPQA-Diamond、LongBench v2
- 关键结果
- HLE (带工具):50.4,超越 Claude/Gemini
- HMMT 赛事:性能优于 Claude/Gemini
- LongBench v2:64.5,长上下文推理开源第一
- 综合推理能力比肩 Kimi-K2.5
6.1.2 编码基准
- 核心评测集
SWE-bench Verified、SWE-bench Multilingual、Terminal-Bench 2.0、CyberGym
- 关键结果
- SWE-bench Verified:77.8,开源 SOTA,超越 Gemini 3 Pro
- SWE-bench 多语言:73.3,超越 Gemini/GPT-5.2
- Terminal-Bench 2.0:修正歧义后60.7+,与 Claude 持平
- CyberGym:43.2,仅次于 Claude,开源第一
6.1.3 智能体能力基准
- 核心评测集
BrowseComp、BrowseComp-ZH、τ²-Bench、MCP-Atlas、Tool-Decathlon、Vending-Bench 2、GDPval-AA
- 关键结果
- BrowseComp:上下文管理后75.9,全球 SOTA
- BrowseComp-ZH:超越 Claude/Gemini,中文网页浏览第一
- 工具使用类任务:与 Claude Opus 4.5 相当
- Vending-Bench 2:余额 **$4,432**,开源第一
- GDPval-AA:超越 Claude,仅次于 GPT-5.2
6.2 Real-world Agentic Engineering Experience(真实智能体工程体验)
采用自研自动化基准CC-Bench-V2,无人工标注,全自动化评估。

6.2.1 前端评估(Agent-as-a-Judge)
- 评测栈
HTML、React、Vue、Svelte、Next.js,覆盖管理后台、游戏、可视化等场景
- 核心指标
构建成功率 (BSR)、实例成功率 (ISR)、检查项成功率 (CSR)
- 关键结果
- BSR:98%,与 Claude 相当
- CSR:接近 Claude,ISR 存在小幅差距

6.2.2 后端评估
- 评测内容
6 语言 85 项真实任务:功能开发、Bug 修复、性能优化
- 评估规则
全量单元测试全部通过才算 Pass@1
- 关键结果
Pass@1:25.8%,与 Claude (26.9%) 基本持平,大幅领先 GLM-4.7
6.2.3 长周期任务评估
- 仓库探索
Pass@1:65.6%,超越 Claude,开源第一
- 链式任务
Pass@1:52.3%,较 GLM-4.7 大幅提升,与 Claude 存在小幅差距
6.2.4 新 SWE 任务评估(SWE-rebench)

- 采用实时 GitHub 新 Issue,无数据污染
- 解决率:42.1%,开源领先,接近闭源模型
6.3 Real-world General Abilities(真实通用能力)
覆盖翻译、多语言对话、指令遵循、世界知识、工具调用五大高频场景。
- 机器翻译
中→英 / 日 / 韩等 7 个语向,ZMultiTransBench/MENT-SNS 双提升
- 多语言对话
LMArena 开源第一,ZMultiDialBench 人工评分显著提升
- 指令遵循
IF-Badcase/IFBench/MultiChallenge 三项全面超越 GLM-4.7
- 世界知识
SimpleQA 中英版 factual 准确率大幅提升
- 工具调用
ToolCall-Badcase 故障率下降,调用准确率显著优化
7 Conclusion(结论)
7.1 核心成果总结
- GLM-5 实现高性能推理 + 极致计算效率的平衡,完成从直觉式编码→智能体工程的范式转变。
- 技术创新:DSA 稀疏注意力、异步 RL 框架、异步智能体算法、国产芯片全栈适配。
- 性能表现:开源模型 SOTA,在编码、智能体、长上下文任务追平顶尖闭源模型。
7.2 范式转变意义
- 证明开源权重模型可在复杂真实工作流中对标顶级闭源系统。
- 重新定义实用 AI 价值:从静态榜单跑分转向真实工程落地。
7.3 开源愿景
- 开源模型与代码,推动社区从静态基准转向高效智能体通用人工智能研究。
- 加速 AI 自主规划、执行、迭代复杂任务的行业落地。

浙公网安备 33010602011771号