GLM-5

GLM-5 

一、论文基础信息

  1. 标题:GLM-5: from Vibe Coding to Agentic Engineering
     
    中文翻译:GLM-5:从直觉式编码到智能体工程
  2. 作者:GLM-5 团队(智谱 AI & 清华大学)
  3. 来源:arXiv 预印本(cs.LG,机器学习方向)
  4. 发布时间:2026 年 2 月 24 日
 

二、研究背景与问题

 

(一)研究动机(现有技术不足)

 
  1. 能力与成本矛盾:大语言模型从被动知识库转向主动问题求解器,但计算成本高、现实场景适配性差,复杂软件工程场景成为核心瓶颈。
  2. 前代模型局限:GLM-4.5 虽融合智能体、推理、编码(ARC)能力,但训练 / 推理效率不足,长上下文理解与复杂长周期交互学习能力有限。
  3. 范式缺陷:传统 “直觉式编码(vibe coding)” 依赖人工提示,无法实现 AI 自主完成端到端软件工程。
  4. 训练框架短板:同步强化学习存在 GPU 空闲、迭代慢的问题,长周期智能体任务训练受同步瓶颈制约。
  5. 注意力机制缺陷:滑动窗口、线性注意力等高效方案存在信息丢失,长上下文细粒度检索性能下降。
  6. 生态适配不足:开源模型对国产 GPU 硬件生态适配性差,部署成本高。
 

(二)研究问题

 
  1. 如何在提升 ARC 能力的同时,大幅降低训练与推理成本?
  2. 如何设计高效异步强化学习框架,提升长周期复杂交互的学习效率与质量?
  3. 如何优化预训练架构、数据与流程,强化长上下文、编码、推理能力?
  4. 如何实现模型对国产 GPU 生态的全栈适配?
  5. 如何完成从 “直觉式编码” 到 “智能体工程” 的范式转变,让 AI 自主完成端到端软件工程?

 

1 Introduction

 

1.1 研究开篇:AGI 发展的核心诉求

  1. AGI 的核心方向:追求通用人工智能不仅需要模型参数规模化,更要从本质上重新思考智能效率自主进化架构
  2. 范式转变背景:大语言模型(LLM)正从被动的知识存储库转向主动的问题求解器,能力定位发生根本性变化。
 

1.2 前代模型(GLM-4.5)的成果与局限

 

1.2.1 前代成果

 
GLM-4.5 验证了将智能体(Agentic)、推理(Reasoning)、编码(Coding)即 ARC 能力融合进混合专家(MoE)架构,可在多类基准测试中取得 SOTA 表现。
 

1.2.2 核心局限

  1. 计算成本瓶颈:训练与推理的算力开销过高,效率不足。
  2. 现实适配短板:在复杂软件工程等真实场景的适配能力差,无法满足落地需求。
  3. 能力边界:长上下文理解、复杂长周期交互的学习能力有限,难以支撑自主智能体任务。

1.3 GLM-5 的模型定位与核心目标

  1. 产品定位:智谱 AI 下一代旗舰基座模型,旨在突破前代的计算成本与现实适配双重壁垒。
  2. 核心目标
    • 实现性能与效率的双重跃迁,登顶主流开源评测榜单。
    • 重新定义真实场景编码能力,突破 SWE-bench 等传统静态基准的局限。
    • 支撑 AI 完成端到端复杂软件开发,完成从 “直觉式编码” 到 “智能体工程” 的范式升级。
     
 

1.4 GLM-5 核心性能结果

1.4.1 基准测试整体表现

image
8 项 ARC(智能体、推理、编码)基准(Humanity’s Last Exam、SWE-bench Verified、Terminal-Bench 2.0 等)中:
 
  • 较前代 GLM-4.7平均提升约 20%
  • 性能比肩 Claude Opus 4.5、GPT-5.2 (xhigh),优于 Gemini 3 Pro。
 

1.4.2 权威指数表现

 
Artificial Analysis Intelligence Index v4.0中得分 50,成为开源权重模型榜首,较 GLM-4.7 提升 8 分,是首个在该指数突破 50 分的开源模型。
 

1.4.3 真实人机交互评测

 
在 UC 伯克利发起的LMArena(百万级真实任务、人工评判)中:
 
  • 位列文本竞技场、代码竞技场开源模型双第一
  • 整体表现与 Claude Opus 4.5、Gemini 3 Pro 持平。
 

1.4.4 长周期任务表现

 
  1. Vending-Bench 2:开源模型中排名第一,账户余额 $4,432,接近 Claude Opus 4.5,长周期规划与资源管理能力突出。
  2. CC-Bench-V2:在前、后端及长周期任务上大幅超越 GLM-4.7,缩小与闭源模型差距。
 

1.5 GLM-5 训练流程总览

 
采用三段式训练 pipeline,全程用同策略跨阶段蒸馏防止灾难性遗忘,保留推理能力的同时兼顾通用性:
 
  1. 基础预训练:27 万亿 token 语料,优先代码与推理数据。
  2. 中期训练:将上下文长度从 4K 逐步扩展至 200K,聚焦长上下文智能体数据。
  3. 后训练:超越标准 SFT,采用序列式强化学习—— 推理 RL→智能体 RL→通用 RL。
image

1.6 GLM-5 四大核心技术贡献

 
  1. 采用 DSA(DeepSeek Sparse Attention)
     
    动态分配注意力资源,显著降低训练与推理成本;模型参数扩至 744B,训练 token 达 28.5T,不损失长上下文与推理深度。
  2. 全新异步强化学习基础设施
     
    解耦生成与训练环节,最大化 GPU 利用率,消除同步瓶颈,大幅提升后训练效率。
  3. 新型异步智能体 RL 算法
     
    优化自主决策、规划与自纠错能力,让模型从复杂长周期交互中高效学习,支撑真实编码场景。
  4. 国产 GPU 生态全栈适配
     
    从底层内核到上层推理框架深度优化,适配华为昇腾、摩尔线程等7 大主流国产芯片平台
 

1.7 模型价值与开源意义

 
  1. 核心价值:GLM-5 不仅是性能更强的模型,更是高效、实用的下一代 AI 智能体基座
  2. 开源初衷:向社区开放模型,推动高效智能体通用人工智能的前沿发展,加速从直觉式编码到智能体工程的行业转型。
 

2 Pre-Training

 
预训练分为通用语言与编码能力预训练智能体与长上下文能力中期训练两阶段,总训练 token 规模达28.5 万亿
 

2.1 Architecture(模型架构)

核心优化点

  1. 模型规模缩放
    • 总参数扩至744B,激活参数 40B(GLM-4.5 为 355B 总 / 32B 激活)。
    • 专家数增至 256 个,层数降至 80 层,降低专家并行通信开销。
     
  2. 多隐层注意力(MLA)优化
    • 原始 MLA 在 Muon 优化器下性能弱于 GQA-8,提出Muon Split方法:将注意力头的投影矩阵拆分后独立正交化,使 MLA 性能追平 GQA-8。
    • 解码计算成本高:将头维度从 192 提至 256,注意力头数减 1/3,推出MLA-256变体,保持训练参数与计算量不变,降低解码开销。
     
  3. 参数共享多 token 预测(MTP
    • 传统 MTP 需 n 层预测 n 个 token,内存占用高;GLM-5 训练时共享 3 层 MTP 参数,推理时 speculative steps=4,接受长度达 2.76,优于 DeepSeek-V3.2 的 2.55。
     

2.1.1 Continued Pre-Training with DeepSeek Sparse Attention (DSA)

 

核心内容

 
  1. DSA 核心思想
     
    替代传统 O (L²) 稠密注意力,基于 token 内容动态筛选重要 token,长序列注意力计算量降低1.5-2 倍,128K 上下文成本减半。
  2. 两阶段训练策略
    • 稠密预热:从中期训练结束的基模型开始,1000 步预热,冻结基础权重仅训练索引器。
    • 稀疏适配:仅 20B token 训练,即可让 DSA 模型性能匹配原始 MLA 模型。
     
  3. 实验验证
    • 长上下文基准(MQ-NIAH-128k、SQuAD-128k 等)上,DSA 与 MLA 性能接近,SFT 损失曲线一致。
    • 优势:无需从头训练,从稠密模型持续预训练即可适配,成本极低。
     
 

2.1.2 Ablation Study of Efficient Attention Variants(高效注意力变体消融)

实验设置

基线 GLM-9B ,对比滑动窗口注意力(SWA)、门控 DeltaNet(GDN) 及改进方案,评估长上下文性能。

核心改进与结果

  1. 滑动窗口类:SWA Interleave(固定交替):一层全注意力、一层窗口注意力交替排列、SWA Pattern(搜索优化):束搜索自动找 “哪些层用窗口、哪些保留全注意力”
     
    基于 PostNAS 搜索最优全注意力 / 窗口注意力层组合,替代固定交替模式,RULER@128K 从 6.51 提升至 53.95,长度泛化性强。image
  2. 线性注意力 GDN(Gated DeltaNet):GDN、SimpleGDN:砍掉 GDN 的 Conv1d 和门控
    image
    移除 GDN 的 Conv1d 与门控模块,直接复用预训练权重,平衡效率与性能,HELMET-ICL@128K 较基线提升 4.48。
  3. DSA 绝对优势
     
    所有高效注意力均存在精度损失,而DSA 无信息丢失,token 级稀疏化保留长程依赖,可应用于所有层无性能下降。
 

2.2 Pre-training Data(预训练数据)

 

四大数据维度优化

  1. 网页数据
     
    新增 DCLM 分类器与世界知识分类器,从低质数据中蒸馏长尾知识,提升数据质量。
  2. 代码数据
    • 代码语料 unique token 增加 28%,修复 Software Heritage 元数据对齐问题。
    • 优化低资源编程语言(Scala、Swift 等)采样策略,提升小语种代码能力。
     
  3. 数理科学数据
    • 从网页、书籍、论文采集高质量数据,优化 PDF / 网页抽取流程。
    • 用 LLM 评分筛选教育性内容,禁用 AI 合成数据,避免噪声。
     
  4. 数据原则
     
    严格去重、过滤,优先高质量、高教育价值、非合成的真实数据。
 

2.3 Mid-Training(中期训练)

核心目标

强化推理、长上下文、智能体能力,上下文窗口从 4K 扩展至 200K
 

关键优化

  1. 上下文与规模扩展
     
    分三阶段递进:32K(1T token)→128K(500B token)→200K(50B token),200K 阶段大幅提升超长文档与多文件代码库处理能力。
  2. 软件工程数据
     
    放宽仓库筛选条件,获取约 1000 万 Issue-PR 对,单 Issue 级质量过滤降噪,相关文件检索更全面,覆盖真实工程场景。
  3. 长上下文数据
    • 自然数据:书籍、论文、文档多阶段过滤(PPL、去重、长度),上采样知识密集域。
    • 合成数据:用 NextLong、EntropyLong 方法构建长程依赖,缓解 “中间丢失” 问题;200K 阶段加入 MRCR 类数据,强化多轮对话召回。
     
 

2.4 Training Infrastructure(训练基础设施)

 

2.4.1 Memory Efficiency(内存效率)

 
  1. 灵活 MTP 部署:MTP 输出层与主输出层同阶段共享参数,嵌入层 / Transformer 层放前一阶段,降低内存压力。
  2. Pipeline ZeRO2 梯度分片:梯度在数据并行秩间分片,仅保留 2 个全量缓冲,减少持久梯度内存。
  3. Muon 优化器零冗余通信:仅聚合参数分片,重叠计算与通信,降低峰值内存。
  4. Pipeline 激活卸载:前向后将激活卸载至主机内存,反向时重载,结合细粒度重计算,消除 GPU 内存占用。
  5. 序列分块输出投影:分块计算输出投影与损失,降低峰值内存,保持性能。
 

2.4.2 Parallelism Efficiency(并行效率)

  1. 高效延迟权重梯度计算:延迟关键路径梯度计算,优化存储与通信重叠,提升吞吐量。
  2. 长序列高效训练: workload 感知序列重排序、注意力计算动态重分配、上下文并行组灵活划分,解决负载不均衡。
  3. 分层 All-to-All 通信:重叠节点内 / 间 QKV 张量通信,降低延迟。

2.4.3 INT4 Quantization-aware training(INT4 量化感知训练)

  1. SFT 阶段采用 INT4 QAT,提升低精度下的准确率。
  2. 研发训练 / 推理通用量化内核,保证行为位一致,降低训练开销。

3 后训练(整体总览)

核心目标

 
将预训练基础模型转化为具备强推理、编码、智能体能力的对话模型,采用渐进式对齐策略,全程通过同策略跨阶段蒸馏避免能力退化。
 

整体流程

 
多任务监督微调(SFT)→ 推理强化学习(Reasoning RL)→ 智能体强化学习(Agentic RL)→ 通用强化学习(General RL)→ 同策略跨阶段蒸馏

3.1 Supervised Fine-Tuning(监督微调)

核心定位

后训练的起点环节,大幅扩充智能体与编码数据规模,奠定模型基础能力。
 

1. 数据规模与上下文

  • 最大上下文长度扩展至202752 tokens
  • 语料覆盖三大类:
    1. 通用对话:问答、写作、角色扮演、翻译、多轮对话、长上下文交互
    2. 推理:数学、编程、科学推理
    3. 编码 & 智能体:前后端工程代码、工具调用、编码 / 搜索 / 通用智能体
     

2. 三大思维特性(核心创新)

  1. Interleaved Thinking(交错思维)
     
    模型在每次回复与工具调用前先思考,提升指令遵循与生成质量。
  2. Preserved Thinking(保留思维)
     
    编码智能体场景下,自动保留多轮对话的所有思维块,复用推理逻辑,减少信息丢失与不一致,适配长周期复杂任务。
  3. Turn-level Thinking(轮次级思维)
     
    支持单轮会话的推理开关:轻量请求关闭思维降低延迟,复杂任务开启提升精度。
image

3. 各任务专项优化

  • 通用对话:回复风格更逻辑、简洁,扩充多语言角色扮演数据,通过自动 + 人工筛选保障质量。
  • 推理任务:构建可验证问题,用拒绝采样合成高质量数据;按难度过滤,仅保留 GLM-4.7 难以解决的难题。
  • 编码 & 智能体:搭建大量执行环境获取高质量轨迹,用专家 RL 与拒绝采样优化数据;掩码轨迹中的错误片段,让模型学习纠错行为。
 

3.2 Reasoning RL(推理强化学习)

 

核心目标

 
专项提升模型数学、科学、代码、工具集成推理能力,解决训练 - 推理分布不匹配问题。
 

1. 算法 backbone

  • 基于GRPO算法,融合IcePop技术,移除 KL 正则项加速收敛。
  • 显式区分训练策略(梯度更新)与推理策略(轨迹采样),解决训练 - 推理不匹配。
image

2. DSA RL 关键洞察

  • DSA 索引器的top-k 选择是 RL 稳定性关键,非确定性 top-k 会导致 RL 性能暴跌。
  • 解决方案:全程使用torch.topk(确定性算子),RL 阶段默认冻结索引器参数,保障训练稳定。

3. 混合领域推理 RL

 
覆盖四大领域,混合训练稳定涨点:
 
  1. 数学:开源数据集 + 外部标注,过滤 GLM-4.7 难解问题
  2. 科学:同数学数据策略,聚焦高难度知识点
  3. 代码:竞赛编程(Codeforces)+ 科学编码,最小化实现逻辑
  4. 工具集成推理(TIR):高难度 STEM 问题,需外部工具解答
 
  • 奖励机制:领域专属评估模型 / 系统产出二元结果奖励。
 
 

3.3 Agentic RL(智能体强化学习)

核心目标

提升编码、搜索智能体性能,解决同步 RL 长周期 Rollout 的 GPU 空闲问题。

1. 核心框架:全异步解耦 RL

  • 解耦推理引擎生成智能体轨迹:一步步调用工具、写代码、执行操作)与训练引擎(更新参数),通过多任务 Rollout 编排器实现高吞吐量联合训练。
  • 权重定期同步,保障训练近似同策略;每次同步后重置优化器,缓解离策略问题。

2. 训练稳定性两大机制

  1. Token-in-Token-out(TITO)网关
     
    直接使用推理引擎的 token 序列,避免重分词导致的边界 / 截断不匹配,保留动作 - 奖励精准对应。
  2. 直接双边重要性采样
     
    token 级裁剪([1-εℓ,1+εh]),屏蔽极端策略偏差的 token;复用 Rollout 对数概率,无需跟踪历史策略,降低计算开销→ 防止策略偏差太大导致训练崩溃。

3. 加速优化:DP 感知路由

  • 强制同一智能体的所有请求路由到固定数据并行秩,最大化 KV 缓存复用,长上下文推理速度大幅提升。

4. 样本过滤

  • 丢弃过于陈旧的离策略轨迹,剔除环境崩溃导致的噪声样本,提升训练信号纯度。
 

3.4 General RL(通用强化学习)

核心目标

完成人类对齐,让模型输出更贴合人类使用习惯,兼顾正确性与体验。

1. 三维优化目标

  1. 基础正确性:最小化指令失败、逻辑矛盾、事实错误、幻觉、语言不流畅。
  2. 情绪智能:输出更共情、自然,贴近人类沟通风格。
  3. 任务特定质量:针对写作、翻译、角色扮演等任务,做细粒度优化。

2. 混合奖励系统(三大奖励互补)

  1. 规则奖励:精准可解释,仅适配确定性规则场景。
  2. 结果奖励模型(ORM):方差低、训练快,易被奖励黑客攻击。
  3. 生成奖励模型(GRM):抗攻击能力强,方差较高。
  • 三者结合,平衡精度、效率、鲁棒性。

3. 人在环对齐

  • 引入人类专家撰写的回复作为风格与质量锚点,避免模型生成刻板、公式化的 “模型文风”。

3.5 On-Policy Cross-Stage Distillation(同策略跨阶段蒸馏)

核心问题

 
多阶段 RL 依次优化不同目标,会导致前期习得能力退化(灾难性遗忘)。
 

核心方案

  1. SFT、推理 RL、通用 RL的最终 checkpoint 为教师模型
  2. 采用同策略蒸馏算法,用教师模型的推理 logits 计算优势函数,快速恢复前期能力。

训练配置

  • GRPO 组大小设为1,提升数据吞吐量;batch size=1024。
  • 优势函数直接由学生模型与教师模型的对数概率差计算,无需大规模样本组。

3.6 RL Training Infrastructure: The slime Framework

核心定位

 
GLM-5统一的后训练基础设施,支撑大规模端到端强化学习,复用并升级 GLM-4.5 的 slime 框架。

3.6.1 Scaling Out: 灵活训练(高度定制化 Rollout轨迹生成)

  1. 定制化 Rollout:无需修改底层架构,即可实现多轮交互、工具调用、环境反馈等任务专属逻辑,能支持推理 RL、智能体 RL、通用 RL 等所有场景。
  2. 服务化 Rollout:通过 HTTP API 暴露 Rollout 服务器,外部智能体框架直接调用,解耦 Rollout 逻辑与训练流程。

3.6.2 Scaling Up: 尾部延迟优化(RL Rollout 核心)

  • RL 优化目标是端到端延迟,单个慢样本会阻塞整个训练步骤。
  1. 无队列服务:多节点推理 + DP 注意力,提供充足分布式 KV 缓存,避免排队延迟。
  2. FP8 Rollout+MTP:FP8 降低单 token 延迟,MTP 提升小批量解码效率,大幅优化尾部延迟。
  3. PD 解耦(Prefill-Decode):预填充与解码分离部署,避免长前缀预填充干扰解码,稳定长周期样本进度。

3.6.3 Rollout 鲁棒性:心跳驱动容错

  • Rollout 服务器定期发送心跳,编排器监控健康状态;故障服务器主动剔除,重试路由至健康节点,保障训练连续不中断。

4 智能体工程

核心定位

 
实现从直觉式编码(vibe coding,人工提示 AI 写代码)到智能体工程(agentic engineering,AI 自主规划、实现、迭代完成任务)的范式跃迁;
 
通过异步强化学习框架提升训练效率,规模化构建可验证智能体环境,支撑编码、搜索、幻灯片生成等长周期智能体任务。

4.1 Asynchronous RL for Agentic Tasks(智能体任务的异步强化学习)

核心目标

 
设计异步解耦的 RL 框架,高效处理长周期智能体轨迹生成,支持多任务 RL 联合训练。
 

核心算法

 
采用分组策略优化算法,每个问题采样 K 条智能体轨迹,基于平均奖励优化模型,仅用模型生成 token 计算损失。
 

4.1.1 Asynchronous RL Design for Agentic Training(智能体训练的异步 RL 设计)

1. 异步训练核心范式(解决同步 RL 痛点)

  • 彻底解耦引擎:推理引擎(生成轨迹)、训练引擎(更新参数)部署在不同 GPU,消除同步等待。
  • 工作流程
    1. 推理引擎不间断生成智能体轨迹;
    2. 轨迹达到阈值→推送训练引擎更新模型;
    3. 训练引擎每 K 次梯度更新→同步权重给推理引擎;
    4. 权重同步后重置优化器,缓解离策略偏差。
     
 

2. 服务化多任务训练设计-

  • 多任务 Rollout 编排器中央调度器管理各类智能体任务(编码、搜索等),任务以独立微服务注册。
  • 统一轨迹格式:将异构任务轨迹标准化为消息列表,支持多任务联合训练。
  • 规模化能力:支持1000 + 并发 Rollout,动态调整任务采样比例,精细化监控进度。

4.1.2 Optimizing Asynchronous Training Stability(优化异步训练稳定性)

1. Token-in-Token-out(TITO)网关

  • 问题:重分词会导致 token 边界、截断错位,破坏动作 - 奖励对应关系。
  • 方案:直接复用推理引擎的原始 token 序列,避免重分词误差,保障训练对齐。

2. 直接双边重要性采样(Token 级裁剪)

  • 问题:异步训练中轨迹由不同模型版本生成,无法跟踪历史策略。
  • 方案
    1. 复用 Rollout 对数概率作为旧策略代理;
    2. token 级双边裁剪[1-εℓ,1+εh],超出区间的 token 屏蔽梯度;
    3. 简化计算,避免历史策略 checkpoint 存储,提升稳定性。
     

3. 样本过滤机制

  • 丢弃离策略样本剔除模型版本过旧的轨迹,避免严重偏差。
  • 剔除噪声样本:移除环境崩溃(非模型能力)导致的失败样本。
  • 组填充策略:有效样本过半则重复填充,不足则丢弃整组,减少训练噪声。

4. DP-aware Routing(DP 感知路由)

  • 方案:同一智能体的所有请求固定路由到同一 DP 秩,最大化KV 缓存复用
  • 效果:长上下文推理避免重复预填充,端到端延迟大幅降低,吞吐量提升。

4.2 Environment Scaling for Agents(智能体环境规模化)

核心目标

 
构建可验证、可执行智能体训练环境,为编码、搜索、内容生成提供接地式反馈。

4.2.1 Software Engineering (SWE) Environments(软件工程环境)

1. 数据基础

 
  • 收集海量真实 Issue-PR 对,经规则 + LLM 双重过滤,分类为 bug 修复、功能实现、重构等任务。

2. 环境构建流程

  • 基于RepoLaunch 框架,自动分析仓库依赖、构建可执行环境、生成测试指令。
  • LLM 实现日志解析,提取 Fail-to-Pass、Pass-to-Pass 测试用例。

3. 规模与覆盖

  • 构建10k + 可验证环境,覆盖9 种编程语言(Python、Java、Go、C/C++、JS/TS、PHP、Ruby)。

4.2.2 Terminal Environments(终端环境)

 
提供两种规模化构建 Pipeline,均支持 Docker 化验证:
 

1. 种子数据合成 Pipeline

  • 三阶段流程:任务草稿生成→ concrete 任务实现→迭代优化;
  • 输出 Harbor 格式任务,包含描述、Docker 环境、测试脚本;
  • Docker 构建准确率超 90%

2. 网络语料合成 Pipeline

  • 闭环设计:筛选高质量技术网页→编码 Agent 生成终端任务→自校验修正
  • 仅通过自验证的任务入库,保证任务质量与可执行性。

4.2.3 Search Tasks(搜索任务)

核心目标

 
构建高难度多跳 QA数据集,评估搜索智能体的多步骤推理与信息获取能力。
 

1. 网页知识图谱(WKG)构建

  • 采集 200 万 + 高信息密度网页,做实体识别、信息抽取、图谱迭代更新。

2. 问题生成

  • 以低频实体为种子,拓展多跳子图,生成需多源信息聚合的高难度问题。

3. 三阶段过滤验证

  1. 剔除无工具模型可解的问题;
  2. 剔除基础搜索智能体可快速解的问题;
  3. 验证智能体双向校验,移除答案不唯一、证据不一致的样本;
  • 最终产出高难度、高质量、高可靠性的多跳 QA 对。
 

4.2.4 Inference with Context Management for Search Agents(搜索智能体的上下文管理推理)

1. 评估标准化-

  • 采用OpenAI 官方评判提示 + o3-mini作为评判模型,避免开源评判器的系统偏差。

2. Keep-recent-k 策略

  • 保留最近 k 轮工具观测,折叠旧观测以控制上下文长度;
  • k=5,BrowseComp 性能从 55.3% 提升至 62.0%。

3. 分层上下文管理(HCM)

  • 结合Keep-recent-k + Discard-all:上下文超 32k 则清空工具历史,重启上下文;
  • 最终 BrowseComp 得分达75.9,登顶开源模型。
image

4.2.5 Slide Generation(幻灯片生成)

1. 自提升训练 Pipeline

  • SFT 初始化基础能力→RL 多级奖励优化→拒绝采样 + 掩码微调注入知识。

2. 三级奖励机制

  1. Level-1(静态标记):约束布局、颜色、排版,检测幻觉 / 重复图片;
  2. Level-2(运行时渲染):校验尺寸、边界框,修复奖励黑客(内容截断、间距滥用);
  3. Level-3(视觉感知):优化空白、构图,提升视觉美感。

3. 效果提升

  • 16:9 比例合规率:40%→92%;
  • 人类评估:综合胜率67.5%,内容质量 60%、布局 57.5%、视觉 65%。
image

5 Adapting GLM-5 to Chinese Chip Infrastructure(GLM-5 国产芯片生态适配)

核心总览

  • 核心目标:解决国产硬件生态异构带来的高性能部署难题,实现 GLM-5 在国产芯片上的全栈适配。
  • 适配范围:完成华为昇腾、摩尔线程、海光、寒武纪、昆仑芯、沐曦、燧原7 大主流国产芯片平台的深度优化。
  • 优化案例:以昇腾 Atlas 系列为典型,从量化、算子、推理引擎三层全栈优化。

5.1 混合精度 W4A8 量化

  1. 核心方案
    • 标准 Attention/MLP 模块:W8A8(INT8)
    • MoE 专家层:W4A8(INT4),大幅降低内存占用
     
  2. 关键技术
    • 引入QuaRot抑制异常值
    • 使用Flex_AWQ_SSZ做缩放校准,保障低比特部署精度无损
     
  3. 部署效果
     
    744B 参数的 GLM-5 可单卡部署在昇腾 Atlas 800T A3机型。

5.2 高性能融合算子

针对 DSA 稀疏注意力的算力瓶颈,定制三大融合核:
  1. Lightning Indexer
     
    融合分数计算、ReLU、TopK 为单算子,实现计算与内存访问重叠。
  2. Sparse Flash Attention
     
    并行处理 KV 缓存 TopK 筛选与稀疏注意力计算,适配 GLM-5 稀疏模式。
  3. MLAPO
     
    融合 13 个预处理小算子为 “超算子”,利用向量 / 计算单元并行提升端到端效率。

5.3 专用推理引擎优化

适配vLLM-AscendSGLang两大推理引擎,最大化硬件利用率:
  1. 异步调度
     
    重叠 “设备→主机” 采样拷贝与解码步骤,消除调度气泡。
  2. 上下文管理
     
    RadixCache 前缀共享PrefixCache实现 KV 缓存高效复用。
  3. 并行策略
     
    混合数据并行 DP + 专家并行 EPFlashComm拆分通信操作隐藏延迟。
  4. 多 Token 预测(MTP)
     
    单步生成多 Token,提升 NPU 计算密度,缩短序列生成时间。

5.4 适配成果

  • 单节点国产硬件性能≈国际双 GPU 集群
  • 长序列场景部署成本降低 50%

6 Evaluation(模型评估)

核心总览

  • 评估维度:ARC(agentic, reasoning,coding) 能力基准、真实智能体工程、真实通用能力三大维度
  • 对比对象:GLM-4.7、DeepSeek-V3.2、Kimi-K2.5、Claude Opus 4.5、Gemini 3 Pro、GPT-5.2 (xhigh)
  • 核心结论:GLM-5 为开源模型 SOTA,与闭源顶尖模型差距大幅缩小

6.1 ARC Benchmarks(智能体 - 推理 - 编码基准评估)

 
在 8 大 ARC 基准平均领先 GLM-4.7 约 20%,性能比肩闭源顶尖模型。
image

6.1.1 推理与通用基准

  1. 核心评测集
     
    Humanity’s Last Exam(HLE)、AIME 2026、HMMT 2025、IMO-AnswerBench、GPQA-Diamond、LongBench v2
  2. 关键结果
    • HLE (带工具):50.4,超越 Claude/Gemini
    • HMMT 赛事:性能优于 Claude/Gemini
    • LongBench v2:64.5,长上下文推理开源第一
    • 综合推理能力比肩 Kimi-K2.5
     
 

6.1.2 编码基准

  1. 核心评测集
     
    SWE-bench Verified、SWE-bench Multilingual、Terminal-Bench 2.0、CyberGym
  2. 关键结果
    • SWE-bench Verified:77.8,开源 SOTA,超越 Gemini 3 Pro
    • SWE-bench 多语言:73.3,超越 Gemini/GPT-5.2
    • Terminal-Bench 2.0:修正歧义后60.7+,与 Claude 持平
    • CyberGym:43.2,仅次于 Claude,开源第一
     

6.1.3 智能体能力基准

  1. 核心评测集
     
    BrowseComp、BrowseComp-ZH、τ²-Bench、MCP-Atlas、Tool-Decathlon、Vending-Bench 2、GDPval-AA
  2. 关键结果
    • BrowseComp:上下文管理后75.9,全球 SOTA
    • BrowseComp-ZH:超越 Claude/Gemini,中文网页浏览第一
    • 工具使用类任务:与 Claude Opus 4.5 相当
    • Vending-Bench 2:余额 **$4,432**,开源第一
    • GDPval-AA:超越 Claude,仅次于 GPT-5.2
     

6.2 Real-world Agentic Engineering Experience(真实智能体工程体验)

采用自研自动化基准CC-Bench-V2,无人工标注,全自动化评估。
image

6.2.1 前端评估(Agent-as-a-Judge)

  1. 评测栈
     
    HTML、React、Vue、Svelte、Next.js,覆盖管理后台、游戏、可视化等场景
  2. 核心指标
     
    构建成功率 (BSR)、实例成功率 (ISR)、检查项成功率 (CSR)
  3. 关键结果
    • BSR:98%,与 Claude 相当
    • CSR:接近 Claude,ISR 存在小幅差距
    image

6.2.2 后端评估

  1. 评测内容
     
    6 语言 85 项真实任务:功能开发、Bug 修复、性能优化
  2. 评估规则
     
    全量单元测试全部通过才算 Pass@1
  3. 关键结果
     
    Pass@1:25.8%,与 Claude (26.9%) 基本持平,大幅领先 GLM-4.7

6.2.3 长周期任务评估

  1. 仓库探索
     
    Pass@1:65.6%,超越 Claude,开源第一
  2. 链式任务
     
    Pass@1:52.3%,较 GLM-4.7 大幅提升,与 Claude 存在小幅差距

6.2.4 新 SWE 任务评估(SWE-rebench)

image
  • 采用实时 GitHub 新 Issue,无数据污染
  • 解决率:42.1%,开源领先,接近闭源模型

6.3 Real-world General Abilities(真实通用能力)

 
覆盖翻译、多语言对话、指令遵循、世界知识、工具调用五大高频场景。
 
  1. 机器翻译
     
    中→英 / 日 / 韩等 7 个语向,ZMultiTransBench/MENT-SNS 双提升
  2. 多语言对话
     
    LMArena 开源第一,ZMultiDialBench 人工评分显著提升
  3. 指令遵循
     
    IF-Badcase/IFBench/MultiChallenge 三项全面超越 GLM-4.7
  4. 世界知识
     
    SimpleQA 中英版 factual 准确率大幅提升
  5. 工具调用
     
    ToolCall-Badcase 故障率下降,调用准确率显著优化

7 Conclusion(结论)

7.1 核心成果总结

 
  1. GLM-5 实现高性能推理 + 极致计算效率的平衡,完成从直觉式编码→智能体工程的范式转变。
  2. 技术创新:DSA 稀疏注意力、异步 RL 框架、异步智能体算法、国产芯片全栈适配。
  3. 性能表现:开源模型 SOTA,在编码、智能体、长上下文任务追平顶尖闭源模型

7.2 范式转变意义

  • 证明开源权重模型可在复杂真实工作流中对标顶级闭源系统。
  • 重新定义实用 AI 价值:从静态榜单跑分转向真实工程落地。

7.3 开源愿景

  • 开源模型与代码,推动社区从静态基准转向高效智能体通用人工智能研究。
  • 加速 AI 自主规划、执行、迭代复杂任务的行业落地。
 
posted @ 2026-04-19 17:23  卓然666  阅读(216)  评论(0)    收藏  举报
Live2D