GLM-5.3 深度解读:当 Post-Training 成为唯一的答案
2026年8月14日,智谱通过 Z.ai 正式发布了 GLM-5.3。https://z.ai/subscribe?ic=Y2H91IWSU3

这不是一次常规的版本迭代。官方博客的第一句话就定下了基调:
"Scaling post-training is all we did for GLM-5.3."
翻译过来就是:我们什么都没改,只是把 post-training 的规模拉满了。
而结果令人震惊——同一个 base model,编程能力在关键基准上提升了 6 倍,网络安全能力出现了意料之外的涌现,甚至在某些长程任务上追平或超越了闭源巨头。
一、最反直觉的发现:底座不变,能力跃迁
GLM-5.3 与 GLM-5.2 共享完全相同的基础模型。所有的提升,100% 来自 post-training 阶段的规模化。
这意味着什么?
在 LLM 领域,我们习惯了"大力出奇迹"的叙事:更大的模型、更多的参数、更长的预训练。但 GLM-5.3 给出了一个截然不同的信号——当 base model 的质量达到一定阈值后,post-training 的规模化可能带来比预训练更高的边际收益。
智谱在过去一个月里做的,是在他们已经搭建好的技术栈上持续加码:
-
IndexShare:高效长上下文处理
-
SAO(Self-Adaptive Optimization)with compaction:针对长程任务的强化学习
-
slime:大规模异步训练框架
-
以及最关键的——海量真实工作流环境的积累与合成
二、编程能力:从"能做"到"能独立完成"
如果说 GLM-5.2 是一个"能写代码的助手",那么 GLM-5.3 正在向"能独立完成工程任务的 Agent"进化。
数据不会说谎
表格
| 基准测试 | GLM-5.3 | GLM-5.2 | 提升幅度 |
|---|---|---|---|
| Terminal Bench 3.0 | 28.3 | 4.6 | 6.1x |
| DeepSWE v1.1 | 66.9 | 46.2 | 1.4x |
| Agents' Last Exam | 28.5 | 23.8 | 1.2x |
| AutomationBench | 48.2 | 26.2 | 1.8x |
Terminal Bench 3.0 的 6 倍跃升是最引人注目的。这个基准测试的是模型在真实终端环境中的复杂操作能力——不是写个函数那么简单,而是在一个完整的开发环境中理解上下文、执行命令、调试错误、完成多步骤任务。
从 4.6 到 28.3,意味着 GLM-5.3 从"几乎不会做"跨入了"能稳定完成"的区间。
Z.ai Code Bench:更真实的检验
智谱还公开了他们内部的 Z.ai Code Bench 数据——GLM-5.3 相比 5.2 提升了 50%。
这个基准的特殊之处在于,它不是为了刷榜设计的。它模拟的是真实用户场景:复杂的本地开发环境、多样化的任务类别、需要端到端完成的工程工作。有些任务对经验丰富的工程师来说也需要数天时间。
更重要的是,Z.ai Code Bench 是私有基准,这避免了模型在公开测试集上过拟合的问题,更能反映真实用户体验。
三、涌现的网络安全能力:意料之外的副产品
如果说编程能力的提升是预期之中,那么网络安全能力的涌现则完全出乎意料。
智谱在博客中坦承:
"As we scaled post-training, cyber capability developed faster than we expected."
漏洞发现:CyberGym SOTA
在 CyberGym 漏洞发现基准上,GLM-5.3 达到了 84.5,超越了包括 GPT-5.6 Sol(83.6)、Fable 5(83.8)在内的所有对比模型,拿下 SOTA。
漏洞利用:翻倍以上的跃升
更惊人的是在漏洞利用链(exploitation chain)上的表现:
表格
| 测试 | GLM-5.3 | GLM-5.2 | 提升 |
|---|---|---|---|
| ExploitGym (2h) | 105 | 29 | 3.6x |
| ExploitGym (6h) | 130 | 39 | 3.3x |
| ExploitBench | 54.4 | 24.4 | 2.2x |
智谱特别指出,越往利用链的上游走,GLM-5.3 的优势越大。这意味着模型不仅能发现漏洞,还能自主构造完整的攻击链——这在两个月前还是不可想象的。
这个发现的意义远超一个基准测试的分数。它暗示了一个可能性:当 post-training 的环境足够丰富、任务足够真实时,模型可能会自发涌现出设计者未曾预料的能力。
四、他们是怎么做到的?环境即一切
GLM-5.3 的技术路线可以总结为一句话:把 post-training 的环境做得足够像真实工作,然后规模化。
从手工环境到自动合成
早期的 RLHF/RL 环境往往是手工设计的,数量有限、任务简单。但智谱意识到,当 Agent 能力提升后,瓶颈从模型转移到了环境。
一个有效的训练环境必须满足三个条件:
-
可执行——能在真实环境中运行
-
可验证——有明确的正确性判断标准
-
接近真实工作——不是玩具问题,而是工程师日常面对的任务
为了规模化这个过程,智谱搭建了一套端到端的环境合成 pipeline:
-
研究 Agent 从真实工作中收集任务模式
-
将其转化为可运行的长程环境,包含多步依赖和隐藏状态
-
评判 Agent 尝试每个任务,验证其确实可解
-
验证器 在没有参考答案的情况下合成,通过 oracle、no-op 和未解决状态检查
-
发现奖励捷径并关闭,确保奖励信号的可靠性
SAO with Compaction:长程任务的秘诀
GLM-5.3 继承了 GLM-5.2 的 SAO(Self-Adaptive Optimization)策略,并加入了 compaction 机制。
这个设计的核心思想是:在长程任务中,模型需要处理的信息量巨大,如果不做压缩,上下文窗口很快会被填满。Compaction 机制让模型能够主动压缩和整理中间状态,把注意力集中在真正影响任务进展的信息上。
效果在数据上清晰可见——GLM-5.3 的提升不仅体现在短任务上,在长程任务上同样显著。这说明模型学会了"如何学习",而不是简单地记忆了更多模式。
五、开源与定价:两周后见
智谱承诺,GLM-5.3 的权重将在发布两周后开源,待安全评估和加固完成后放出。
这延续了智谱一贯的开源策略。在闭源模型越来越强、开源社区略显疲软的当下,GLM-5.3 的出现无疑是一剂强心针——它证明了开源模型在顶级能力上仍然可以竞争,甚至在某些领域领先。
定价与生态
目前 Z.ai 的 GLM Coding Plan 定价为 $18/月 起,支持 Claude Code、Cline 等 20+ 顶级编程工具。
如果你正在考虑订阅,可以通过我的专属链接注册,享受 9 折优惠:
六、写在最后:Post-Training 的新范式
GLM-5.3 最重要的启示,不是某个具体的分数,而是它验证了一个假设:
当 base model 足够好后,post-training 的规模化可以独立驱动能力的质变。
这改变了我们对 LLM 发展的认知。过去我们认为,提升模型能力主要靠三件事:更大的模型、更多的数据、更长的预训练。但 GLM-5.3 告诉我们,第四件事可能同样重要——更好的环境、更真实的任务、更智能的训练策略。
在某种意义上,GLM-5.3 不是在训练一个更好的语言模型,而是在训练一个更好的"数字员工"——一个能在真实工作环境中理解上下文、分解任务、执行操作、验证结果的智能体。
两周后权重开源,我很期待看到社区会用它做出什么。

浙公网安备 33010602011771号