GLM-5.3-Flash 把视觉反馈带进 Agent 的执行循环
前几天,OpenCode 和 OpenRouter 上出现了一个叫 ox-alpha 的匿名模型。没有品牌名称,也没有发布信息,开发者只能把真实任务交给它,看代码能不能改对、命令能不能跑通、长流程会不会中途失控。身份公布前的六个完整自然日里,它在 OpenRouter 处理了 23.2T token,是第二名的 2.3 倍;在 OpenCode 的七日统计中,它也排在首位。

身份揭晓后,人们才知道 ox-alpha 就是 GLM-5.3-Flash。匿名阶段的意义在于,使用者先接触任务表现,再得知模型来自哪里。对一个主打代码和 Agent 的模型来说,这种观察方式很直接:真实环境会暴露工具调用、状态保持、错误恢复和多轮执行中的问题,很难只靠一两次漂亮回答掩盖。
GLM-5.3-Flash 是 GLM-5 系列首个原生多模态模型,支持文本、图片、视频和文件输入,具备 1M 上下文与最高 128K 输出。它的能力组合很有针对性:代码生成负责产出,视觉理解负责读取环境,工具调用把动作送进真实应用,长上下文维持任务状态。四项能力接在一起,模型才有机会完成一段连续工作。

01 代码能力要看完整过程
GLM-5.3-Flash 在 Terminal-Bench 2.1、DeepSWE v1.1、Agents' Last Exam、AutomationBench、HLE with Tools 和 GDPval-AA v2 上的成绩分别为 84.3、63.4、26.3、48.8、55.3 和 1773。

这些测试测量的任务并不相同。Terminal-Bench 2.1 要求模型在终端里理解环境、执行命令并处理报错;DeepSWE 接近仓库级软件工程,需要追踪文件关系、定位缺陷并完成修改;AutomationBench 考察跨应用自动化;HLE with Tools 把知识推理与工具使用放进同一条任务链;GDPval-AA v2 更接近日常专业工作的交付质量。

与 GLM-5.2 相比,DeepSWE 从 46.2 升至 63.4,AutomationBench 从 26.2 升至 48.8。发布材料还列出了 NL2Repo 56.3 和 Toolathlon Verified 78.4,前者考察从自然语言需求构建仓库级项目,后者关注复杂工具组合。这几项结果放在一起看,模型的长处集中在持续执行:理解目标,读取仓库或应用状态,选择工具,检查返回结果,再处理下一步。
「代码 Agent 最容易被忽略的能力是保持方向。」
单轮生成一段函数并不难,仓库级任务却会不断引入新信息:测试失败、依赖冲突、接口约束、已有代码风格,以及前一次修改留下的副作用。模型要在数十轮操作后仍记得验收条件,还要知道何时回看旧文件。DeepSWE 和 Terminal-Bench 的价值,就在于它们把模型放进了这种会变化的环境。
评测数字也要连同条件一起读。Terminal-Bench 2.1 使用 Claude Code 2.1.207,单项任务最长六小时;DeepSWE 采用 mini-swe-agent,并提供 400K 上下文。提示模板、工具接口、推理预算和超时设置都会影响成绩。榜单适合判断能力位置,项目测试仍要使用自己的仓库、应用和验收标准。
02 思考预算会改变代码表现
Z.ai Code Bench v1.0 记录了不同推理强度下的 Agentic Coding 表现。GLM-5.3-Flash 从 low 档约 21.4% 提升到 high 档约 28%,max 档接近 29%。它在 high 到 max 之间的提升已经很小,输出 token 却从约 70K 增至约 140K。


这组曲线说明,更多思考并不会等比例换来更高准确率。简单修改可以使用较低预算;跨文件调试、需求含糊或需要多次验证的任务,更值得给模型充足的推理空间。对使用者而言,重要的是根据任务难度分配预算,并把测试结果、终端输出和页面反馈及时送回模型。
03 原生多模态开始参与执行
GLM-5.3-Flash 使用 30T token 的多模态预训练语料。视觉信息从训练阶段就与语言和代码共同学习,图片、视频、文档页面和应用界面可以直接进入推理过程。模型读取的不只是一张图里有什么,还包括页面层级、图表关系、控件状态、布局差异和动态变化。
多模态评测给出了更细的能力切面:OfficeQA Pro 为 62.4,CharXiv Reasoning with Tools 为 89.4,Chartography with Tools 为 78.0,BabyVision 为 53.4,MVBench 为 77.8,MMVU 为 80.5。前几项更接近文档、图表与工具协作,后几项覆盖通用视觉和视频理解。它们说明视觉能力已经能够进入专业材料与动态内容,而非停在图片描述。
「截图在这里是一轮环境反馈。模型看见自己做出的页面,才能判断下一步应该改哪里。」
网页复刻是最容易理解的例子。模型先读取截图或设计稿,识别组件关系、页面层级和交互状态;生成项目后打开浏览器查看实际渲染,再根据字体、间距、图片裁切和动画表现继续修改。
类似的循环可以用于演示文稿、财务图表、游戏和 Blender 场景。模型生成内容后检查页面,发现文本溢出、对齐错误或图表表达不清,再返回文件继续调整。处理视频时,它还能结合画面变化、字幕和时间线判断动作是否连贯、剪辑点是否合理。视觉由输入材料变成验收手段,这一点比单次识图更值得关注。
04 百万上下文服务于长任务
1M 上下文的价值主要体现在任务跨度。仓库级开发会同时涉及源码、测试、日志、依赖说明和历史讨论;研究任务会积累网页、文档、表格与中间结论;视频项目还会带入字幕、镜头描述和时间线。材料之间的关系能够留在同一段上下文中,Agent 才能减少反复摘要造成的信息损失。

最高 128K 输出适合生成完整代码文件、长篇研究记录、多页文档或较长的工具调用轨迹。不过,窗口大并不等于记得准。模型仍需从大量材料里找到当前步骤真正相关的部分,还要避免早期要求被后续噪声淹没。长上下文是否有效,最终取决于检索能力和任务组织。
ARCHITECTURE
GLM-5.3-Flash 采用线性注意力与稀疏注意力组合的混合架构。线性注意力负责连续状态建模,稀疏注意力通过索引器寻找与当前问题有关的上下文块。模型共有 45 层,开头三层使用全注意力,后续主体按三层线性注意力配一层稀疏注意力组织。
IndexPool 会把四组索引键向量压缩为一组,再进行候选块检索;mHC(Manifold-Constrained Hyper-Connections)用于改善深层网络中的信号传递。按发布资料的逐层估算,相比 GLM-5.3,GLM-5.3-Flash 的注意力计算量降低 3.01 倍,KV Cache 降低 4.44 倍。

05 它适合承担什么工作
把各项能力合起来,GLM-5.3-Flash 最适合那些需要反复观察和修正的任务。代码与工程方面,它可以处理终端操作、仓库级修改、调试和自动化;视觉工作方面,它能读取截图、视频和应用界面,并根据结果修正网页、游戏或三维场景;知识工作方面,它可以处理文档、表格、演示文稿和研究材料,再通过渲染结果检查交付物。
它的使用边界同样清楚。评测高分依赖合适的 Agent 环境;视觉自检依赖准确、及时的界面反馈;长上下文任务仍需良好的材料组织和验收机制。如果工具返回值缺失、截图滞后或任务标准模糊,模型也很难稳定完成长流程。
从 ox-alpha 的匿名使用数据到代码与多模态评测,GLM-5.3-Flash 已经形成了比较完整的能力画像:代码和终端是强项,视觉信息可以进入执行循环,百万上下文负责维持长任务,多工具协作把结果送进真实应用。
检验这款模型的方式也很直接。交给它一段需要观察、行动、检查和返工的完整任务,看最终结果能否通过验收。
06 模型下载
OpenCSG社区:
https://opencsg.com/models/zai-org/GLM-5.3-Flash
Hugging Face社区:
https://huggingface.co/zai-org/GLM-5.3-Flash
07 OpenCSG vs 魔搭:如何选择?
在魔搭、OpenCSG 等模型社区中均可实现,但 OpenCSG/CSGHub 的核心在于,它不只是让模型"跑起来",而是进一步支持企业把模型、数据集、代码和应用等 AI 资产放到本地、内网或离线环境中统一管理。它解决的不只是"模型怎么部署、怎么调用"的问题,更是"模型进入企业后如何被安全管理、版本沉淀、权限控制和持续运营"的问题。
对于企业来说,CSGHub 可以帮助构建自己的私有模型资产中心,降低对外部平台的依赖;对于个人开发者来说,也可以用更系统的方式管理模型、实验项目和 AI 应用流程。相比更偏向模型发现、体验和使用入口的魔搭,CSGHub 更适合那些希望把 AI 能力真正沉淀下来,并长期维护、持续迭代的用户。
关于 OpenCSG
OpenCSG是全球领先的开源大模型社区平台,致力于打造开放、协同、可持续生态,AgenticOps是人工智能领域的一种 AI 原生方法论,由 OpenCSG(开放传神)提出。AgenticOps 是 Agentic AI 的最佳落地实践也是方法论。核心产品CSGHub提供模型、数据集、代码与 AI 应用的一站式托管、协作与共享服务,具备业界领先的模型资产管理能力,支持多角色协同和高效复用。

浙公网安备 33010602011771号