智谱开源 GLM-5.3-Flash:用 1/40 的成本,把前沿多模态大模型拉进普惠区间
智谱开源 GLM-5.3-Flash:用 1/40 的成本,把前沿多模态大模型拉进普惠区间

2026 年 8 月,智谱 AI 正式上线并开源 GLM-5.3-Flash(320B-A18B),这是 GLM-5 家族里第一款原生多模态模型。它想打破一个固有印象:前沿能力必须等于高昂账单。
智能水平站到第一梯队
在 Artificial Analysis 综合智能指数(AA Index v4.1.1)里,GLM-5.3-Flash 拿到 57 分,进入全球前沿模型区间,与 Anthropic 的 Claude Opus 4.8 持平;在智谱自研的 Z.ai Code Bench 编程体感评测中,表现也与之相当。横向看,它全面超过参数量大一倍的 GLM-5.2。
发布前,团队用匿名代号 Ox-Alpha(社区称“牛来”)在 OpenCode、OpenRouter 跑了一轮灰度,直接冲到双平台当周调用量第一。所有流量背后,算力全部来自国产芯片集群。
价格打到“不用省着用”
- API 价:GLM-5.3 的 1/10
- 限时折扣:GLM-5.3 的 1/20
- 对比 Opus 4.8:约 1/40
同样档次的智力,四十分之一的价格——这是文章最核心的 slogan 落点。

架构为什么能又强又便宜
Flash 版本不是简单蒸馏,而是重做了结构:
- 总参数 320B,激活参数 18B,层数 45(对比 GLM-5.2 几乎减半)
- 30T token 多模态预训练语料
- 业界首个开源前沿模型采用稀疏注意力 + 线性注意力混合架构;线性注意力走递归抓局部,稀疏注意力用轻量索引器召回全局
- 引入 IndexPool,把 1M 上下文下索引器的 4 个缓存向量压成 1 个
- 用 流形约束超连接(mHC) 抬 Scaling 上限
官方测算:对比 GLM-5.3,注意力计算量降 3.01 倍,KV 缓存降 4.44 倍;单 head 单层的注意力算力在几个基线里最低(KV 缓存比 Kimi-K3、DeepSeek-V4-Flash 略高,是后续优化项)。

原生多模态:让模型“看着自己写”
多模态不是接个视觉编码器,而是把“看”变成推理回路的一部分:
- 前端 / 游戏 / 3D 仿真里,模型自己决定什么时候要观察渲染结果,再做下一步
- 数据流水线强调自我视觉判断 + 测试时改进,模型和环境交互 → 检视输出 → 迭代
- 案例:无外部素材,自主跑 16 小时在 Blender 里搭出约 400㎡ 主厨自宅与测试厨房
- ZCode 里接 Browser Use / Computer Use Agent,代码、网页、桌面 GUI 联动自检
办公侧同样吃视觉红利:PPTX / PDF / DOCX / XLSX 任务里,模型拿视觉上下文比对预期效果,做审美与版式自检;金融研报、法律合同批注、律师函起草都能直接交付。
国产卡上跑出可用性价比
推理栈完全自建:
- 基于 SGLang 改专用引擎,由 GLM-5.3 驱动的 infra agent 辅助调算子、查瓶颈
- 节点内张量并行 + ReplaySSM + W8A8 + INT8/FP8/BF16 混合缓存量化 + Layer Split
- 集群层用生产级 Encode–Prefill–Decode(EPD)分离架构,多模态编码、prefill、decode 拆成独立工作池
- 1M 上下文是主战场,靠“以算力换带宽、以通信换显存”硬挤内存
结果:同硬件上端到端性能较初始基线 提升 3 倍,单 token 成本与效率逼近主流英伟达 GPU。
怎么拿到
- 权重:HuggingFace
zai-org/GLM-5.3-Flash已放 - API:BigModel 开放平台、Z.ai
- 体验:chat.z.ai、智谱清言 App
- Agent:ZCode(代码)、AutoClaw(办公)
- 计划:GLM Coding Plan 每天 1 万张体验卡
- 技术 Blog:https://z.ai/blog/glm-5.3-flash
本文来自博客园,作者:kaizi1992,转载请注明原文链接:https://www.cnblogs.com/kaigejava/p/22712586

浙公网安备 33010602011771号