智谱开源 GLM-5.3-Flash:用 1/40 的成本,把前沿多模态大模型拉进普惠区间

智谱开源 GLM-5.3-Flash:用 1/40 的成本,把前沿多模态大模型拉进普惠区间

0db72b8f0501aaa712a6976bd0222c03.png

2026 年 8 月,智谱 AI 正式上线并开源 ​GLM-5.3-Flash(320B-A18B)​,这是 GLM-5 家族里第一款​原生多模态模型​。它想打破一个固有印象:前沿能力必须等于高昂账单。

智能水平站到第一梯队

7840fcb8d8e439e9c27bd082d7e31a20.png

在 Artificial Analysis 综合智能指数(AA Index v4.1.1)里,GLM-5.3-Flash 拿到 ​57 分​,进入全球前沿模型区间,与 Anthropic 的 Claude Opus 4.8 持平;在智谱自研的 Z.ai Code Bench 编程体感评测中,表现也与之相当。横向看,它全面超过参数量大一倍的 GLM-5.2。

发布前,团队用匿名代号 ​Ox-Alpha​(社区称“牛来”)在 OpenCode、OpenRouter 跑了一轮灰度,直接冲到双平台当周调用量第一。所有流量背后,算力全部来自​国产芯片集群​。

价格打到“不用省着用”

  • API 价:GLM-5.3 的 1/10
  • 限时折扣:GLM-5.3 的 1/20
  • 对比 Opus 4.8:约 1/40

同样档次的智力,四十分之一的价格——这是文章最核心的 slogan 落点。

8ff047bceea2b348dc9b441c2827597a.png

架构为什么能又强又便宜

Flash 版本不是简单蒸馏,而是重做了结构:

  • 总参数 320B,激活参数 ​18B​,层数 45(对比 GLM-5.2 几乎减半)
  • 30T token 多模态预训练语料
  • 业界首个开源前沿模型采用​稀疏注意力 + 线性注意力混合架构​;线性注意力走递归抓局部,稀疏注意力用轻量索引器召回全局
  • 引入 ​IndexPool​,把 1M 上下文下索引器的 4 个缓存向量压成 1 个
  • 流形约束超连接(mHC) 抬 Scaling 上限

官方测算:对比 GLM-5.3,注意力计算量降 ​3.01 倍​,KV 缓存降 ​4.44 倍​;单 head 单层的注意力算力在几个基线里最低(KV 缓存比 Kimi-K3、DeepSeek-V4-Flash 略高,是后续优化项)。

image.png

原生多模态:让模型“看着自己写”

多模态不是接个视觉编码器,而是把“看”变成推理回路的一部分:

  • 前端 / 游戏 / 3D 仿真里,模型自己决定什么时候要观察渲染结果,再做下一步
  • 数据流水线强调​自我视觉判断 + 测试时改进​,模型和环境交互 → 检视输出 → 迭代
  • 案例:无外部素材,自主跑 16 小时在 Blender 里搭出约 400㎡ 主厨自宅与测试厨房
  • ZCode 里接 Browser Use / Computer Use Agent,代码、网页、桌面 GUI 联动自检

办公侧同样吃视觉红利:PPTX / PDF / DOCX / XLSX 任务里,模型拿视觉上下文比对预期效果,做审美与版式自检;金融研报、法律合同批注、律师函起草都能直接交付。

国产卡上跑出可用性价比

推理栈完全自建:

  • 基于 SGLang 改专用引擎,由 GLM-5.3 驱动的 infra agent 辅助调算子、查瓶颈
  • 节点内张量并行 + ReplaySSM + W8A8 + INT8/FP8/BF16 混合缓存量化 + Layer Split
  • 集群层用生产级 ​Encode–Prefill–Decode(EPD)分离架构​,多模态编码、prefill、decode 拆成独立工作池
  • 1M 上下文是主战场,靠“以算力换带宽、以通信换显存”硬挤内存

结果:同硬件上端到端性能较初始基线 ​提升 3 倍​,单 token 成本与效率逼近主流英伟达 GPU。

怎么拿到

  • 权重:HuggingFace zai-org/GLM-5.3-Flash 已放
  • API:BigModel 开放平台、Z.ai
  • 体验:chat.z.ai、智谱清言 App
  • Agent:ZCode(代码)、AutoClaw(办公)
  • 计划:GLM Coding Plan 每天 1 万张体验卡
  • 技术 Blog:https://z.ai/blog/glm-5.3-flash
posted @ 2026-08-27 10:51  kaizi1992  阅读(28)  评论(0)    收藏  举报