Qwen 3.8 Max vs GLM 5.2 vs Kimi K3 vs DeepSeek V4 Flash(2026年):国产大模型四强全面对比
Qwen 3.8 Max vs GLM 5.2 vs Kimi K3 vs DeepSeek V4 Flash(2026年):国产大模型四强全面对比
核心要点(TL;DR)
- Kimi K3(月之暗面,2026年7月16日)是四款模型中唯一拥有完整第三方验证成绩的:Artificial Analysis 智能指数 57 分,189 款模型中排名第 4 —— 开源权重模型的历史最高排名。同时以 1,679 Elo 拿下 Arena 前端编码榜第 1(483,895 票盲测)。
- GLM 5.2(智谱,2026年6月13–17日,约 744B 参数)是验证过的编码与 Agent 特化选手:Code Arena 与 Design Arena 全球第 1,MIT 权重已上线 Hugging Face,OpenRouter 上仅 $0.29/百万 token。
- Qwen 3.8 Max(阿里,2026年7月19日,2.4T 参数,95B 激活参数)是最新旗舰——首个承诺开源权重的 Max 规模模型,官方声称"仅次于 Fable 5"。官方公告(阿里通义千问微信公众号)附有基准数据,但截至发文尚无任何第三方验证。
- DeepSeek V4 Flash 0731(2026年7月31日,284B 总量 / 13B 激活)是性价比之王:在 DeepSeek 官方 Hugging Face 榜单上几乎全面击败 GLM 5.2(Terminal-Bench 2.1:82.7 vs 81.0;DeepSWE:54.4 vs 46.2),而价格仅 $0.14/$0.28 每百万 token —— 约为 Claude Opus 4.8 输出价格的 1.1%。
⚠️ 准确性说明:本文严格区分官方声称数据(厂商发布)与第三方验证数据(Artificial Analysis、Arena 等)。截至 2026年8月3日,Qwen 3.8 Max 有官方基准但尚无独立验证;Kimi K3、GLM 5.2、DeepSeek V4 Flash 0731 两者皆有。
目录
- 为什么 2026 年这场四强对比如此重要
- 一图看懂:规格对比总表
- 发布时间线:两个月的军备竞赛
- 基准测试:官方声称 vs 独立验证
- Agent 与编码基准正面交锋
- 定价拆解:官方 API、OpenRouter 与缓存
- 上下文窗口与多模态能力
- 开源权重、许可证与部署
- 四款模型怎么选?
- 常见问题 FAQ
- 最终结论与下一步行动
为什么 2026 年这场四强对比如此重要
2026 年夏天是中国四家实验室在六周内相继发布前沿级模型的首次。如果你正在基于 LLM 构建产品,Qwen 3.8 Max vs GLM 5.2 vs Kimi K3 vs DeepSeek V4 Flash 的选择将决定你的基准上限、单 token 成本,以及能否自托管。三个理由:
- 开源权重的差距被抹平了。 Kimi K3(2.8T)、GLM 5.2(约 744B)、Qwen 3.8 Max(2.4T)均已发布或承诺开源权重,DeepSeek V4 Flash 0731(284B)的权重也预计数周内发布。前沿级性能第一次可以脱离云服务运行。
- 规模在分化而非趋同。 你可以选择 2.8 万亿参数的巨兽(Kimi K3)、2.4T 的多模态旗舰(Qwen 3.8 Max)、744B 的编码特化选手(GLM 5.2),或是以 284B/13B 激活参数击败远大于自身模型的性价比之王(DeepSeek V4 Flash 0731)。
- 四款中三款已有了验证数据。 Artificial Analysis 已对 Kimi K3(57)、GLM 5.2(51)、DeepSeek V4 Flash 0731(50)完成智能指数评测。Qwen 3.8 Max 仍是未知数。
专业提示:2026 年最重要的准确性守则:引用任何数字前,先确认它是厂商发布还是第三方验证的。
一图看懂:规格对比总表
| 规格 | Qwen 3.8 Max(阿里) | GLM 5.2(智谱) | Kimi K3(月之暗面) | DeepSeek V4 Flash 0731 |
|---|---|---|---|---|
| 发布日期 | 2026年7月19日(预览) | 2026年6月13–17日 | 2026年7月16日 | 2026年7月31日(0731 检查点) |
| 总参数量 | 2.4T(官方) | 约 744B | 2.8T | 284B |
| 激活参数量 | 95B(官方) | 约 40B | 约 50B(896 专家中 16 个) | 13B(256 专家中 6 个) |
| 架构 | MoE(基于 Qwen 3.5) | MoE + 升级版 DeepSeek 稀疏注意力 | Stable LatentMoE + KDA 混合注意力 | MoE,1 共享 + 256 路由专家,哈希路由 |
| 上下文窗口 | 100 万 token(官方) | 100 万 token | 100 万 token | 100 万 token(1,048,576) |
| 原生多模态 | 文本、图像、视频、文档 | 文本优先 | 文本、图像、音频、视频 | 仅文本 |
| 开源权重 | 公告承诺"下周开源" | MIT,Hugging Face 已上线 | MIT,2026年7月27日已开源 | 预计"数周内" |
| AA 智能指数 | 未评测(仅官方声称) | 51(已验证) | 57(已验证,189 中第 4) | 50(已验证) |
| OpenRouter ID | 无(仅 Token Plan) | z-ai/glm-5.2 |
moonshotai/kimi-k3 |
deepseek/deepseek-v4-flash-0731 |
发布时间线:两个月的军备竞赛
graph LR
A[6月13-17日: GLM 5.2] --> B[7月16日: Kimi K3]
B --> C[7月19日: Qwen 3.8 Max 预览]
C --> D[7月27日: Kimi K3 权重开源]
D --> E[7月31日: DeepSeek V4 Flash 0731]
E --> F[8月上旬: Qwen 3.8 Max 权重? DeepSeek 权重?]
- 2026年6月13–17日 — 智谱发布 GLM 5.2(约 744B),数周内登顶 Code Arena 与 Design Arena,基于华为昇腾硬件训练。
- 2026年7月16日 — 月之暗面在 WAIC 上海发布 Kimi K3(2.8T),史上最大开源权重模型。
- 2026年7月19日 — 阿里在 WAIC 预览 Qwen 3.8 Max(2.4T),声称"仅次于 Fable 5"。
- 2026年7月27日 — Kimi K3 完整 MIT 权重上线 Hugging Face。
- 2026年7月31日 — DeepSeek 发布 V4 Flash 0731 检查点(同 284B/13B 架构,完全重新后训练),Agent 基准大幅跃升。
基准测试:官方声称 vs 独立验证
Qwen 3.8 Max vs GLM 5.2 vs Kimi K3 vs DeepSeek V4 Flash 的基准图景分为两层。先看已验证的一层。
第三方验证:Artificial Analysis 智能指数
| 模型 | 智能指数 | 全球排名 | 备注 |
|---|---|---|---|
| Kimi K3(max) | 57 | 189 中第 4 | 开源权重模型史上最高;与 Claude Opus 4.8(约 56)基本持平 |
| GLM 5.2(max) | 51 | 前十 | 全评测套件验证通过 |
| DeepSeek V4 Flash 0731(max) | 50 | — | 与 GLM 5.2 仅差 1 分;与 Gemini 3.6 Flash(50)持平,落后 Muse Spark 1.1(51)1 分 |
| Qwen 3.8 Max | 未评测 | — | 截至 2026年8月3日无第三方评测 |
参考点:Claude Fable 5 约 60(第 1)、GPT-5.6 Sol 约 59(第 2)。
官方声称:Qwen 3.8 Max(阿里官方公告)
阿里通义千问官方公告(约 2026年7月30日,微信公众号)正是社区等待已久的官方数据源。确认的规格:2.4T 总参数、95B 激活参数、100 万 token 上下文,且是首个承诺开源权重的 Max 规模模型("权重将于下周开源")。公告中的性能表以图片形式发布,但文字部分包含以下成果:
- E-Commerce Bench(365 天模拟电商,10 万元启动资金):最终总现金 ¥416,252(4.16 倍回报) —— 比第二名 GLM 5.2 高出 38%、比上一代 Qwen 3.7-Max 提升 152%;年终大促期净利润约为 GLM 5.2 的 2.4 倍。
- 自主芯片设计(GCD/RSA 密码硬件加速器):从首个跑通的 8,298 门,经过约 500 轮交互优化到 678 门 —— 官方声明为参评模型中表现最优。
- 自主科研循环:约 37 小时复现论文完整流水线后,独立提出 18 个改进方向,最终以 AIME24 +2.7 分超越原方法。
- 长周期自主编程:
oh-my-cli项目约 16 个自主运行日留下 265 次提交、127 个 PR、151 个 issue(GitHub:qwen-code-dev-bot/oh-my-cli)。
对 Qwen 3.8 Max 数字的评估:官方发布、内容详实,但尚无第三方验证(Artificial Analysis 与 LMArena 均未评测)。Qwen 3.7-Max 的验证基准(AA 指数 56.6、GPQA-Diamond 92.4、SWE-bench Verified 80.4、Terminal-Bench 2.0 69.7)仍是该家族唯一经过第三方检验的参照。
⚠️ 注意:Qwen 3.8 Max 目前唯一的独立数据点是 Trilogy AI 的单次盲测 StackPerf:Qwen3.8-Max-Preview 80 vs Kimi K3 83。单次运行、单任务 —— 仅供参考,不能当作定论。
Agent 与编码基准正面交锋
DeepSeek 的 V4 Flash 0731 Hugging Face 模型卡发布了一份四模型 Agent 基准直接对比(模型自报、DeepSeek 自研 harness)。这是目前公开最干净的同口径对比表:
| 基准 | DS V4 Flash 0731 | DS V4 Flash(旧) | DS V4 Pro(旧) | GLM 5.2 | Opus 4.8 |
|---|---|---|---|---|---|
| Terminal-Bench 2.1 | 82.7 | 61.8 | 72.1 | 81.0 | 85.0 |
| NL2Repo | 54.2 | 39.4 | 38.5 | 48.9 | 69.7 |
| Cybergym | 76.7 | 38.7 | 52.7 | — | 83.1 |
| DeepSWE | 54.4 | 7.3 | 12.8 | 46.2 | 58.0 |
| Toolathlon-Verified | 70.3 | 49.7 | 55.9 | 59.9 | 76.2 |
| Agents' Last Exam | 25.2 | 15.8 | 16.5 | 23.8 | 25.7 |
| DSBench-FullStack | 68.7 | 37.0 | 41.8 | 61.8 | 71.6 |
| DSBench-Hard | 59.6 | 25.8 | 31.1 | 54.5 | 71.7 |
请仔细阅读:DeepSeek V4 Flash 0731(13B 激活)在同时出现的每一行都击败了 GLM 5.2(约 40B 激活),并逼近 Claude Opus 4.8;其 0731 检查点的 DeepSWE 从预览版 7.3 跃升至 54.4。社区/Medium 关于"Agent 基准达到 Claude Opus 4.6 水平"的评价与这些数据一致。
编码专项的已验证排名:
| 编码基准 | 胜者 |
|---|---|
| Arena 前端编码 | Kimi K3 —— 1,679 Elo,第 1(483,895 票盲测,7 个领域拿下 6 个第一) |
| Code Arena(智谱盲测) | GLM 5.2 —— 全球第 1 |
| Design Arena | GLM 5.2 —— 第 1,Elo 1360 |
| SWE-bench Verified | Kimi K3 约 78% / GLM 5.2 77.8% —— 基本持平 |
| HumanEval | Kimi K3 88.3(厂商报告) |
| Qwen 3.7-Max 基线(SWE-bench Verified) | 80.4 —— 3.8 验证前的家族参照 |
定价拆解:官方 API、OpenRouter 与缓存
| 模型 | 输入/百万 | 输出/百万 | 缓存输入/百万 | 备注 |
|---|---|---|---|---|
| DeepSeek V4 Flash 0731 | $0.14 | $0.28 | $0.0028(98% 折扣) | 约为 Opus 4.8 输出价的 1.1%;2,500 并发;最大输出 384K |
| GLM 5.2 | $0.29(OpenRouter)/ ¥8(智谱 API) | $0.29 | — | NVIDIA NIM 提供免费额度 |
| Kimi K3 | 高级档(Moonshot API) | 高级档 | — | kimi.com 与 Kimi Code 免费 |
| Qwen 3.8 Max | 仅预览积分(Token Plan / Qoder) | 仅预览积分 | — | 预览为标准费率 1/10,夜间 1/50;无公开单价 |
单任务成本真相:DeepSeek V4 Flash 0731 不仅单价碾压,还比上一版省 12% 的 token(同一智能指数评测仅用 2.06 亿 vs 2.34 亿输出 token)。Kimi K3 的推理深度则往往用更少 token 完成同一任务,可部分抵消其高价。请务必按"每任务端到端成本"做基准,而不是只看费率表。
上下文窗口与多模态能力
四款模型全部支持 100 万 token 上下文窗口 —— 这是 2026 年悄然出现的一大趋同。多模态则差异显著:
| 模型 | 多模态? | 详情 |
|---|---|---|
| Kimi K3 | ✅ 原生 | 单次提示支持文本、图像、音频、视频 —— 单一模型覆盖最广 |
| Qwen 3.8 Max | ✅ 原生 | 千问首款超 1T 参数的多模态模型;官方演示覆盖 200+ 页财报、100+ 小时视频("Video Graph 记忆")、Vlog 剪辑、截图还原前端、Blender 3D;RecreationBench 应用复刻基准;Qwen-MM-Plugins 扩展库 |
| GLM 5.2 | ⚠️ 文本优先 | 视觉能力经 GLM-4.5V 系列配套模型提供,非统一架构 |
| DeepSeek V4 Flash 0731 | ❌ 仅文本 | Artificial Analysis 已确认:仅文本输入输出 |
如果你的工作负载需要"看一眼 + 思考 + 行动"一模型搞定,选择收窄为 Kimi K3 或 Qwen 3.8 Max。纯文本 Agent 场景下,DeepSeek V4 Flash 0731 的窄模态反而是优点:部署更小、成本更低、没有视觉税。
开源权重、许可证与部署
| 模型 | 许可证 | 权重状态 | 自托管规模 |
|---|---|---|---|
| Kimi K3 | MIT | 2026年7月27日已开源(moonshotai/Kimi-K3) |
多节点 H100/MI300(≥8 GPU);vLLM / SGLang |
| GLM 5.2 | MIT | 已上线(zai-org/GLM-5.2) |
单节点 8×H100 或 4×MI300;vLLM、SGLang、llama.cpp |
| Qwen 3.8 Max | 未定 | 公告承诺"下周开源"(约 7月30日);许可证未公布 | 权重发布前不明;95B 激活暗示 8 卡级节点 |
| DeepSeek V4 Flash 0731 | 预计宽松许可 | "数周内"(Artificial Analysis) | 13B 激活 —— 小型集群即可运行;社区已有 2×DGX Spark 部署方案 |
✅ 最佳实践:今天就要开源权重,选 GLM 5.2(744B)或 Kimi K3(2.8T)。想要最小可自托管的前沿级模型,等 DeepSeek V4 Flash 0731 权重 —— 13B 激活意味着运维成本的天壤之别。Qwen 3.8 Max 的权重日期与许可证截至 2026年8月3日仍未确认。
四款模型怎么选?
graph TD
A[你最看重什么?] --> B{先要验证过的成绩?}
A --> C{单模型兼顾<br/>规模与多模态?}
A --> D{最低的<br/>单任务成本?}
A --> E{今天就要<br/>开源权重?}
B -->|是| F[Kimi K3: AA 57, 验证第4]
C -->|是| G[Kimi K3 或 Qwen 3.8 Max]
D -->|是| H[DeepSeek V4 Flash 0731: $0.14/$0.28]
E -->|是| I[GLM 5.2 已上线 / Kimi K3 已开源]
G --> J{也要厂商基准?}
J -->|是| K[Qwen 3.8 Max 官方数据+案例]
J -->|否| L[Kimi K3 原生4模态]
按工作负载推荐:
- 生产级编码 Agent,今天就要,且要验证数据 → Kimi K3(AA 57、前端编码第 1)或 GLM 5.2(Code Arena 第 1、单 token 更便宜)。
- 预算敏感的 Agent 循环 → DeepSeek V4 Flash 0731 —— 在 DeepSeek Agent 榜单上击败 GLM 5.2,成本只有高级模型约 2%。
- 长周期自主工作(科研、电商、芯片设计),有厂商实证 → Qwen 3.8 Max —— 官方案例(4.16 倍电商回报、678 门芯片)是目前最强的公开演示;不过规模化前务必等验证。
- 原生多模态单一模型 → Kimi K3(4 种模态)或 Qwen 3.8 Max(视觉 + 视频 + GUI Agent)。
- 在普通硬件上自托管 → DeepSeek V4 Flash 0731(13B 激活)或 GLM 5.2(单 8 卡节点)。
常见问题 FAQ
Q:四款中哪款验证基准最强?
A:Kimi K3 —— Artificial Analysis 智能指数 57 分,189 款模型中第 4(开源权重史上最高),Arena 前端编码第 1(1,679 Elo)。GLM 5.2(51)与 DeepSeek V4 Flash 0731(50)在指数上非常接近。
Q:Qwen 3.8 Max 真的"仅次于 Fable 5"吗?
A:这是阿里的官方声称,公告附有详细的内部基准表与案例(E-Commerce Bench 4.16 倍回报、比 GLM 5.2 高 38%、比 Qwen 3.7-Max 高 152%、芯片设计 678 门)。截至 2026年8月3日尚无第三方验证。建议当作有力的厂商主张,等待独立分数。
Q:DeepSeek V4 Flash 0731(13B 激活)凭什么赢 GLM 5.2(40B 激活)?
A:0731 检查点与 V4 Flash 同架构(284B/13B),但完全重新后训练。DeepSeek 官方 HF 表显示其 Agent 能力大幅跃升(DeepSWE 7.3→54.4;Terminal-Bench 2.1 61.8→82.7)。决定 Agent 性能的是后训练质量而非原始规模 —— 这正是 2026 年这款模型教给我们的最重要一课。
Q:四款中最便宜的是?
A:DeepSeek V4 Flash 0731:$0.14/百万输入、$0.28/百万输出、$0.0028/百万缓存输入(98% 折扣)—— 约为 Claude Opus 4.8 输出价的 1.1%,支持 2,500 并发。其次是 OpenRouter 上的 GLM 5.2($0.29/百万)。
Q:哪些可以本地部署?
A:GLM 5.2(MIT 权重已上线)与 Kimi K3(7月27日起 MIT 权重开源)现在就能跑。DeepSeek V4 Flash 0731 权重数周内发布,且最易部署(13B 激活)。Qwen 3.8 Max 公告承诺"下周开源",但截至 2026年8月3日日期与许可证均未确认。
Q:四款都支持 100 万 token 上下文吗?
A:是的 —— Qwen 3.8 Max(官方确认)、GLM 5.2、Kimi K3、DeepSeek V4 Flash 0731(1,048,576 token)全部支持 100 万 token 上下文。
Q:多模态任务选哪款?
A:Kimi K3(原生文本/图像/音频/视频)与 Qwen 3.8 Max(原生图像/视频/文档 + RecreationBench 等 GUI Agent 能力)。GLM 5.2 文本优先(视觉走配套模型),DeepSeek V4 Flash 0731 仅文本。
最终结论与下一步行动
Qwen 3.8 Max vs GLM 5.2 vs Kimi K3 vs DeepSeek V4 Flash 截至 2026年8月的对比,可以归结为四个清晰的押注方向:
- 押注验证:Kimi K3 —— 四款中唯一拥有前沿级第三方分数的模型。
- 押注编码 + 今天的开源权重:GLM 5.2 —— Code Arena 第 1、MIT 权重已上线、token 便宜。
- 押注最新旗舰:Qwen 3.8 Max —— 今年最大的官方基准包;但规模化前务必验证。
- 押注单任务成本:DeepSeek V4 Flash 0731 —— 接近 Opus 4.8 的 Agent 性能,1/100 的价格。
三步行动方案
- 本周:把 Agent 编码流量切到 DeepSeek V4 Flash 0731(OpenRouter 的
deepseek/deepseek-v4-flash-0731,或 DeepSeek API $0.14/$0.28),与现有栈对比基准 —— 98% 的缓存折扣让仓库级上下文循环几乎免费。 - 本月:用 Kimi K3(AA 57)评估最难推理/多模态负载,同时关注 Qwen 3.8 Max 的开源权重与首个第三方分数 —— 这两件事将解决对比中最大的悬而未决问题。
- 2–4 周后复查:DeepSeek 开源权重与 Qwen 3.8 Max 独立评测都会落地;届时请重跑本对比 —— 官方声称与验证现实之间的差距,正是这场竞赛的决胜点。
数据来源
- 阿里通义千问官方公告(微信公众号,约 2026年7月30日):Qwen3.8-Max 规格(2.4T、95B 激活、100 万上下文)、E-Commerce Bench、芯片设计、oh-my-cli 案例 —— mp.weixin.qq.com/s/9S8VZETppDj_AidiUFrZlw
- DeepSeek-V4-Flash-0731 模型卡(Hugging Face)—— 与 V4 Pro、GLM-5.2、Opus-4.8 的 Agent 基准对比:huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731
- Artificial Analysis —— 智能指数:DeepSeek V4 Flash 0731(50)、GLM-5.2(51)、Kimi K3(57)、Fable 5(约 60)、GPT-5.6 Sol(约 59)
- Arena(LMArena)前端编码榜 —— Kimi K3 1,679 Elo;智谱 Code Arena / Design Arena —— GLM 5.2 第 1
- Moonshot AI Kimi K3 发布报道;OpenRouter 模型页;DeepSeek 官方定价页($0.14/$0.28、$0.0028 缓存);Trilogy AI StackPerf(Qwen3.8-Max 80 vs Kimi K3 83)
最后更新:2026-08-03。凡厂商报告数字,在第三方验证完成前均已标注为"声称"。
浙公网安备 33010602011771号