Qwen 3.8 Max vs GLM 5.2 vs Kimi K3 vs DeepSeek V4 Flash(2026年):国产大模型四强全面对比

Qwen 3.8 Max vs GLM 5.2 vs Kimi K3 vs DeepSeek V4 Flash(2026年):国产大模型四强全面对比

核心要点(TL;DR)

  • Kimi K3(月之暗面,2026年7月16日)是四款模型中唯一拥有完整第三方验证成绩的:Artificial Analysis 智能指数 57 分,189 款模型中排名第 4 —— 开源权重模型的历史最高排名。同时以 1,679 Elo 拿下 Arena 前端编码榜第 1(483,895 票盲测)。
  • GLM 5.2(智谱,2026年6月13–17日,约 744B 参数)是验证过的编码与 Agent 特化选手:Code Arena 与 Design Arena 全球第 1,MIT 权重已上线 Hugging Face,OpenRouter 上仅 $0.29/百万 token。
  • Qwen 3.8 Max(阿里,2026年7月19日,2.4T 参数,95B 激活参数)是最新旗舰——首个承诺开源权重的 Max 规模模型,官方声称"仅次于 Fable 5"。官方公告(阿里通义千问微信公众号)附有基准数据,但截至发文尚无任何第三方验证
  • DeepSeek V4 Flash 0731(2026年7月31日,284B 总量 / 13B 激活)是性价比之王:在 DeepSeek 官方 Hugging Face 榜单上几乎全面击败 GLM 5.2(Terminal-Bench 2.1:82.7 vs 81.0;DeepSWE:54.4 vs 46.2),而价格仅 $0.14/$0.28 每百万 token —— 约为 Claude Opus 4.8 输出价格的 1.1%。

⚠️ 准确性说明:本文严格区分官方声称数据(厂商发布)与第三方验证数据(Artificial Analysis、Arena 等)。截至 2026年8月3日,Qwen 3.8 Max 有官方基准但尚无独立验证;Kimi K3、GLM 5.2、DeepSeek V4 Flash 0731 两者皆有。

目录

  1. 为什么 2026 年这场四强对比如此重要
  2. 一图看懂:规格对比总表
  3. 发布时间线:两个月的军备竞赛
  4. 基准测试:官方声称 vs 独立验证
  5. Agent 与编码基准正面交锋
  6. 定价拆解:官方 API、OpenRouter 与缓存
  7. 上下文窗口与多模态能力
  8. 开源权重、许可证与部署
  9. 四款模型怎么选?
  10. 常见问题 FAQ
  11. 最终结论与下一步行动

为什么 2026 年这场四强对比如此重要

2026 年夏天是中国四家实验室在六周内相继发布前沿级模型的首次。如果你正在基于 LLM 构建产品,Qwen 3.8 Max vs GLM 5.2 vs Kimi K3 vs DeepSeek V4 Flash 的选择将决定你的基准上限、单 token 成本,以及能否自托管。三个理由:

  1. 开源权重的差距被抹平了。 Kimi K3(2.8T)、GLM 5.2(约 744B)、Qwen 3.8 Max(2.4T)均已发布或承诺开源权重,DeepSeek V4 Flash 0731(284B)的权重也预计数周内发布。前沿级性能第一次可以脱离云服务运行。
  2. 规模在分化而非趋同。 你可以选择 2.8 万亿参数的巨兽(Kimi K3)、2.4T 的多模态旗舰(Qwen 3.8 Max)、744B 的编码特化选手(GLM 5.2),或是以 284B/13B 激活参数击败远大于自身模型的性价比之王(DeepSeek V4 Flash 0731)。
  3. 四款中三款已有了验证数据。 Artificial Analysis 已对 Kimi K3(57)、GLM 5.2(51)、DeepSeek V4 Flash 0731(50)完成智能指数评测。Qwen 3.8 Max 仍是未知数。

专业提示:2026 年最重要的准确性守则:引用任何数字前,先确认它是厂商发布还是第三方验证的。

一图看懂:规格对比总表

规格 Qwen 3.8 Max(阿里) GLM 5.2(智谱) Kimi K3(月之暗面) DeepSeek V4 Flash 0731
发布日期 2026年7月19日(预览) 2026年6月13–17日 2026年7月16日 2026年7月31日(0731 检查点)
总参数量 2.4T(官方) 约 744B 2.8T 284B
激活参数量 95B(官方) 约 40B 约 50B(896 专家中 16 个) 13B(256 专家中 6 个)
架构 MoE(基于 Qwen 3.5) MoE + 升级版 DeepSeek 稀疏注意力 Stable LatentMoE + KDA 混合注意力 MoE,1 共享 + 256 路由专家,哈希路由
上下文窗口 100 万 token(官方) 100 万 token 100 万 token 100 万 token(1,048,576)
原生多模态 文本、图像、视频、文档 文本优先 文本、图像、音频、视频 仅文本
开源权重 公告承诺"下周开源" MIT,Hugging Face 已上线 MIT,2026年7月27日已开源 预计"数周内"
AA 智能指数 未评测(仅官方声称) 51(已验证) 57(已验证,189 中第 4) 50(已验证)
OpenRouter ID 无(仅 Token Plan) z-ai/glm-5.2 moonshotai/kimi-k3 deepseek/deepseek-v4-flash-0731

发布时间线:两个月的军备竞赛

graph LR
    A[6月13-17日: GLM 5.2] --> B[7月16日: Kimi K3]
    B --> C[7月19日: Qwen 3.8 Max 预览]
    C --> D[7月27日: Kimi K3 权重开源]
    D --> E[7月31日: DeepSeek V4 Flash 0731]
    E --> F[8月上旬: Qwen 3.8 Max 权重? DeepSeek 权重?]
  • 2026年6月13–17日 — 智谱发布 GLM 5.2(约 744B),数周内登顶 Code Arena 与 Design Arena,基于华为昇腾硬件训练。
  • 2026年7月16日 — 月之暗面在 WAIC 上海发布 Kimi K3(2.8T),史上最大开源权重模型。
  • 2026年7月19日 — 阿里在 WAIC 预览 Qwen 3.8 Max(2.4T),声称"仅次于 Fable 5"。
  • 2026年7月27日 — Kimi K3 完整 MIT 权重上线 Hugging Face。
  • 2026年7月31日 — DeepSeek 发布 V4 Flash 0731 检查点(同 284B/13B 架构,完全重新后训练),Agent 基准大幅跃升。

基准测试:官方声称 vs 独立验证

Qwen 3.8 Max vs GLM 5.2 vs Kimi K3 vs DeepSeek V4 Flash 的基准图景分为两层。先看已验证的一层。

第三方验证:Artificial Analysis 智能指数

模型 智能指数 全球排名 备注
Kimi K3(max) 57 189 中第 4 开源权重模型史上最高;与 Claude Opus 4.8(约 56)基本持平
GLM 5.2(max) 51 前十 全评测套件验证通过
DeepSeek V4 Flash 0731(max) 50 与 GLM 5.2 仅差 1 分;与 Gemini 3.6 Flash(50)持平,落后 Muse Spark 1.1(51)1 分
Qwen 3.8 Max 未评测 截至 2026年8月3日无第三方评测

参考点:Claude Fable 5 约 60(第 1)、GPT-5.6 Sol 约 59(第 2)。

官方声称:Qwen 3.8 Max(阿里官方公告)

阿里通义千问官方公告(约 2026年7月30日,微信公众号)正是社区等待已久的官方数据源。确认的规格:2.4T 总参数、95B 激活参数、100 万 token 上下文,且是首个承诺开源权重的 Max 规模模型("权重将于下周开源")。公告中的性能表以图片形式发布,但文字部分包含以下成果:

  • E-Commerce Bench(365 天模拟电商,10 万元启动资金):最终总现金 ¥416,252(4.16 倍回报) —— 比第二名 GLM 5.2 高出 38%比上一代 Qwen 3.7-Max 提升 152%;年终大促期净利润约为 GLM 5.2 的 2.4 倍。
  • 自主芯片设计(GCD/RSA 密码硬件加速器):从首个跑通的 8,298 门,经过约 500 轮交互优化到 678 门 —— 官方声明为参评模型中表现最优。
  • 自主科研循环:约 37 小时复现论文完整流水线后,独立提出 18 个改进方向,最终以 AIME24 +2.7 分超越原方法。
  • 长周期自主编程oh-my-cli 项目约 16 个自主运行日留下 265 次提交、127 个 PR、151 个 issue(GitHub:qwen-code-dev-bot/oh-my-cli)。

对 Qwen 3.8 Max 数字的评估:官方发布、内容详实,但尚无第三方验证(Artificial Analysis 与 LMArena 均未评测)。Qwen 3.7-Max 的验证基准(AA 指数 56.6、GPQA-Diamond 92.4、SWE-bench Verified 80.4、Terminal-Bench 2.0 69.7)仍是该家族唯一经过第三方检验的参照。

⚠️ 注意:Qwen 3.8 Max 目前唯一的独立数据点是 Trilogy AI 的单次盲测 StackPerf:Qwen3.8-Max-Preview 80 vs Kimi K3 83。单次运行、单任务 —— 仅供参考,不能当作定论。

Agent 与编码基准正面交锋

DeepSeek 的 V4 Flash 0731 Hugging Face 模型卡发布了一份四模型 Agent 基准直接对比(模型自报、DeepSeek 自研 harness)。这是目前公开最干净的同口径对比表:

基准 DS V4 Flash 0731 DS V4 Flash(旧) DS V4 Pro(旧) GLM 5.2 Opus 4.8
Terminal-Bench 2.1 82.7 61.8 72.1 81.0 85.0
NL2Repo 54.2 39.4 38.5 48.9 69.7
Cybergym 76.7 38.7 52.7 83.1
DeepSWE 54.4 7.3 12.8 46.2 58.0
Toolathlon-Verified 70.3 49.7 55.9 59.9 76.2
Agents' Last Exam 25.2 15.8 16.5 23.8 25.7
DSBench-FullStack 68.7 37.0 41.8 61.8 71.6
DSBench-Hard 59.6 25.8 31.1 54.5 71.7

请仔细阅读:DeepSeek V4 Flash 0731(13B 激活)在同时出现的每一行都击败了 GLM 5.2(约 40B 激活),并逼近 Claude Opus 4.8;其 0731 检查点的 DeepSWE 从预览版 7.3 跃升至 54.4。社区/Medium 关于"Agent 基准达到 Claude Opus 4.6 水平"的评价与这些数据一致。

编码专项的已验证排名:

编码基准 胜者
Arena 前端编码 Kimi K3 —— 1,679 Elo,第 1(483,895 票盲测,7 个领域拿下 6 个第一)
Code Arena(智谱盲测) GLM 5.2 —— 全球第 1
Design Arena GLM 5.2 —— 第 1,Elo 1360
SWE-bench Verified Kimi K3 约 78% / GLM 5.2 77.8% —— 基本持平
HumanEval Kimi K3 88.3(厂商报告)
Qwen 3.7-Max 基线(SWE-bench Verified) 80.4 —— 3.8 验证前的家族参照

定价拆解:官方 API、OpenRouter 与缓存

模型 输入/百万 输出/百万 缓存输入/百万 备注
DeepSeek V4 Flash 0731 $0.14 $0.28 $0.0028(98% 折扣) 约为 Opus 4.8 输出价的 1.1%;2,500 并发;最大输出 384K
GLM 5.2 $0.29(OpenRouter)/ ¥8(智谱 API) $0.29 NVIDIA NIM 提供免费额度
Kimi K3 高级档(Moonshot API) 高级档 kimi.com 与 Kimi Code 免费
Qwen 3.8 Max 仅预览积分(Token Plan / Qoder) 仅预览积分 预览为标准费率 1/10,夜间 1/50;无公开单价

单任务成本真相:DeepSeek V4 Flash 0731 不仅单价碾压,还比上一版省 12% 的 token(同一智能指数评测仅用 2.06 亿 vs 2.34 亿输出 token)。Kimi K3 的推理深度则往往用更少 token 完成同一任务,可部分抵消其高价。请务必按"每任务端到端成本"做基准,而不是只看费率表。

上下文窗口与多模态能力

四款模型全部支持 100 万 token 上下文窗口 —— 这是 2026 年悄然出现的一大趋同。多模态则差异显著:

模型 多模态? 详情
Kimi K3 ✅ 原生 单次提示支持文本、图像、音频、视频 —— 单一模型覆盖最广
Qwen 3.8 Max ✅ 原生 千问首款超 1T 参数的多模态模型;官方演示覆盖 200+ 页财报、100+ 小时视频("Video Graph 记忆")、Vlog 剪辑、截图还原前端、Blender 3D;RecreationBench 应用复刻基准;Qwen-MM-Plugins 扩展库
GLM 5.2 ⚠️ 文本优先 视觉能力经 GLM-4.5V 系列配套模型提供,非统一架构
DeepSeek V4 Flash 0731 ❌ 仅文本 Artificial Analysis 已确认:仅文本输入输出

如果你的工作负载需要"看一眼 + 思考 + 行动"一模型搞定,选择收窄为 Kimi K3 或 Qwen 3.8 Max。纯文本 Agent 场景下,DeepSeek V4 Flash 0731 的窄模态反而是优点:部署更小、成本更低、没有视觉税。

开源权重、许可证与部署

模型 许可证 权重状态 自托管规模
Kimi K3 MIT 2026年7月27日已开源(moonshotai/Kimi-K3 多节点 H100/MI300(≥8 GPU);vLLM / SGLang
GLM 5.2 MIT 已上线(zai-org/GLM-5.2 单节点 8×H100 或 4×MI300;vLLM、SGLang、llama.cpp
Qwen 3.8 Max 未定 公告承诺"下周开源"(约 7月30日);许可证未公布 权重发布前不明;95B 激活暗示 8 卡级节点
DeepSeek V4 Flash 0731 预计宽松许可 "数周内"(Artificial Analysis) 13B 激活 —— 小型集群即可运行;社区已有 2×DGX Spark 部署方案

最佳实践:今天就要开源权重,选 GLM 5.2(744B)或 Kimi K3(2.8T)。想要最小可自托管的前沿级模型,等 DeepSeek V4 Flash 0731 权重 —— 13B 激活意味着运维成本的天壤之别。Qwen 3.8 Max 的权重日期与许可证截至 2026年8月3日仍未确认。

四款模型怎么选?

graph TD
    A[你最看重什么?] --> B{先要验证过的成绩?}
    A --> C{单模型兼顾<br/>规模与多模态?}
    A --> D{最低的<br/>单任务成本?}
    A --> E{今天就要<br/>开源权重?}
    B -->|是| F[Kimi K3: AA 57, 验证第4]
    C -->|是| G[Kimi K3 或 Qwen 3.8 Max]
    D -->|是| H[DeepSeek V4 Flash 0731: $0.14/$0.28]
    E -->|是| I[GLM 5.2 已上线 / Kimi K3 已开源]
    G --> J{也要厂商基准?}
    J -->|是| K[Qwen 3.8 Max 官方数据+案例]
    J -->|否| L[Kimi K3 原生4模态]

按工作负载推荐:

  • 生产级编码 Agent,今天就要,且要验证数据Kimi K3(AA 57、前端编码第 1)或 GLM 5.2(Code Arena 第 1、单 token 更便宜)。
  • 预算敏感的 Agent 循环DeepSeek V4 Flash 0731 —— 在 DeepSeek Agent 榜单上击败 GLM 5.2,成本只有高级模型约 2%。
  • 长周期自主工作(科研、电商、芯片设计),有厂商实证Qwen 3.8 Max —— 官方案例(4.16 倍电商回报、678 门芯片)是目前最强的公开演示;不过规模化前务必等验证。
  • 原生多模态单一模型Kimi K3(4 种模态)或 Qwen 3.8 Max(视觉 + 视频 + GUI Agent)。
  • 在普通硬件上自托管DeepSeek V4 Flash 0731(13B 激活)或 GLM 5.2(单 8 卡节点)。

常见问题 FAQ

Q:四款中哪款验证基准最强?

A:Kimi K3 —— Artificial Analysis 智能指数 57 分,189 款模型中第 4(开源权重史上最高),Arena 前端编码第 1(1,679 Elo)。GLM 5.2(51)与 DeepSeek V4 Flash 0731(50)在指数上非常接近。

Q:Qwen 3.8 Max 真的"仅次于 Fable 5"吗?

A:这是阿里的官方声称,公告附有详细的内部基准表与案例(E-Commerce Bench 4.16 倍回报、比 GLM 5.2 高 38%、比 Qwen 3.7-Max 高 152%、芯片设计 678 门)。截至 2026年8月3日尚无第三方验证。建议当作有力的厂商主张,等待独立分数。

Q:DeepSeek V4 Flash 0731(13B 激活)凭什么赢 GLM 5.2(40B 激活)?

A:0731 检查点与 V4 Flash 同架构(284B/13B),但完全重新后训练。DeepSeek 官方 HF 表显示其 Agent 能力大幅跃升(DeepSWE 7.3→54.4;Terminal-Bench 2.1 61.8→82.7)。决定 Agent 性能的是后训练质量而非原始规模 —— 这正是 2026 年这款模型教给我们的最重要一课。

Q:四款中最便宜的是?

A:DeepSeek V4 Flash 0731:$0.14/百万输入、$0.28/百万输出、$0.0028/百万缓存输入(98% 折扣)—— 约为 Claude Opus 4.8 输出价的 1.1%,支持 2,500 并发。其次是 OpenRouter 上的 GLM 5.2($0.29/百万)。

Q:哪些可以本地部署?

A:GLM 5.2(MIT 权重已上线)与 Kimi K3(7月27日起 MIT 权重开源)现在就能跑。DeepSeek V4 Flash 0731 权重数周内发布,且最易部署(13B 激活)。Qwen 3.8 Max 公告承诺"下周开源",但截至 2026年8月3日日期与许可证均未确认。

Q:四款都支持 100 万 token 上下文吗?

A:是的 —— Qwen 3.8 Max(官方确认)、GLM 5.2、Kimi K3、DeepSeek V4 Flash 0731(1,048,576 token)全部支持 100 万 token 上下文。

Q:多模态任务选哪款?

A:Kimi K3(原生文本/图像/音频/视频)与 Qwen 3.8 Max(原生图像/视频/文档 + RecreationBench 等 GUI Agent 能力)。GLM 5.2 文本优先(视觉走配套模型),DeepSeek V4 Flash 0731 仅文本。

最终结论与下一步行动

Qwen 3.8 Max vs GLM 5.2 vs Kimi K3 vs DeepSeek V4 Flash 截至 2026年8月的对比,可以归结为四个清晰的押注方向:

  • 押注验证:Kimi K3 —— 四款中唯一拥有前沿级第三方分数的模型。
  • 押注编码 + 今天的开源权重:GLM 5.2 —— Code Arena 第 1、MIT 权重已上线、token 便宜。
  • 押注最新旗舰:Qwen 3.8 Max —— 今年最大的官方基准包;但规模化前务必验证。
  • 押注单任务成本:DeepSeek V4 Flash 0731 —— 接近 Opus 4.8 的 Agent 性能,1/100 的价格。

三步行动方案

  1. 本周:把 Agent 编码流量切到 DeepSeek V4 Flash 0731(OpenRouter 的 deepseek/deepseek-v4-flash-0731,或 DeepSeek API $0.14/$0.28),与现有栈对比基准 —— 98% 的缓存折扣让仓库级上下文循环几乎免费。
  2. 本月:用 Kimi K3(AA 57)评估最难推理/多模态负载,同时关注 Qwen 3.8 Max 的开源权重与首个第三方分数 —— 这两件事将解决对比中最大的悬而未决问题。
  3. 2–4 周后复查:DeepSeek 开源权重与 Qwen 3.8 Max 独立评测都会落地;届时请重跑本对比 —— 官方声称与验证现实之间的差距,正是这场竞赛的决胜点。

数据来源

  • 阿里通义千问官方公告(微信公众号,约 2026年7月30日):Qwen3.8-Max 规格(2.4T、95B 激活、100 万上下文)、E-Commerce Bench、芯片设计、oh-my-cli 案例 —— mp.weixin.qq.com/s/9S8VZETppDj_AidiUFrZlw
  • DeepSeek-V4-Flash-0731 模型卡(Hugging Face)—— 与 V4 Pro、GLM-5.2、Opus-4.8 的 Agent 基准对比:huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731
  • Artificial Analysis —— 智能指数:DeepSeek V4 Flash 0731(50)、GLM-5.2(51)、Kimi K3(57)、Fable 5(约 60)、GPT-5.6 Sol(约 59)
  • Arena(LMArena)前端编码榜 —— Kimi K3 1,679 Elo;智谱 Code Arena / Design Arena —— GLM 5.2 第 1
  • Moonshot AI Kimi K3 发布报道;OpenRouter 模型页;DeepSeek 官方定价页($0.14/$0.28、$0.0028 缓存);Trilogy AI StackPerf(Qwen3.8-Max 80 vs Kimi K3 83)

最后更新:2026-08-03。凡厂商报告数字,在第三方验证完成前均已标注为"声称"。

posted on 2026-08-03 11:54  见路非道  阅读(202)  评论(0)    收藏  举报