顶尖大语言模型调研报告
报告日期:2026年8月13日
范围:全球主要AI厂商旗舰及代表性大语言模型
一、概述
截至2026年8月,全球大语言模型竞争进入白热化阶段。主要产商包括OpenAI、Anthropic、Google、xAI(SpaceXAI)、Meta等美国厂商,以及深度求索(DeepSeek)、阿里(Qwen)、月之暗面(Kimi)、MiniMax等中国厂商。模型参数规模已从千亿级迈向万亿级,上下文窗口普遍达到100万token以上,Agent(智能体)能力成为各厂商竞争的焦点。
在Artificial Analysis Intelligence Index(2026年8月)排名中,Claude Opus 5以60.7分位居榜首,Claude Fable 5(59.9分)和GPT-5.6 Sol(58.9分)紧随其后。在LMArena综合榜上,Claude Fable 5以1507 ELO分继续占据榜首。
二、OpenAI —— GPT-5.6系列
2.1 系列概况
GPT-5.6系列是OpenAI于2026年6月26日宣布、7月9日正式向全球开放的新一代大语言模型系列。这是OpenAI首次在同一代际下推出三档差异化模型——Sol(旗舰)、Terra(均衡)、Luna(轻量),标志着其从“做一个最强的模型”转向“做一个最好用的模型矩阵”。
2.2 GPT-5.6 Sol(旗舰)
| 属性 | 详情 |
|---|---|
| 定位 | 旗舰模型,面向复杂推理、科研、编程及网络安全任务 |
| 上下文窗口 | 150万tokens |
| 最大输出 | 12.8万tokens |
| 推理速度 | 最高750 token/秒(在Cerebras硬件上部署后) |
| API定价 | 输入$5/百万token,输出$30/百万token |
| 特殊模式 | Max模式(深度推理)、Ultra模式(多智能体协同,默认4个并行,最多16个) |
性能亮点:
- Terminal-Bench 2.1编程测试标准模式88.8%,Ultra模式达91.9%,创下该基准新纪录
- Artificial Analysis编程智能体指数80分,比Claude Fable 5高出2.8分,输出Token量不到后者一半
- Agents‘ Last Exam测试创下53.6分新高
- 代理式编程任务效率提升54%,长链条Agent任务Token消耗比前代节省10%-15%
2.3 GPT-5.6 Terra(均衡)& Luna(轻量)
| 维度 | Terra | Luna |
|---|---|---|
| 定位 | 均衡型,性价比之选 | 轻量快速,成本优先 |
| 输入价格 | $2.5/百万token | $1/百万token |
| 输出价格 | $15/百万token | $6/百万token |
| 推理速度 | 标准 | 比前代快2倍 |
三、Anthropic —— Claude系列
Anthropic目前拥有最完整的高端模型矩阵,包括Mythos 5(超旗舰安全研究版)、Fable 5(旗舰)、Opus 5(高性价比旗舰)等。
3.1 Claude Mythos 5
Mythos 5是Anthropic面向专业安全人员推出的“解限版”模型,能力凌驾于Opus系列之上。
| 属性 | 详情 |
|---|---|
| 上下文窗口 | 100万tokens |
| 最大输出 | 12.8万tokens |
| API定价 | 输入$10/百万token,输出$50/百万token |
| 性能评级 | Frontier-Bench评分83/100,排名216个模型中第1 |
核心能力:在生命科学领域展现了真正的研究能力——将药物设计流程加速约10倍;在一周多的自主工作中,完成跨138个物种、数百万细胞的单细胞数据分析。
3.2 Claude Fable 5
Fable 5是Anthropic的旗舰商用模型,于2026年6月初发布。
| 属性 | 详情 |
|---|---|
| 上下文窗口 | 100万tokens |
| 最大输出 | 12.8万tokens |
| API定价 | 输入$10/百万token,输出$50/百万token |
| 知识截止 | 2026年1月 |
| LMArena综合榜 | 1507 ELO分,排名第1 |
3.3 Claude Opus 5
Opus 5于2026年7月24日发布,定位为“接近Fable 5的前沿智能,但价格仅为一半”。
| 属性 | 详情 |
|---|---|
| 上下文窗口 | 100万tokens |
| 最大输出 | 12.8万tokens |
| API定价 | 输入$5/百万token,输出$25/百万token |
| 知识截止 | 2026年5月(比Fable 5更新4个月) |
| Artificial Analysis智能指数 | 60.7分,排名第1 |
性能亮点:
- CursorBench 3.2测试中,开启最高思考深度后与Fable 5最高成绩差距仅0.5%,单次任务成本约为Fable 5的一半
- Frontier-Bench v0.1超越所有其他模型,成绩是Opus 4.8的两倍以上
- ARC-AGI 3得分是GPT-5.6 Sol的3倍
- Zapier AutomationBench通过率约为第二名模型的1.5倍
- OSWorld 2.0(计算机使用基准)超越所有模型,以Fable 5三分之一成本取得更好成绩
- 在Artificial Analysis智能指数上61分,微弱领先Fable 5的60分和GPT-5.6 Sol的59分
四、Google —— Gemini 3.0系列
4.1 Gemini 3.0 核心规格
Gemini 3于2026年3月正式发布,是Google在AI领域的第三次重大迭代,采用彻底的架构重构。
| 属性 | 详情 |
|---|---|
| 参数量 | 9万亿(GPT-5的90%,但效率更高) |
| 上下文窗口 | 1000万tokens(可一次性处理整套维基百科) |
| 模态支持 | 原生支持文本、图像、视频、音频、3D点云 |
| 训练成本 | 30亿美元(比GPT-5低40%) |
| 端侧推理 | 80%查询可在本地完成,基于TensorSoC Gen3 NPU,功耗仅5W |
4.2 Gemini 3.0 Pro
| 属性 | 详情 |
|---|---|
| 架构 | 稀疏混合专家(MoE),万亿级参数 |
| 上下文窗口 | 100万tokens |
| 模态支持 | 文本、图像、音频、视频多模态输入 |
性能亮点:
- GPQA Diamond评测91.9%准确率(Deep Think模式93.8%)
- SWE-bench编码任务76.2%
- AIME 2025数学测试配合代码执行100%准确率
- Video-MMMU多模态推理87.6%
- “人类最后考试”基准无工具辅助37.5%
五、xAI(SpaceXAI)—— Grok 4.6
Grok 4.6于2026年8月发布,是xAI的最新旗舰模型。
| 属性 | 详情 |
|---|---|
| 基础架构 | 1.5万亿参数V9基础架构(与Grok 4.5相同) |
| 上下文窗口 | 50万tokens |
| 模态支持 | 文本和图像输入,文本输出 |
| API定价 | 输入$2/百万token,输出$6/百万token |
| 推理速度 | 78 token/秒(高于同类中位数71) |
| Artificial Analysis智能指数 | 61分,与GPT-5.6 Sol持平 |
核心优势:
- 知识型工作任务仅需约53轮对话和5亿输入token,而Claude Opus 5需要103轮和20亿token——轮次效率优势使单任务成本远低于按token比较的结果
- 在GDPVal-AA v2取得1753 ELO,排名高于GPT-5.6 Sol Max(1728)和Claude Fable 5 Max(1741)
- API定价不到GPT-5.6 Sol和Claude Opus 5的一半
未来规划:Grok 4.7(参数增至2.1万亿)预计3-4周内推出,Grok 5目标年底前发布。
六、DeepSeek —— V4系列
6.1 DeepSeek-V4-Pro(旗舰版)
DeepSeek-V4-Pro于2026年8月13日正式上线。
| 属性 | 详情 |
|---|---|
| 总参数 | 1.6万亿 |
| 激活参数 | 490亿 |
| 上下文窗口 | 100万tokens |
| 最大输出 | 38.4万tokens |
| 模式 | 支持thinking模式和非thinking模式,默认开启thinking |
性能亮点:
- DeepSWE(AI编程智能体基准)得分从预览版的7.3大幅提升至62.7,超越Claude Opus 4.8
- 使用体验优于闭源的Claude Sonnet 4.5,交付品质接近Claude Opus 4.6非思考模式
6.2 DeepSeek-V4-Flash(高性价比版)
V4-Flash正式版于2026年7月31日上线。
| 属性 | 详情 |
|---|---|
| 架构 | MoE(混合专家) |
| 总参数 | 2840亿 |
| 激活参数 | 130亿 |
| 上下文窗口 | 100万tokens |
性能亮点(9项Agent基准测试):
| 基准测试 | V4-Flash正式版 | V4-Flash预览版 |
|---|---|---|
| Terminal-Bench 2.1 | 82.7 | 61.8 |
| NL2Repo | 54.2 | 39.4 |
| DeepSWE | 54.4 | 7.3 |
| Cybergym(网络安全) | 76.7 | 38.7 |
| Toolathlon-Verified | 70.3 | 49.7 |
| Agents‘ Last Exam | 25.2 | 15.8 |
| AutomationBench | 25.1 | 10.8 |
- Artificial Analysis智能指数50分,仅比GPT-5.6 Luna(51分)低1分
- 单任务成本比GPT-5.6 Luna低约60%
七、阿里(Qwen)—— 千问系列
7.1 Qwen3.5-Max-Preview
Qwen3.5-Max-Preview于2026年3月亮相LMArena。
| 属性 | 详情 |
|---|---|
| LMArena得分 | 1464分 |
| 全球排名 | 综合榜第6(无风格控制绝对胜率) |
| 数学能力排名 | 全球第5 |
| 公司排名 | 全球第5、中国公司第1 |
7.2 Qwen3.8-Max
Qwen3.8-Max于2026年8月首秀LMArena综合榜。
| 属性 | 详情 |
|---|---|
| LMArena ELO | 1497分 |
| 综合榜排名 | 第6名(与第5名同分,仅因置信区间差异排名靠后) |
| 上下文窗口 | 100万tokens |
| API定价 | 输入$2/百万token,输出$6/百万token |
八、月之暗面(Moonshot AI)—— Kimi K3
Kimi K3于2026年7月17日发布。
| 属性 | 详情 |
|---|---|
| 总参数 | 2.8万亿 |
| 激活参数 | 1040亿 |
| 架构 | MoE,896个专家模块,每次激活16个 |
| 上下文窗口 | 100万tokens |
| 特色 | 全球首个开源的3万亿级别模型 |
| 视觉能力 | 原生支持视觉理解 |
九、Meta —— Muse-Spark-1.2
Muse-Spark-1.2于2026年8月5日发布。
| 属性 | 详情 |
|---|---|
| 上下文窗口 | 100万tokens |
| 模态支持 | 文本、图像、视频、音频、PDF |
| API定价 | 输入$1.25/百万token,输出$4.25/百万token |
| Artificial Analysis智能指数 | 57分 |
| LMArena综合榜 | 第4名,ELO 1498分 |
| 推理模式 | 始终开启,支持minimal至xhigh五级推理强度 |
十、其他重要模型
10.1 MiniMax M3(开源)
| 属性 | 详情 |
|---|---|
| 总参数 | 4280亿 |
| 激活参数 | 230亿 |
| 上下文窗口 | 100万tokens |
| 架构 | 原生多模态,128个专家,每token激活4位 |
| 特色 | 第一个从零开始做多模态混合训练的开源模型 |
| 输出速度 | 约80 token/秒(计划再提升30-40%) |
| SWE-Bench Pro | 59.0%胜率 |
10.2 NVIDIA Nemotron 3 Ultra(开源)
| 属性 | 详情 |
|---|---|
| 总参数 | 5500亿 |
| 激活参数 | 550亿 |
| 架构 | MoE |
| 推理吞吐 | 比同级别开源模型最高提升5倍 |
| 使用成本 | 比同级别模型最高降低30% |
十一、综合对比总结
11.1 性能排名(Artificial Analysis Intelligence Index,2026年8月)
| 排名 | 模型 | 得分 |
|---|---|---|
| 1 | Claude Opus 5 | 60.7 |
| 2 | Claude Fable 5 | 59.9 |
| 3 | GPT-5.6 Sol | 58.9 |
| — | Grok 4.6 | 61(独立测试) |
| — | Muse-Spark-1.2 | 57 |
| — | DeepSeek-V4-Flash | 50 |
11.2 定价对比(输出/百万token)
| 模型 | 输入价格 | 输出价格 |
|---|---|---|
| Grok 4.6 | $2 | $6 |
| DeepSeek-V4-Flash | — | 极低成本 |
| Claude Opus 5 | $5 | $25 |
| GPT-5.6 Sol | $5 | $30 |
| Claude Fable 5 | $10 | $50 |
| Claude Mythos 5 | $10 | $50 |
11.3 关键趋势
- 万亿参数成标配:头部模型总参数普遍突破万亿级别(GPT-5.6系列、Gemini 3、Grok 4.6、Kimi K3等)。
- 上下文窗口军备竞赛:从100万token起步,Google Gemini 3已达1000万token,大幅领先竞品。
- Agent能力成为核心战场:各厂商最新版本的性能提升主要来自Agent能力的增强,而非单纯的参数堆叠。
- 性价比竞争加剧:Claude Opus 5以Fable 5一半价格提供接近性能;Grok 4.6以不到竞品一半价格实现同等智能水平。
- 中国模型快速追赶:DeepSeek、Qwen、Kimi等国产模型已进入全球第一梯队,在开源和性价比方面具有显著优势。
- 开源生态日益繁荣:Kimi K3(2.8万亿参数)、MiniMax M3、Nemotron 3 Ultra等开源模型不断刷新规模记录,推动AI民主化。
注释与参考文献
本报告所有数据截至 2026年8月13日,信息来源于各厂商官方公告、技术博客及第三方独立基准测试平台。为便于学术引用与行业交流,特设本章节对文中涉及的主要厂商、模型名称、发音及数据源进行统一说明。
a 主要厂商背景与命名释义
| 厂商名称 | 英文音标 | 成立时间与核心背景 | 名称释义 |
|---|---|---|---|
| OpenAI | /ˈoʊ.pən ˈaɪ/ | 2015年由Sam Altman等人联合创立,最初为非营利组织,后转型为“上限利润”公益公司。 | “Open”意为“开放”,“AI”即人工智能,早期愿景是推动AI惠及全人类。 |
| Anthropic | /ænˈθrɒp.ɪk/ | 2021年由Dario Amodei等前OpenAI成员创立,总部位于美国旧金山,核心方向为AI安全与可解释性(Constitutional AI)。 | 源自英文单词“Anthropic”(意为“与人类相关的”),强调其致力于构建“可靠、可解释、可控”的AI系统。 |
| Google (DeepMind) | /ˈɡuː.ɡəl/ | Google旗下AI研究机构,前身DeepMind于2014年被Google收购,现为Google核心AI技术引擎。 | “Gemini”意为“双子座”,暗喻其原生多模态能力(文本与图像、音频、视频的“双生”协同)。 |
| xAI | /eks ˈeɪ aɪ/ | 2023年由Elon Musk创立,总部位于美国旧金山,强调“追求真理”与“反过度政治正确”的AI模型。 | “x”代表“未知变量”,“AI”即人工智能,整体寓意探索未知领域的智能。 |
| Meta (FAIR) | /ˈmet.ə/ | 原名Facebook,2021年更名Meta,旗下AI研究部门FAIR(Fundamental AI Research)长期主导开源大模型生态。 | 源自“Metaverse”(元宇宙),代表公司从社交网络向下一代虚拟空间的战略转型。 |
| DeepSeek | /diːp siːk/ | 中国深度求索公司,由梁文锋创立,以极致性价比和开源策略著称,在全球范围内率先打破大模型高定价壁垒。 | “Deep”深度 + “Seek”探索,意为“深度探索”人工智能的本质与技术极限。 |
| 阿里巴巴 (Qwen) | /ˈælɪˈbɑːbɑː/ | 中国阿里巴巴集团旗下达摩院研发,依托电商与云计算生态布局AI应用。 | “Qwen” = “千问” 的拼音缩写,意为“通晓千问、有问必答”,体现其通用问答能力。 |
| 月之暗面 (Moonshot AI) | /ˈmuːn.ʃɒt/ | 中国AI初创公司,由杨植麟等顶尖学者创立,以超长上下文(Long Context)为核心技术优势。 | “Moonshot”译为“登月计划”,代表挑战极高难度的技术目标;“Kimi”为该系列虚拟助手的拟人化昵称。 |
| MiniMax | /ˈmɪn.i mæks/ | 中国AI独角兽企业,核心技术路线为多模态混合专家(MoE),坚持开源与商业并行。 | “Mini”极小 + “Max”极大,寓意“以极小的计算代价,最大化智能效果”。 |
| NVIDIA | /ɪnˈvɪd.i.ə/ | 全球AI算力龙头,硬件GPU市场主导者,2025年后积极切入大模型自研赛道(Nemotron系列)。 | 源自拉丁语“Invidia”(意为“嫉妒”),因早期Logo形象与“嫉妒之眼”相关,现多解读为“看不见的视觉计算”缩写。 |
b 核心模型名称音标与释义对照表
以下列表统一整理报告中主要模型名称的标准读法(IPA音标)、中文谐音参考及命名背后的文化逻辑,供引用时规范使用。
| 模型名称 | 音标(IPA) | 中文谐音参考 | 命名释义 |
|---|---|---|---|
| GPT-5.6 Sol | /dʒiː piː tiː soʊl/ | “G-P-T 索尔” | GPT = 生成式预训练变换器(Generative Pre-trained Transformer);Sol为拉丁语“太阳”,寓意旗舰版的巅峰算力。 |
| GPT-5.6 Terra | /ˈter.ə/ | “泰拉” | Terra为拉丁语“地球”,代表均衡、稳健的通用性能。 |
| GPT-5.6 Luna | /ˈluː.nə/ | “露娜” | Luna为拉丁语“月亮”,代表轻量、快速、面向大规模高频调用。 |
| Claude Mythos 5 | /ˈmaɪ.θɒs/ | “迈索斯” | 希腊语“神话/传说”,代表了Anthropic最前沿的安全与科研能力。 |
| Claude Fable 5 | /ˈfeɪ.bəl/ | “费波” | 英语“寓言”,暗示模型具有深刻的故事理解与叙事推理能力,定位旗舰商用。 |
| Claude Opus 5 | /ˈoʊ.pəs/ | “欧帕斯” | 拉丁语“作品/巨著”,代表该系列具备厚重、精密的知识加工能力。 |
| Gemini 3.0 | /ˈdʒem.ɪ.naɪ/ | “杰米奈” | 天文学“双子座”,寓意原生多模态(文本与视觉双生)。 |
| Grok 4.6 | /ɡrɒk/ | “格洛克” | 源自罗伯特·海因莱因科幻小说《异乡异客》,意为“通过直觉与共情深刻理解事物”。 |
| Qwen 3.8-Max | /kwɛn/ | “Q-文”或“快恩” | “千问”拼音首字母,即“千次提问,万能应答”。 |
| Kimi K3 | /ˈkiː.miː/ | “基米” | 拟人化昵称,在芬兰语中意为“秘密”,在中文语境中亲切易记。 |
| Muse-Spark | /mjuːz spɑːrk/ | “缪兹·斯帕克” | “Muse”(缪斯女神)代表“创意灵感” + “Spark”(火花)代表“思维引爆点”。 |
| Nemotron 3 Ultra | /ˈneɪ.mə.trɒn/ | “奈莫创” | NVIDIA内部代号,融合“Neuron”(神经元)与“Tron”(电子脉冲),指向极致并行计算。 |
| DeepSeek-V4-Flash | /flæʃ/ | “弗拉什” | “Flash”意为“闪速”,代表该版本主打高吞吐、低延迟的极速响应。 |
c 基准测试与数据来源说明
报告中引用的大量评分与排名数据,主要出自以下国际权威测评平台:
| 基准测试平台 | 性质 | 核心评测维度 | 数据更新时间 |
|---|---|---|---|
| LMArena (Chatbot Arena) | 众包ELO竞技场 | 基于用户盲测投票的大模型综合对话体验排名 | 持续更新,截至2026年8月 |
| Artificial Analysis | 标准化独立评测机构 | 提供统一的 “智能指数” (Intelligence Index),兼顾能力与成本效率 | 2026年8月 |
| SWE-bench / DeepSWE | 自动化软件工程基准 | 评估模型解决真实GitHub Issue的编程与Agent能力 | 2026年迭代版本 |
| Frontier-Bench | 前沿综合能力基准 | 涵盖生命科学、网络安全、数学推理等高阶学术任务 | v0.1 (2026) |
| Terminal-Bench | 终端任务基准 | 测试模型在Shell、命令行、底层运维中的工具调用能力 | v2.1 (2026) |
| ARC-AGI | 抽象推理基准 | 评测模型的泛化与逻辑抽象推理能力(区别于记忆型问答) | ARC-AGI 3 (2026) |
| OSWorld 2.0 | 计算机操作基准 | 评测模型模拟人类操作操作系统、浏览器、办公软件的能力 | v2.0 (2026) |
d 主要参考文献(资料源)
- OpenAI Official Blog – Introducing GPT-5.6 Series: Sol, Terra & Luna. (2026-07-09).
- Anthropic Technical Report – Claude 5 Family: Opus, Fable & Mythos. (2026-07-24).
- Google DeepMind Blog – Gemini 3.0: Native Multimodality at 10M Context. (2026-03-21).
- xAI Official Documentation – Grok 4.6 Release Notes & V9 Architecture. (2026-08-05).
- DeepSeek Official Announcement – DeepSeek-V4-Pro & Flash Official Launch. (2026-08-13).
- LMArena Leaderboard – ELO Scores Snapshot. (Accessed: 2026-08-13).
- Artificial Analysis Intelligence Index – Comparative Benchmark of Leading LLMs. (Published: 2026-08-12).
- 阿里巴巴达摩院 – Qwen3.8-Max 技术白皮书. (2026-08-10).
- 月之暗面 Kimi 官方 – Kimi K3 开源发布说明(2.8万亿参数MoE). (2026-07-17).

浙公网安备 33010602011771号