Qwen3.8-Flash-Next(2026):Qwen Qwen4 预览版架构模型完整指南
Qwen3.8-Flash-Next(2026):Qwen Qwen4 预览版架构模型完整指南
核心要点 (TL;DR)
- Qwen3.8-Flash-Next 是阿里 Qwen 开源的支撑 Qwen4 的架构预览版——一个 125B 参数的 MoE 模型,每次 token 只激活6B 参数(外加 51B n-gram 嵌入),以极低的计算成本带来近前沿的智能。
- 最大看点是效率:Qwen3.8-Flash-Next 的 DeepSWE 1.1 达到 58.7、SWE-bench Pro 达到 62.5、LiveCodeBench v6 达到 91.9,尽管属于"中端 Flash 版",却在多数基准上胜过 Claude Opus 4.6 Max。训练成本约为 Qwen3.7-Plus 的九分之一。
- Qwen3.8-Flash-Next 引入三个全新架构构件——Qwen 稀疏注意力(QSA)、Gated Residual、n-gram 嵌入——重新思考现代 LLM 核心组件在大规模下的交互方式。
- Qwen3.8-Flash-Next 提供原生 262,144 token(256K)上下文窗口(可通过 YaRN 扩展到 1M),Qwen 报告在 1M token 处预填充最快 7.6 倍、解码最快 4.9 倍。官方托管版 Qwen3.8-Flash 默认 1M 上下文并内置工具。
目录
- 什么是 Qwen3.8-Flash-Next?
- Qwen3.8-Flash-Next 架构与规格
- Qwen3.8-Flash-Next 基准测试:效率的跃升
- 为什么"Flash"很重要:Qwen3.8-Flash-Next 的效率
- 运行 Qwen3.8-Flash-Next(部署与 API)
- Qwen3.8-Flash-Next 与竞品对比
- 常见问题解答
- 总结与行动建议
什么是 Qwen3.8-Flash-Next?
Qwen3.8-Flash-Next 是阿里 Qwen 团队发布的最新开源权重模型,标志着其路线图的关键转折。与 Qwen3.8-Max(2.4T 参数的旗舰)或 Qwen3.8-27B(270 亿参数的稠密模型)不同,Qwen3.8-Flash-Next 是基于彻底重构的架构打造的第一款开源模型——模型卡称之为"支撑 Qwen4 的架构的实验性预览"。
名字说明了一切。"Flash" 是 Qwen 的中端、效率优先品牌:用部分原始上限换取显著更低的成本和更快的推理。"Next" 表明这是下一代架构的蓝图。在 Qwen3.8-Flash-Next 中,原本的 Gated DeltaNet 与 Gated Attention 组合被重构为 Gated DeltaNet 加 Qwen 稀疏注意力(QSA),同时引入两个全新组件:Gated Residual 和 n-gram 嵌入。
其结果,Qwen 将其定位为"以部分计算成本,交付更大 Qwen3.8 系列的大部分推理与编码能力"。正如官方发布所言:问题不再是能扩展多少,而是能多高效地扩展。
专业提示: Qwen3.8-Flash-Next 在 Hugging Face 上以
Qwen/Qwen3.8-Flash-Next提供,采用 qwen-community-1.0 许可(开源权重,但非完全宽松的 Apache 2.0)。需要托管推理的话,Qwen Cloud 上的官方 Qwen3.8-Flash 是生产级版本,默认 1M 上下文并内置官方工具。
架构与规格
以下是 Qwen3.8-Flash-Next 的核心规格:
| 规格 | Qwen3.8-Flash-Next |
|---|---|
| 模型类型 | 带视觉编码器的因果语言模型 |
| 总参数 | 125B MoE + 51B n-gram 嵌入 + 4B MTP |
| 每 token 激活参数 | 6B |
| 专家混合(MoE) | 512 个专家(10 路由 + 1 共享激活),专家中间维度 640 |
| 隐藏维度 | 2,560 |
| 层数 | 48 |
| 隐藏布局 | 12 × (3 × (Gated DeltaNet → MoE) → 1 × (Qwen 稀疏注意力 → MoE)) |
| 视觉 | 支持(图像 + 文本输入,原生多模态) |
| 原生上下文 | 262,144 token(256K) |
| 可扩展上下文 | 最大 1,000,000 token(YaRN) |
| 许可 | qwen-community-1.0 |
Qwen3.8-Flash-Next 的决定性特征是:它不是简单的大或小,而是一次架构重构。三大新机制尤为突出。
1. 带 Qwen 稀疏注意力(QSA)的混合注意力
Qwen3.8-Flash-Next 处理注意力的方式发生了最大改变。它不再挑选单个 token,而是让 QSA 在微块(micro-block)级别运作——用轻量索引器(MQA,4 个查询头 + 1 个共享键头,128 维)整体选取需要关注的 token 块。这大幅降低了长上下文延迟,而这在智能体工作负载(拥有海量工具调用历史与巨型代码库)成为现实使用主流的今天至关重要。预算:512 块,即 2,048 token。
2. Gated Residual
深 LLM 的训练之所以可控,得益于带归一化的残差流。Qwen3.8-Flash-Next 用 Gated Residual 对其精巧化:通过逐元素、数据依赖的读门,以及逐分支的标量写门(4 分支,瓶颈秩 320),来调制流经加宽残差流的信息。结果是各层之间更细腻的表达力,同时保持训练稳定,并把推理开销压到很低。
3. n-gram 嵌入
Qwen3.8-Flash-Next 沿一条新轴缩放参数:嵌入而非专家权重。通过用短 n-gram(第 2 层 2000 万个二元/三元组,51B 嵌入参数)做索引,模型实现了计算量更少、也更适合内存卸载的参数缩放,比纯 MoE 更高效——尤其适合内存受限的加速器。这也就是为何 Qwen3.8-Flash-Next 能拥有 125B+ 参数却只激活 6B。
4. 定制训练配方
训练内存与成本通过一套定制配方得到优化:对特定权重类别分别应用 Muon 与 AdamW 优化器。在重新拟合的缩放定律指导下,Qwen 取消了传统的批大小预热,直接从目标批大小开始——大幅减少优化器步数,同时安全地支持更大的学习率以实现稳健收敛。这正是训练成本降到 Qwen3.7-Plus 约九分之一的重要原因。
✅ 最佳实践: 用 Qwen3.8-Flash-Next 做智能体任务时,思考试模式(默认开启)、复杂规划用
reasoning_effort="xhigh"。但要记住:reasoning_effort更高不一定整体更慢——更低可能导致分析不足、失败与重试增多,反而推高总延迟与 token 消耗。
基准测试:效率的跃升
Qwen3.8-Flash-Next 的话题之所以迅速升温,与其基准曲线的形状有关:一个"Flash"(中端)模型在多数测试上超越前沿旗舰。以下是官方语言基准(对比此前的 Qwen 模型、DeepSeek-V4-Flash-0731、Claude Opus 4.6 Max):
| 基准 | Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus | DeepSeek V4 Flash 0731 | Opus 4.6 Max |
|---|---|---|---|---|---|
| 激活参数 | 6B | 27B | 17B | 13B | – |
| DeepSWE 1.1 | 58.7 | 42.2 | 16.5 | 54.4 | – |
| SWE-bench Pro | 62.5 | 61.7 | 55.8 | 56.0 | 53.4 |
| SWE-bench Multilingual | 81.0 | 73.8 | 75.8 | – | 77.5 |
| NL2Repo-Bench | 48.1 | 42.3 | 41.1 | 54.2 | 47.6 |
| CoWorkBench | 73.9 | 70.7 | 65.1 | 45.1 | 68.2 |
| JobBench | 55.7 | 33.4 | 27.6 | 41.3 | 36.6 |
| Agents' Last Exam(得分) | 51.2 | 42.9 | 33.6 | – | – |
| Toolathlon Verified | 73.5 | 67.1 | 50.6 | 70.3 | – |
| IFBench | 81.3 | 79.5 | 79.1 | 79.2 | 62.5 |
| GPQA Diamond | 91.7 | 89.2 | 90.3 | 90.8 | 91.3 |
| HLE | 35.9 | 30.8 | 34.7 | 33.8 | 40.0 |
| LiveCodeBench v6 | 91.9 | 90.3 | 89.6 | 90.6 | 88.8 |
信息再明确不过。Qwen3.8-Flash-Next 在 DeepSWE 1.1(58.7)、SWE-bench Pro(62.5)、SWE-bench Multilingual(81.0)、CoWorkBench(73.9)、JobBench(55.7)、Toolathlon Verified(73.5)与 LiveCodeBench v6(91.9)上均居首——而这一切只用6B 激活参数。Claude Opus 4.6 Max 在 GPQA Diamond(91.3)与 Humanity's Last Exam(40.0)上保持优势,DeepSeek-V4-Flash 在 NL2Repo-Bench(54.2)上胜出。
视觉语言基准
Qwen3.8-Flash-Next 也是原生视觉语言模型。在多模态智能体与通用智能测试上:
| 基准 | Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus | Opus 4.6 Max |
|---|---|---|---|---|
| ClawEval-MM(Pass@3 / 均值) | 64.4 / 60.4 | 57.4 / 56.9 | 57.4 / 60.1 | 52.5 / 54.7 |
| RecreationBench | 49.9 | 47.1 | 30.2 | – |
| AndroidWorld | 84.5 | 81.9 | 81.0 | 62.0 |
| OSWorld 2.0(二值 / 部分) | 19.4 / 52.3 | 19.4 / 48.0 | 2.8 / 21.5 | – |
| Vision2Web | 64.0 | 62.9 | 42.1 | – |
| ERQA | 72.3 | 65.5 | 69.8 | 40.8 |
| LVBench(长视频) | 76.6 | 72.4 | 76.2 | 63.0 |
| RealWorldQA | 88.5 | 85.9 | 86.9 | 73.9 |
| MathVision(with CI) | 95.7 | 94.6 | 88.7 | 65.5 |
| CharXiv RQ(with CI) | 90.6 | 90.2 | 85.9 | 66.0 |
Qwen3.8-Flash-Next 在计算机使用、移动端使用、长视频理解、具身感知与视觉数学上全面超越 Claude Opus 4.6 Max——而这一切都由一个只激活 6B 参数的模型完成。
⚠️ 注意: 这些是 Qwen 官方自测数据,尚未独立验证。在第三方排行榜(如 DeepSWE 或 SWE-bench Pro 排行榜)确认之前,应把最深层的基准主张视为方向性参考。
为什么"Flash"很重要
定位与原始分数同样重要。Qwen3.8-Flash-Next 刻意被定价和定位为中端、效率优先模型——而非旗舰。正因如此,其基准结果才真的令人意外:一个便宜、低激活的模型,在企业最看重的智能体编码与长程基准上占据领先。
经济性是核心。Qwen 声称训练 Qwen3.8-Flash-Next 的成本约为 Qwen3.7-Plus 的九分之一,却几乎在所有基准上胜出。这与 Qwen 数周前在 Qwen3.8-27B 上的思路一致——把更小更便宜的模型与远大于它的对手对比,仍能保持竞争力。Flash-Next 把这一论证再推进一步:直接重构架构本身,使节省来自模型如何计算,而不仅是参数多少。
对任何支付 API token 或自建 GPU 的人来说,Qwen3.8-Flash-Next 的激活比(125B 中 6B 激活)才是实操的看点:大部分智能,极少计算。
专业提示: 如果你的工作负载以长上下文智能体任务为主——庞大的工具调用历史、聊天记录、多文件代码库——那么 Qwen3.8-Flash-Next 的 QSA 与 256K→1M 上下文扩展正是为你而生。Qwen 报告在 1M token 处,预填充最快比先前架构快 7.6 倍、解码最快快 4.9 倍。
运行 Qwen3.8-Flash-Next(部署与 API)
让 Qwen3.8-Flash-Next 跑起来很简单。Qwen 建议大多数用户采用 API 集成;自托管则提供 Transformers 兼容权重,可用于 SGLang、vLLM、TokenSpeed。
支持的推理框架
| 框架 | 说明 |
|---|---|
| SGLang | Qwen3.8-Flash-Next Cookbook —— 推荐用于生产/高吞吐 |
| vLLM | Qwen3.8-Flash-Next Recipe |
| TokenSpeed | Qwen3.8-Flash-Next Recipe |
| KTransformers | 推荐用于高吞吐服务 |
| Qwen Cloud | 官方托管版 Qwen3.8-Flash —— 默认 1M 上下文 + 内置工具 |
[!Important] 推理效率与吞吐在各框架间差异显著。Qwen 强烈建议使用最新版框架;对生产或高吞吐工作负载,强烈推荐 SGLang、KTransformers 或 vLLM 这类专用服务引擎。
API 用法
Qwen3.8-Flash-Next 默认以思考模式运行,在最终回答前生成推理内容(以 \n...\n\n 标示)。可用 enable_thinking、preserve_thinking 与 reasoning_effort(等级:xhigh、medium、low)控制思考行为。
推荐采样参数:
- 思考模式:
temperature=1.0、top_p=0.95、top_k=20、min_p=0.0、presence_penalty=0.0、repetition_penalty=1.0 - 指令(非思考)模式:
temperature=0.7、top_p=0.80、top_k=20、min_p=0.0、presence_penalty=1.5、repetition_penalty=1.0
纯文本示例(OpenAI 兼容 API):
from openai import OpenAI
client = OpenAI() # 设置 OPENAI_BASE_URL 与 OPENAI_API_KEY
completion = client.chat.completions.create(
model="Qwen/Qwen3.8-Flash-Next",
messages=[{"role": "user", "content": "Write a Python function to merge two sorted linked lists."}],
extra_body={
"chat_template_kwargs": {
"enable_thinking": True, # 默认开启
"preserve_thinking": True, # 默认开启
},
},
reasoning_effort="xhigh", # 默认 xhigh;可选 xhigh、medium、low
stream=True,
stream_options={"include_usage": True},
)
Qwen3.8-Flash-Next 也通过标准 OpenAI image_url 内容类型接受图像输入,使其成为 Chat Completions API 即插即用的原生视觉语言模型。
与竞品对比
Qwen3.8-Flash-Next 与其对比对象相比表现如何?
| 模型 | 总参数 | 激活 | DeepSWE | SWE-bench Pro | 本地友好 | 视觉 |
|---|---|---|---|---|---|---|
| Qwen3.8-Flash-Next | 125B | 6B | 58.7 | 62.5 | ✅(高效) | ✅ 原生 |
| Qwen3.8-27B | 27B 稠密 | 27B | 42.2 | 61.7 | ✅(消费级 GPU) | ✅ |
| DeepSeek V4 Flash 0731 | 284B | 13B | 54.4 | 56.0 | ⚠️(较大) | ❌ |
| Qwen3.7-Plus | 397B | 17B | 16.5 | 55.8 | ⚠️ | ✅ |
| Claude Opus 4.6 Max | 前沿 | – | – | 53.4 | ❌ | ✅ |
结论最清晰:Qwen3.8-Flash-Next 不仅超越体量更大、更昂贵的兄弟 Qwen3.7-Plus,还在大部分共享基准上超越前沿的 Claude Opus 4.6 Max——而只激活区区 6B 参数。败点很窄:DeepSeek-V4-Flash 在 NL2Repo-Bench 上占优,Claude 在最难的前沿推理测试(GPQA Diamond 与 HLE)上占优。在智能体编码与长程工作方面,Qwen3.8-Flash-Next 是目前效率之王。
常见问题解答
Q: 什么是 Qwen3.8-Flash-Next?
A: Qwen3.8-Flash-Next 是阿里 Qwen 开源的 Qwen4 架构预览——一个 125B 参数的专家混合视觉语言模型,每 token 只激活 6B 参数,外加 51B n-gram 嵌入。它引入 Qwen 稀疏注意力、Gated Residual 与 n-gram 嵌入,以高效率和规模化面向编码、智能体与长上下文工作负载。
Q: Qwen3.8-Flash-Next 激活多少参数?
A: 在 125B 总参数中,每 token 只有 6B 激活,另有 51B n-gram 嵌入参数与 4B MTP。这一低激活比正是 Qwen3.8-Flash-Next 效率设计的核心。
Q: Qwen3.8-Flash-Next 的基准表现如何?
A: Qwen3.8-Flash-Next 在 DeepSWE 1.1 上得 58.7、SWE-bench Pro 得 62.5、SWE-bench Multilingual 得 81.0、Toolathlon Verified 得 73.5、LiveCodeBench v6 得 91.9——只用 6B 激活参数就在大部分共享基准上超越 Claude Opus 4.6 Max。
Q: Qwen3.8-Flash-Next 的上下文长度是多少?
A: Qwen3.8-Flash-Next 原生支持 262,144 token(256K),可通过 YaRN 缩放扩展到 1,000,000 token。凭借 Qwen 重构的注意力内核,1M token 处预填充最快 7.6 倍、解码最快 4.9 倍。
Q: Qwen3.8-Flash-Next 是开源的么?
A: Qwen3.8-Flash-Next 以 qwen-community-1.0 许可开源(非 Apache 2.0),在 Hugging Face Qwen/Qwen3.8-Flash-Next 与 ModelScope 上提供。商业使用需遵循社区许可条款。
Q: 能本地运行吗?
A: 能。Qwen3.8-Flash-Next 兼容 Transformers,并获 SGLang、vLLM、TokenSpeed、KTransformers 官方支持。因为它只激活 6B 参数,远比参数数量给人的印象更省内存。
Q: 支持图像吗?
A: 支持。Qwen3.8-Flash-Next 是原生视觉语言模型,通过 OpenAI 兼容 Chat Completions API 接受图像 + 文本输入。它在 RealWorldQA 上得 88.5、MathVision(with CI)得 95.7、CharXiv RQ(with CI)得 90.6。
Q: 支持工具调用与思考模式吗?
A: 支持。Qwen3.8-Flash-Next 默认以思考模式运行,支持 enable_thinking、preserve_thinking、reasoning_effort(xhigh/medium/low)。它支持工具调用,并在最终回答之外返回推理内容。
Q: Qwen3.8-Flash(托管版)是什么?
A: Qwen3.8-Flash 是基于 Qwen3.8-Flash-Next 打造的 Qwen Cloud 官方生产版,默认 1M 上下文窗口并内置官方工具——若你想要托管推理而非自托管,推荐使用它。
Q: Qwen3.8-Flash-Next 是何时发布的?
A: Qwen3.8-Flash-Next 开源权重于2026 年 8 月 26 日发布,同步发布技术报告,并在 Qwen Cloud 提供生产版 Qwen3.8-Flash。
总结与行动建议
Qwen3.8-Flash-Next 是 2026 年最重要的效率发布之一。它是 Qwen4 架构的首个开源窗口,并证明一个"中端 Flash"模型——仅 6B 激活参数——能在对真实智能体工作最重要的基准上(DeepSWE 1.1 58.7、SWE-bench Pro 62.5、CoWorkBench 73.9、LiveCodeBench v6 91.9)超越前沿旗舰。凭借原生视觉、256K→1M 上下文、QSA 驱动的长上下文加速、以及 Qwen3.7-Plus 约九分之一的训练成本,它重新定义了"计算对智能"的比率。
注意点:这些是待独立验证的 Qwen 自测基准;许可是 qwen-community-1.0,并非完全宽松;在最难的前沿推理测试(GPQA Diamond 91.3、HLE 40.0)上 Claude Opus 4.6 Max 仍领先。但对成本敏感、长上下文、智能体与多模态工作负载而言,Qwen3.8-Flash-Next 树立了新标杆。
下一步行动:
- 试试 API —— 通过 OpenAI 兼容的 Chat Completions API(本地 SGLang/vLLM 服务或 Qwen Cloud)在真实智能体编码任务上试用 Qwen3.8-Flash-Next。
- 与你的技术栈对标 —— 在 DeepSWE 风格与长上下文任务上,将 Qwen3.8-Flash-Next 与当前模型并排对比,看成本/性能收益。
- 关注架构演进 —— 既然 Qwen3.8-Flash-Next 预览了 Qwen4,请关注 Qwen3.8-Flash-Next 博客 与技术报告 了解全代际落地。
原文: Qwen3.8-Flash-Next (2026): The Complete Guide to Qwen's Qwen4-Preview Architecture Model
参考资料: Hugging Face 上的 Qwen3.8-Flash-Next · Qwen3.8-Flash-Next 博客 · Qwen3.8-Flash-Next 技术报告 · OfficeChai: Alibaba Releases Qwen 3.8 Flash-Next · PC Watch(日文)
浙公网安备 33010602011771号