Qwen3.8-Flash-Next(2026):Qwen Qwen4 预览版架构模型完整指南

Qwen3.8-Flash-Next(2026):Qwen Qwen4 预览版架构模型完整指南

核心要点 (TL;DR)

  • Qwen3.8-Flash-Next 是阿里 Qwen 开源的支撑 Qwen4 的架构预览版——一个 125B 参数的 MoE 模型,每次 token 只激活6B 参数(外加 51B n-gram 嵌入),以极低的计算成本带来近前沿的智能。
  • 最大看点是效率Qwen3.8-Flash-Next 的 DeepSWE 1.1 达到 58.7、SWE-bench Pro 达到 62.5、LiveCodeBench v6 达到 91.9,尽管属于"中端 Flash 版",却在多数基准上胜过 Claude Opus 4.6 Max。训练成本约为 Qwen3.7-Plus 的九分之一
  • Qwen3.8-Flash-Next 引入三个全新架构构件——Qwen 稀疏注意力(QSA)Gated Residualn-gram 嵌入——重新思考现代 LLM 核心组件在大规模下的交互方式。
  • Qwen3.8-Flash-Next 提供原生 262,144 token(256K)上下文窗口(可通过 YaRN 扩展到 1M),Qwen 报告在 1M token 处预填充最快 7.6 倍、解码最快 4.9 倍。官方托管版 Qwen3.8-Flash 默认 1M 上下文并内置工具。

目录

  1. 什么是 Qwen3.8-Flash-Next?
  2. Qwen3.8-Flash-Next 架构与规格
  3. Qwen3.8-Flash-Next 基准测试:效率的跃升
  4. 为什么"Flash"很重要:Qwen3.8-Flash-Next 的效率
  5. 运行 Qwen3.8-Flash-Next(部署与 API)
  6. Qwen3.8-Flash-Next 与竞品对比
  7. 常见问题解答
  8. 总结与行动建议

什么是 Qwen3.8-Flash-Next?

Qwen3.8-Flash-Next 是阿里 Qwen 团队发布的最新开源权重模型,标志着其路线图的关键转折。与 Qwen3.8-Max(2.4T 参数的旗舰)或 Qwen3.8-27B(270 亿参数的稠密模型)不同,Qwen3.8-Flash-Next 是基于彻底重构的架构打造的第一款开源模型——模型卡称之为"支撑 Qwen4 的架构的实验性预览"。

名字说明了一切。"Flash" 是 Qwen 的中端、效率优先品牌:用部分原始上限换取显著更低的成本和更快的推理。"Next" 表明这是下一代架构的蓝图。在 Qwen3.8-Flash-Next 中,原本的 Gated DeltaNet 与 Gated Attention 组合被重构为 Gated DeltaNet 加 Qwen 稀疏注意力(QSA),同时引入两个全新组件:Gated Residualn-gram 嵌入

其结果,Qwen 将其定位为"以部分计算成本,交付更大 Qwen3.8 系列的大部分推理与编码能力"。正如官方发布所言:问题不再是能扩展多少,而是能多高效地扩展

专业提示: Qwen3.8-Flash-Next 在 Hugging Face 上以 Qwen/Qwen3.8-Flash-Next 提供,采用 qwen-community-1.0 许可(开源权重,但非完全宽松的 Apache 2.0)。需要托管推理的话,Qwen Cloud 上的官方 Qwen3.8-Flash 是生产级版本,默认 1M 上下文并内置官方工具。

架构与规格

以下是 Qwen3.8-Flash-Next 的核心规格:

规格 Qwen3.8-Flash-Next
模型类型 带视觉编码器的因果语言模型
总参数 125B MoE + 51B n-gram 嵌入 + 4B MTP
每 token 激活参数 6B
专家混合(MoE) 512 个专家(10 路由 + 1 共享激活),专家中间维度 640
隐藏维度 2,560
层数 48
隐藏布局 12 × (3 × (Gated DeltaNet → MoE) → 1 × (Qwen 稀疏注意力 → MoE))
视觉 支持(图像 + 文本输入,原生多模态)
原生上下文 262,144 token(256K)
可扩展上下文 最大 1,000,000 token(YaRN)
许可 qwen-community-1.0

Qwen3.8-Flash-Next 的决定性特征是:它不是简单的大或小,而是一次架构重构。三大新机制尤为突出。

1. 带 Qwen 稀疏注意力(QSA)的混合注意力

Qwen3.8-Flash-Next 处理注意力的方式发生了最大改变。它不再挑选单个 token,而是让 QSA微块(micro-block)级别运作——用轻量索引器(MQA,4 个查询头 + 1 个共享键头,128 维)整体选取需要关注的 token 块。这大幅降低了长上下文延迟,而这在智能体工作负载(拥有海量工具调用历史与巨型代码库)成为现实使用主流的今天至关重要。预算:512 块,即 2,048 token。

2. Gated Residual

深 LLM 的训练之所以可控,得益于带归一化的残差流。Qwen3.8-Flash-NextGated Residual 对其精巧化:通过逐元素、数据依赖的读门,以及逐分支的标量写门(4 分支,瓶颈秩 320),来调制流经加宽残差流的信息。结果是各层之间更细腻的表达力,同时保持训练稳定,并把推理开销压到很低。

3. n-gram 嵌入

Qwen3.8-Flash-Next 沿一条新轴缩放参数:嵌入而非专家权重。通过用短 n-gram(第 2 层 2000 万个二元/三元组,51B 嵌入参数)做索引,模型实现了计算量更少、也更适合内存卸载的参数缩放,比纯 MoE 更高效——尤其适合内存受限的加速器。这也就是为何 Qwen3.8-Flash-Next 能拥有 125B+ 参数却只激活 6B。

4. 定制训练配方

训练内存与成本通过一套定制配方得到优化:对特定权重类别分别应用 MuonAdamW 优化器。在重新拟合的缩放定律指导下,Qwen 取消了传统的批大小预热,直接从目标批大小开始——大幅减少优化器步数,同时安全地支持更大的学习率以实现稳健收敛。这正是训练成本降到 Qwen3.7-Plus 约九分之一的重要原因。

最佳实践:Qwen3.8-Flash-Next 做智能体任务时,思考试模式(默认开启)、复杂规划用 reasoning_effort="xhigh"。但要记住:reasoning_effort 更高不一定整体更慢——更低可能导致分析不足、失败与重试增多,反而推高总延迟与 token 消耗。

基准测试:效率的跃升

Qwen3.8-Flash-Next 的话题之所以迅速升温,与其基准曲线的形状有关:一个"Flash"(中端)模型在多数测试上超越前沿旗舰。以下是官方语言基准(对比此前的 Qwen 模型、DeepSeek-V4-Flash-0731、Claude Opus 4.6 Max):

基准 Qwen3.8-Flash-Next Qwen3.8-27B Qwen3.7-Plus DeepSeek V4 Flash 0731 Opus 4.6 Max
激活参数 6B 27B 17B 13B
DeepSWE 1.1 58.7 42.2 16.5 54.4
SWE-bench Pro 62.5 61.7 55.8 56.0 53.4
SWE-bench Multilingual 81.0 73.8 75.8 77.5
NL2Repo-Bench 48.1 42.3 41.1 54.2 47.6
CoWorkBench 73.9 70.7 65.1 45.1 68.2
JobBench 55.7 33.4 27.6 41.3 36.6
Agents' Last Exam(得分) 51.2 42.9 33.6
Toolathlon Verified 73.5 67.1 50.6 70.3
IFBench 81.3 79.5 79.1 79.2 62.5
GPQA Diamond 91.7 89.2 90.3 90.8 91.3
HLE 35.9 30.8 34.7 33.8 40.0
LiveCodeBench v6 91.9 90.3 89.6 90.6 88.8

信息再明确不过。Qwen3.8-Flash-Next 在 DeepSWE 1.1(58.7)、SWE-bench Pro(62.5)、SWE-bench Multilingual(81.0)、CoWorkBench(73.9)、JobBench(55.7)、Toolathlon Verified(73.5)与 LiveCodeBench v6(91.9)上均居首——而这一切只用6B 激活参数。Claude Opus 4.6 Max 在 GPQA Diamond(91.3)与 Humanity's Last Exam(40.0)上保持优势,DeepSeek-V4-Flash 在 NL2Repo-Bench(54.2)上胜出。

视觉语言基准

Qwen3.8-Flash-Next 也是原生视觉语言模型。在多模态智能体与通用智能测试上:

基准 Qwen3.8-Flash-Next Qwen3.8-27B Qwen3.7-Plus Opus 4.6 Max
ClawEval-MM(Pass@3 / 均值) 64.4 / 60.4 57.4 / 56.9 57.4 / 60.1 52.5 / 54.7
RecreationBench 49.9 47.1 30.2
AndroidWorld 84.5 81.9 81.0 62.0
OSWorld 2.0(二值 / 部分) 19.4 / 52.3 19.4 / 48.0 2.8 / 21.5
Vision2Web 64.0 62.9 42.1
ERQA 72.3 65.5 69.8 40.8
LVBench(长视频) 76.6 72.4 76.2 63.0
RealWorldQA 88.5 85.9 86.9 73.9
MathVision(with CI) 95.7 94.6 88.7 65.5
CharXiv RQ(with CI) 90.6 90.2 85.9 66.0

Qwen3.8-Flash-Next 在计算机使用、移动端使用、长视频理解、具身感知与视觉数学上全面超越 Claude Opus 4.6 Max——而这一切都由一个只激活 6B 参数的模型完成。

⚠️ 注意: 这些是 Qwen 官方自测数据,尚未独立验证。在第三方排行榜(如 DeepSWE 或 SWE-bench Pro 排行榜)确认之前,应把最深层的基准主张视为方向性参考。

为什么"Flash"很重要

定位与原始分数同样重要。Qwen3.8-Flash-Next 刻意被定价和定位为中端、效率优先模型——而非旗舰。正因如此,其基准结果才真的令人意外:一个便宜、低激活的模型,在企业最看重的智能体编码与长程基准上占据领先。

经济性是核心。Qwen 声称训练 Qwen3.8-Flash-Next 的成本约为 Qwen3.7-Plus九分之一,却几乎在所有基准上胜出。这与 Qwen 数周前在 Qwen3.8-27B 上的思路一致——把更小更便宜的模型与远大于它的对手对比,仍能保持竞争力。Flash-Next 把这一论证再推进一步:直接重构架构本身,使节省来自模型如何计算,而不仅是参数多少。

对任何支付 API token 或自建 GPU 的人来说,Qwen3.8-Flash-Next 的激活比(125B 中 6B 激活)才是实操的看点:大部分智能,极少计算。

专业提示: 如果你的工作负载以长上下文智能体任务为主——庞大的工具调用历史、聊天记录、多文件代码库——那么 Qwen3.8-Flash-Next 的 QSA 与 256K→1M 上下文扩展正是为你而生。Qwen 报告在 1M token 处,预填充最快比先前架构快 7.6 倍、解码最快快 4.9 倍

运行 Qwen3.8-Flash-Next(部署与 API)

Qwen3.8-Flash-Next 跑起来很简单。Qwen 建议大多数用户采用 API 集成;自托管则提供 Transformers 兼容权重,可用于 SGLang、vLLM、TokenSpeed。

支持的推理框架

框架 说明
SGLang Qwen3.8-Flash-Next Cookbook —— 推荐用于生产/高吞吐
vLLM Qwen3.8-Flash-Next Recipe
TokenSpeed Qwen3.8-Flash-Next Recipe
KTransformers 推荐用于高吞吐服务
Qwen Cloud 官方托管版 Qwen3.8-Flash —— 默认 1M 上下文 + 内置工具

[!Important] 推理效率与吞吐在各框架间差异显著。Qwen 强烈建议使用最新版框架;对生产或高吞吐工作负载,强烈推荐 SGLangKTransformersvLLM 这类专用服务引擎。

API 用法

Qwen3.8-Flash-Next 默认以思考模式运行,在最终回答前生成推理内容(以 \n...\n\n 标示)。可用 enable_thinkingpreserve_thinkingreasoning_effort(等级:xhighmediumlow)控制思考行为。

推荐采样参数:

  • 思考模式: temperature=1.0top_p=0.95top_k=20min_p=0.0presence_penalty=0.0repetition_penalty=1.0
  • 指令(非思考)模式: temperature=0.7top_p=0.80top_k=20min_p=0.0presence_penalty=1.5repetition_penalty=1.0

纯文本示例(OpenAI 兼容 API):

from openai import OpenAI

client = OpenAI()  # 设置 OPENAI_BASE_URL 与 OPENAI_API_KEY

completion = client.chat.completions.create(
    model="Qwen/Qwen3.8-Flash-Next",
    messages=[{"role": "user", "content": "Write a Python function to merge two sorted linked lists."}],
    extra_body={
        "chat_template_kwargs": {
            "enable_thinking": True,   # 默认开启
            "preserve_thinking": True, # 默认开启
        },
    },
    reasoning_effort="xhigh",          # 默认 xhigh;可选 xhigh、medium、low
    stream=True,
    stream_options={"include_usage": True},
)

Qwen3.8-Flash-Next 也通过标准 OpenAI image_url 内容类型接受图像输入,使其成为 Chat Completions API 即插即用的原生视觉语言模型。

与竞品对比

Qwen3.8-Flash-Next 与其对比对象相比表现如何?

模型 总参数 激活 DeepSWE SWE-bench Pro 本地友好 视觉
Qwen3.8-Flash-Next 125B 6B 58.7 62.5 ✅(高效) ✅ 原生
Qwen3.8-27B 27B 稠密 27B 42.2 61.7 ✅(消费级 GPU)
DeepSeek V4 Flash 0731 284B 13B 54.4 56.0 ⚠️(较大)
Qwen3.7-Plus 397B 17B 16.5 55.8 ⚠️
Claude Opus 4.6 Max 前沿 53.4

结论最清晰:Qwen3.8-Flash-Next 不仅超越体量更大、更昂贵的兄弟 Qwen3.7-Plus,还在大部分共享基准上超越前沿的 Claude Opus 4.6 Max——而只激活区区 6B 参数。败点很窄:DeepSeek-V4-Flash 在 NL2Repo-Bench 上占优,Claude 在最难的前沿推理测试(GPQA Diamond 与 HLE)上占优。在智能体编码与长程工作方面,Qwen3.8-Flash-Next 是目前效率之王。

常见问题解答

Q: 什么是 Qwen3.8-Flash-Next?

A: Qwen3.8-Flash-Next 是阿里 Qwen 开源的 Qwen4 架构预览——一个 125B 参数的专家混合视觉语言模型,每 token 只激活 6B 参数,外加 51B n-gram 嵌入。它引入 Qwen 稀疏注意力、Gated Residual 与 n-gram 嵌入,以高效率和规模化面向编码、智能体与长上下文工作负载。

Q: Qwen3.8-Flash-Next 激活多少参数?

A: 在 125B 总参数中,每 token 只有 6B 激活,另有 51B n-gram 嵌入参数与 4B MTP。这一低激活比正是 Qwen3.8-Flash-Next 效率设计的核心。

Q: Qwen3.8-Flash-Next 的基准表现如何?

A: Qwen3.8-Flash-Next 在 DeepSWE 1.1 上得 58.7、SWE-bench Pro 得 62.5、SWE-bench Multilingual 得 81.0、Toolathlon Verified 得 73.5、LiveCodeBench v6 得 91.9——只用 6B 激活参数就在大部分共享基准上超越 Claude Opus 4.6 Max。

Q: Qwen3.8-Flash-Next 的上下文长度是多少?

A: Qwen3.8-Flash-Next 原生支持 262,144 token(256K),可通过 YaRN 缩放扩展到 1,000,000 token。凭借 Qwen 重构的注意力内核,1M token 处预填充最快 7.6 倍、解码最快 4.9 倍。

Q: Qwen3.8-Flash-Next 是开源的么?

A: Qwen3.8-Flash-Nextqwen-community-1.0 许可开源(非 Apache 2.0),在 Hugging Face Qwen/Qwen3.8-Flash-Next 与 ModelScope 上提供。商业使用需遵循社区许可条款。

Q: 能本地运行吗?

A: 能。Qwen3.8-Flash-Next 兼容 Transformers,并获 SGLang、vLLM、TokenSpeed、KTransformers 官方支持。因为它只激活 6B 参数,远比参数数量给人的印象更省内存。

Q: 支持图像吗?

A: 支持。Qwen3.8-Flash-Next 是原生视觉语言模型,通过 OpenAI 兼容 Chat Completions API 接受图像 + 文本输入。它在 RealWorldQA 上得 88.5、MathVision(with CI)得 95.7、CharXiv RQ(with CI)得 90.6。

Q: 支持工具调用与思考模式吗?

A: 支持。Qwen3.8-Flash-Next 默认以思考模式运行,支持 enable_thinkingpreserve_thinkingreasoning_effort(xhigh/medium/low)。它支持工具调用,并在最终回答之外返回推理内容。

Q: Qwen3.8-Flash(托管版)是什么?

A: Qwen3.8-Flash 是基于 Qwen3.8-Flash-Next 打造的 Qwen Cloud 官方生产版,默认 1M 上下文窗口并内置官方工具——若你想要托管推理而非自托管,推荐使用它。

Q: Qwen3.8-Flash-Next 是何时发布的?

A: Qwen3.8-Flash-Next 开源权重于2026 年 8 月 26 日发布,同步发布技术报告,并在 Qwen Cloud 提供生产版 Qwen3.8-Flash

总结与行动建议

Qwen3.8-Flash-Next 是 2026 年最重要的效率发布之一。它是 Qwen4 架构的首个开源窗口,并证明一个"中端 Flash"模型——仅 6B 激活参数——能在对真实智能体工作最重要的基准上(DeepSWE 1.1 58.7、SWE-bench Pro 62.5、CoWorkBench 73.9、LiveCodeBench v6 91.9)超越前沿旗舰。凭借原生视觉、256K→1M 上下文、QSA 驱动的长上下文加速、以及 Qwen3.7-Plus 约九分之一的训练成本,它重新定义了"计算对智能"的比率。

注意点:这些是待独立验证的 Qwen 自测基准;许可是 qwen-community-1.0,并非完全宽松;在最难的前沿推理测试(GPQA Diamond 91.3、HLE 40.0)上 Claude Opus 4.6 Max 仍领先。但对成本敏感、长上下文、智能体与多模态工作负载而言,Qwen3.8-Flash-Next 树立了新标杆。

下一步行动:

  1. 试试 API —— 通过 OpenAI 兼容的 Chat Completions API(本地 SGLang/vLLM 服务或 Qwen Cloud)在真实智能体编码任务上试用 Qwen3.8-Flash-Next
  2. 与你的技术栈对标 —— 在 DeepSWE 风格与长上下文任务上,将 Qwen3.8-Flash-Next 与当前模型并排对比,看成本/性能收益。
  3. 关注架构演进 —— 既然 Qwen3.8-Flash-Next 预览了 Qwen4,请关注 Qwen3.8-Flash-Next 博客技术报告 了解全代际落地。

原文: Qwen3.8-Flash-Next (2026): The Complete Guide to Qwen's Qwen4-Preview Architecture Model

参考资料: Hugging Face 上的 Qwen3.8-Flash-Next · Qwen3.8-Flash-Next 博客 · Qwen3.8-Flash-Next 技术报告 · OfficeChai: Alibaba Releases Qwen 3.8 Flash-Next · PC Watch(日文)

posted on 2026-08-26 22:10  见路非道  阅读(268)  评论(0)    收藏  举报