Qwen3.8-27B(2026):Qwen 新 27B 视觉语言模型完整指南

Qwen3.8-27B(2026):Qwen 新 27B 视觉语言模型完整指南

核心要点 (TL;DR)

  • Qwen3.8-27B 是阿里 Qwen 团队新推出的 270 亿参数稠密模型——原生视觉语言模型,支持图像视频理解,具备灵活的思考控制,采用 Apache 2.0 开源权重。
  • 最大看点是本地模型尺寸下的智能体性能Qwen3.8-27B 的 DeepSWE 1.1 达到 42.2(前代 Qwen3.6-27B 仅 13.3),Terminal Bench 2.1 达到 73.0,并在 SWE-bench Pro、QwenSWEBench、LiveCodeBench v6、OSWorld、AndroidWorld 上超越 Claude Opus 4.6 Max。
  • Qwen3.8-27B 提供原生 262,144 token(262K)上下文窗口(可通过 YaRN 扩展到 1M)、28B BF16 权重、默认开启的思考模式,以及 xhigh/medium/low 三档 reasoning_effort
  • OpenRouter 上 Qwen3.8-27B 的定价为每百万输入 token $0.45、输出 $3.20——Reddit 用户已在 RTX 3090、双 RTX 5080 和 16GB 显存显卡上本地运行它。

目录

  1. 什么是 Qwen3.8-27B?
  2. Qwen3.8-27B 架构与规格
  3. Qwen3.8-27B 基准测试:智能体的跃升
  4. Qwen3.8-27B 定价与 API 访问
  5. 本地运行 Qwen3.8-27B
  6. Qwen3.8-27B 与竞品对比
  7. 常见问题解答

什么是 Qwen3.8-27B?

Qwen3.8-27B 是 Qwen3.8 家族的最新成员——官方模型卡称之为"Qwen 开源模型家族迄今最强的一代"。在 Qwen3.5 的架构基础上,Qwen3.8-27B 在编码、专业工作、研究和长程智能体任务上带来全面大幅提升,同时保持紧凑、易于部署的稠密形态。

关键词是"稠密"。与 2026 年 8 月 8 日权重发布时抢占头条的巨型 Qwen3.8-Max(2.4T 参数 MoE)不同,Qwen3.8-27B 是为个人真正拥有的硬件而设计的 270 亿参数稠密模型。r/LocalLLaMA 发布帖称 Qwen3.8-27B 是"备受喜爱的 Qwen 模型的焕新之作,带来无与伦比的智能密度"。

Qwen3.8-27B 还是原生视觉语言模型:开箱即可理解图像和视频——从 STEM 图表、文档到小时级视频。它是该级别首个具备完整多模态输入和社区自 GPT-OSS 时代就渴望的灵活思考控制的 Qwen 模型。一位 Reddit 用户写道:"终于来了!自 GPT-OSS 以来我一直在等一个原生支持 low/medium 推理的本地模型!规划用 high,执行和探索用 low!"

专业提示

Qwen3.8-27B 托管在 Hugging Face 的 Qwen/Qwen3.8-27B(9.47K 点赞、月下载约 9.2 万、319 个量化变体)和 ModelScope 上。Qwen Cloud 托管版即将推出,默认提供 1M 上下文和内置工具。

Qwen3.8-27B 架构与规格

看看 Qwen3.8-27B 的机箱内部:

规格 Qwen3.8-27B
模型类型 带视觉编码器的因果 LM
参数 27B(BF16,磁盘约 28B)
隐藏维度 5,120
层数 64
隐藏布局 16 × (3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN))
线性注意力头 48 V / 16 QK(Gated DeltaNet),维度 128
注意力头 24 Q / 4 KV(Gated Attention),维度 256
FFN 中间维度 17,408
多 token 预测 多步训练
原生上下文 262,144 token
可扩展上下文 最大 1,000,000 token(YaRN)
许可证 Apache 2.0
输入 文本、图像、视频
输出 文本

混合架构结合了 Gated DeltaNet(用于低成本长上下文处理的线性注意力)与 Gated Attention 层,并通过多 token 预测(MTP)加速解码。Qwen3.8-27B 默认开启思考模式,reasoning_effort 可在 xhigh(默认)/medium/low 间调节;preserve_thinking 跨轮次保留推理上下文,模型卡称这能"改善 KV 缓存利用率,优化思考与非思考两种模式的推理效率"。

对于超过 262K 的超长任务,Qwen3.8-27B 推荐使用 YaRN RoPE 缩放(factor 设为 4.0;若典型上下文约 524K 则建议 2.0),vLLM、SGLang、TokenSpeed 均支持。

最佳实践

Qwen3.8-27B 跑智能体任务时,请分配充足的输出长度:推理内容最大 262,144 token,最终回答 131,072 token。降低 reasoning_effort 并不总能缩短总耗时——分析不足会导致更多失败和重试。

Qwen3.8-27B 基准测试:智能体的跃升

Qwen3.8-27B 之所以让发布帖出现"DeepSWE 大跃升——新的本地编码冠军诞生?"这样的评论,是因为它相对前代的提升幅度。以下是官方文本基准(注明的使用 Claude Code harness):

基准 Qwen3.8-27B Qwen3.6-27B Qwen3.7-Plus Opus 4.6 Max
Terminal Bench 2.1 (Terminus) 73.0 63.4 64.0 78.2
SWE-bench Pro 61.7 53.5 57.6 53.4
NL2Repo-Bench 42.3 36.2 41.1 47.6
DeepSWE 1.1 42.2 13.3 14.2
QwenSWEBench 79.0 49.3 59.2 63.8
CoWorkBench 70.7 61.0 65.1 68.2
JobBench 33.4 21.8 27.6
Agents' Last Exam(分数) 42.9 27.3 33.6
IFBench 79.5 69.1 79.1 62.5
GPQA Diamond 89.2 87.8 90.3 91.3
HLE 30.8 24.0 34.7 40.0
LiveCodeBench v6 90.3 83.9 89.6 88.8

DeepSWE 数字最为突出:Qwen3.8-27B 把前代成绩翻了三倍多(13.3 → 42.2),并在 SWE-bench Pro、QwenSWEBench、CoWorkBench、LiveCodeBench v6 上超越 Opus 4.6 Max——尽管体量只有后者的零头。独立榜单已经与模型卡一致:datacurve 的 DeepSWE 榜单将 Qwen3.8-27B 列为 42.2,ScaleAI 的 SWE-bench Pro 为 61.7。

Qwen3.8-27B 真正与其它本地模型拉开差距的是多模态智能体:

VL 基准 Qwen3.8-27B Qwen3.6-27B Opus 4.6 Max
OSWorld-Verified(电脑操作) 84.3 63.9 72.7
WebArena-Verified(浏览器操作) 64.8 48.8
AndroidWorld(移动端操作) 81.9 70.3 62.0
RecreationBench 47.1 29.8
ClawEval-MM(Pass@3) 57.4 42.6 52.5
SWE-MM 38.6 25.7 27.1
Vision2Web 62.9 45.0
MathVision(含 CI) 94.6 85.1 65.5
CharXiv(含 CI) 90.2 78.4 85.9
OmniDocBench 1.5 91.1 89.4 86.6
RealWorldQA 85.9 84.1 73.9
ERQA 65.5 62.5 40.8

Qwen3.8-27B 在 OSWorld、AndroidWorld、SWE-MM、MathVision、CharXiv、OmniDocBench、RealWorldQA、ERQA 上击败 Opus 4.6 Max——电脑操作、移动端操作、文档智能、具身感知,全部装进一个消费级显卡能跑动的模型。

Qwen3.8-27B 定价与 API 访问

Qwen3.8-27B 已在 OpenRouter 上线,模型 ID 为 qwen/qwen3.8-27b

定价项 Qwen3.8-27B
输入 / 100 万 token $0.45(加权均价 $0.4499)
输出 / 100 万 token $3.20(加权均价 $3.199)
上下文窗口 262K
OpenRouter 上线日期 2026 年 8 月 14 日
供应商 AkashML(单一)
吞吐 18 token/s(P50)
延迟 1.50s(P50)
3 天可用率 91.97%
3 天可用性 79.65%
工具调用错误率 1.06%
结构化输出错误率 17.52%

早期生产流量说明了一切:Qwen3.8-27B 在 OpenRouter 上的头部应用是 Kilo Code(798 万 token)、Zed Editor(702 万)、pi(482 万)、Hermes Agent(450 万)——全是智能体编码工具。以 $0.45/$3.20 的价格,Qwen3.8-27B 比多数前沿 API 便宜一个数量级,同时支持工具调用、结构化输出、图像和视频。

API 用法遵循标准 Qwen3.8 模式:思考模式默认开启(enable_thinking: True),reasoning_effort 支持 xhigh/medium/low,preserve_thinking: True 为默认。推荐采样参数:思考模式温度 1.0 / top_p 0.95;指令模式 0.7 / 0.8 加 presence_penalty 1.5。

⚠️ 注意

OpenRouter 目前通过单一供应商(AkashML)路由 Qwen3.8-27B,3 天可用性仅 79.65%,结构化输出错误率 17.52%。生产环境追求可靠性,建议等 Qwen Cloud 托管版或自托管。

本地运行 Qwen3.8-27B

这是 Qwen3.8-27B 最闪光的领域——发布帖的头条评论是"RTX 3090 粉丝:出动"。社区实测汇总:

  • 双 RTX 5080(共 32GB): 用户 n0head_r 用 unsloth 的 Qwen38-27B-Q6_K GGUF,172K 上下文(kv q8_0)、MTP + 张量并行,在 60–70K 上下文前稳定跑出 约 100 token/s(100K 时约 95 tps)。一个 15 万 token 的智能体循环——写代码、构建、验证、修 bug——工具调用零失败
  • RTX 4080 16GB: r/ollama 上 Qwen3.8-27B 以 12.6GB 显存 / 5.6GB 内存、8K 上下文运行,完成一个双工具智能体任务(数学评估 + 实时加密货币价格,均正确)约 18 秒。
  • RTX 3090 24GB: 预期是 Q4/Q6 量化的甜点;unsloth 的 Q8_0 也有运行报告。

Qwen3.8-27B 的部署选项:

  1. Hugging Face TransformersAutoModelForMultimodalLM.from_pretrained("Qwen/Qwen3.8-27B")
  2. vLLM / SGLang / TokenSpeedvllm serve "Qwen/Qwen3.8-27B" 提供 OpenAI 兼容 API
  3. llama.cpp / Ollama / LM Studio — 通过 319 个社区量化版本(Q4_K_M、Q6_K、Q8_0 等)
  4. Docker Model Runnerdocker model run hf.co/Qwen/Qwen3.8-27B

最佳实践

单卡 16–24GB 显存:用 unsloth 的 Qwen3.8-27B Q4 或 Q6 GGUF;32GB 以上显存或双卡:Q8_0 + 张量并行 + MTP 的速度/质量平衡最佳。

Qwen3.8-27B 与竞品对比

Qwen3.8-27B 和它被拿来比较的模型相比如何?

模型 规模 DeepSWE Terminal Bench 本地友好 视觉
Qwen3.8-27B 27B 稠密 42.2 73.0 ✅(16GB+ 显存) ✅ 图像+视频
DeepSeek V4 Flash 0731 284B A13B 54.4 82.7 ⚠️(体积大)
Qwen3.6-27B 27B 稠密 13.3 63.4
Opus 4.6 Max 前沿 78.2
Minimax M2.7 MoE ⚠️

Reddit 的评价:"27B 参数下,Qwen3.8-27B 已经非常接近 284B A13B 的 DeepSeek V4 Flash 0731!"也有人表示"看起来比 900B+ 的 MoE 还好",并讨论 Qwen3.8-27B 能否在智能体编码上胜过 Minimax M2.7。目前的结论:Qwen3.8-27B 以参数量的零头提供了接近前沿的智能体与多模态性能,是 27B 级别迄今最强的本地编码选手。

常见问题解答

Q: Qwen3.8-27B 是什么?

A: Qwen3.8-27B 是阿里 Qwen 于 2026 年 8 月以 Apache 2.0 开源权重发布的 270 亿参数稠密视觉语言模型。它理解图像和视频,支持灵活的思考控制,面向编码、专业工作、研究和长程智能体任务。

Q: Qwen3.8-27B 多少钱?

A: OpenRouter 上 Qwen3.8-27B 每百万输入 token $0.45、每百万输出 token $3.20。Apache 2.0 许可下自托管免费,带 1M 上下文的 Qwen Cloud 托管版即将推出。

Q: Qwen3.8-27B 的上下文长度是多少?

A: Qwen3.8-27B 原生支持 262,144 token(262K),可通过 vLLM、SGLang 或 TokenSpeed 的 YaRN RoPE 缩放扩展到 1,000,000 token。

Q: Qwen3.8-27B 支持图像和视频吗?

A: 支持。Qwen3.8-27B 是原生视觉语言模型,支持从 STEM 图表、文档到小时级视频的图像与视频输入,并具备电脑操作(OSWorld-Verified 84.3)和浏览器操作(WebArena-Verified 64.8)能力。

Q: 可以本地运行 Qwen3.8-27B 吗?

A: 可以。Qwen3.8-27B 能在消费级显卡上运行:已有 RTX 3090 24GB、双 RTX 5080(Q6_K 约 100 tps、172K 上下文)、RTX 4080 16GB(Ollama 下 12.6GB 显存)等实测。共有 319 个量化版本可用。

Q: Qwen3.8-27B 支持工具调用和结构化输出吗?

A: 支持。Qwen3.8-27B 支持工具调用、JSON 输出和 OpenAI 兼容的 Chat Completions API,Kilo Code、Zed、pi、Hermes Agent 已通过 OpenRouter 在生产中使用它。

Q: Qwen3.8-27B 是开源的吗?

A: Qwen3.8-27B 以 Apache 2.0 许可证发布——完全开源权重、允许商用。可在 Hugging Face(Qwen/Qwen3.8-27B)和 ModelScope 获取。

Q: Qwen3.8-27B 什么时候发布的?

A: Qwen3.8-27B 于 2026 年 8 月 14 日发布(Hugging Face 和 ModelScope 上线开源权重,同日登上 OpenRouter),此前的发布消息与 Qwen3.8-Max 一同宣布。

Q: Qwen3.8-27B 相比 Qwen3.6-27B 提升多少?

A: Qwen3.8-27B 将 DeepSWE 提升约 3 倍(13.3 → 42.2)、Terminal Bench 提升约 10 分(63.4 → 73.0)、SWE-bench Pro +8.2、OSWorld +20(63.9 → 84.3)——整整一代的进步。

总结与行动建议

Qwen3.8-27B 是本地 AI 社区期待已久的模型:接近前沿的智能体性能——DeepSWE 42.2、SWE-bench Pro 61.7、OSWorld 84.3、LiveCodeBench v6 90.3——浓缩进单块 24GB 显卡即可运行的 27B 稠密包,多项基准超越 Opus 4.6 Max,OpenRouter 上每百万 token 仅 $0.45/$3.20。它还有视觉(图像+视频)、灵活思考控制、262K 原生上下文和 Apache 2.0 许可。

注意点:基准数据为 Qwen 官方自测,尚待独立验证;OpenRouter 单一 AkashML 供应商可用性 79.65%;结构化输出可靠性(17.52% 错误率)需要关注。但正如一位评论者所说:"照这个速度,明年我们可能就不需要 AI-aaS 公司了。"

下一步行动:

  1. 试试 API——在 OpenRouter 上用 Qwen3.8-27B 跑一个智能体编码任务,与当前模型对比。
  2. 下载 GGUF——从 unsloth 拿一份 Qwen3.8-27B 的 Q4/Q6_K 量化版,今天就在本地 GPU 上试试。
  3. 关注 Qwen Cloud——带 1M 上下文和内置工具的托管版 Qwen3.8-27B 即将推出,留意 Hugging Face 动态。

参考资料: Hugging Face 上的 Qwen3.8-27B · r/LocalLLaMA 发布帖 · OpenRouter 上的 Qwen3.8-27B · Qwen3.8-Max 博客 · r/ollama 基准测试 · Medium: 2026 年最重要的本地 AI 发布

posted on 2026-08-15 20:20  见路非道  阅读(4713)  评论(0)    收藏  举报