Qwen3.8-27B(2026):Qwen 新 27B 视觉语言模型完整指南
Qwen3.8-27B(2026):Qwen 新 27B 视觉语言模型完整指南
核心要点 (TL;DR)
- Qwen3.8-27B 是阿里 Qwen 团队新推出的 270 亿参数稠密模型——原生视觉语言模型,支持图像和视频理解,具备灵活的思考控制,采用 Apache 2.0 开源权重。
- 最大看点是本地模型尺寸下的智能体性能:Qwen3.8-27B 的 DeepSWE 1.1 达到 42.2(前代 Qwen3.6-27B 仅 13.3),Terminal Bench 2.1 达到 73.0,并在 SWE-bench Pro、QwenSWEBench、LiveCodeBench v6、OSWorld、AndroidWorld 上超越 Claude Opus 4.6 Max。
- Qwen3.8-27B 提供原生 262,144 token(262K)上下文窗口(可通过 YaRN 扩展到 1M)、28B BF16 权重、默认开启的思考模式,以及 xhigh/medium/low 三档
reasoning_effort。 - OpenRouter 上 Qwen3.8-27B 的定价为每百万输入 token $0.45、输出 $3.20——Reddit 用户已在 RTX 3090、双 RTX 5080 和 16GB 显存显卡上本地运行它。
目录
- 什么是 Qwen3.8-27B?
- Qwen3.8-27B 架构与规格
- Qwen3.8-27B 基准测试:智能体的跃升
- Qwen3.8-27B 定价与 API 访问
- 本地运行 Qwen3.8-27B
- Qwen3.8-27B 与竞品对比
- 常见问题解答
什么是 Qwen3.8-27B?
Qwen3.8-27B 是 Qwen3.8 家族的最新成员——官方模型卡称之为"Qwen 开源模型家族迄今最强的一代"。在 Qwen3.5 的架构基础上,Qwen3.8-27B 在编码、专业工作、研究和长程智能体任务上带来全面大幅提升,同时保持紧凑、易于部署的稠密形态。
关键词是"稠密"。与 2026 年 8 月 8 日权重发布时抢占头条的巨型 Qwen3.8-Max(2.4T 参数 MoE)不同,Qwen3.8-27B 是为个人真正拥有的硬件而设计的 270 亿参数稠密模型。r/LocalLLaMA 发布帖称 Qwen3.8-27B 是"备受喜爱的 Qwen 模型的焕新之作,带来无与伦比的智能密度"。
Qwen3.8-27B 还是原生视觉语言模型:开箱即可理解图像和视频——从 STEM 图表、文档到小时级视频。它是该级别首个具备完整多模态输入和社区自 GPT-OSS 时代就渴望的灵活思考控制的 Qwen 模型。一位 Reddit 用户写道:"终于来了!自 GPT-OSS 以来我一直在等一个原生支持 low/medium 推理的本地模型!规划用 high,执行和探索用 low!"
专业提示
Qwen3.8-27B 托管在 Hugging Face 的
Qwen/Qwen3.8-27B(9.47K 点赞、月下载约 9.2 万、319 个量化变体)和 ModelScope 上。Qwen Cloud 托管版即将推出,默认提供 1M 上下文和内置工具。
Qwen3.8-27B 架构与规格
看看 Qwen3.8-27B 的机箱内部:
| 规格 | Qwen3.8-27B |
|---|---|
| 模型类型 | 带视觉编码器的因果 LM |
| 参数 | 27B(BF16,磁盘约 28B) |
| 隐藏维度 | 5,120 |
| 层数 | 64 |
| 隐藏布局 | 16 × (3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN)) |
| 线性注意力头 | 48 V / 16 QK(Gated DeltaNet),维度 128 |
| 注意力头 | 24 Q / 4 KV(Gated Attention),维度 256 |
| FFN 中间维度 | 17,408 |
| 多 token 预测 | 多步训练 |
| 原生上下文 | 262,144 token |
| 可扩展上下文 | 最大 1,000,000 token(YaRN) |
| 许可证 | Apache 2.0 |
| 输入 | 文本、图像、视频 |
| 输出 | 文本 |
混合架构结合了 Gated DeltaNet(用于低成本长上下文处理的线性注意力)与 Gated Attention 层,并通过多 token 预测(MTP)加速解码。Qwen3.8-27B 默认开启思考模式,reasoning_effort 可在 xhigh(默认)/medium/low 间调节;preserve_thinking 跨轮次保留推理上下文,模型卡称这能"改善 KV 缓存利用率,优化思考与非思考两种模式的推理效率"。
对于超过 262K 的超长任务,Qwen3.8-27B 推荐使用 YaRN RoPE 缩放(factor 设为 4.0;若典型上下文约 524K 则建议 2.0),vLLM、SGLang、TokenSpeed 均支持。
✅ 最佳实践
用 Qwen3.8-27B 跑智能体任务时,请分配充足的输出长度:推理内容最大 262,144 token,最终回答 131,072 token。降低
reasoning_effort并不总能缩短总耗时——分析不足会导致更多失败和重试。
Qwen3.8-27B 基准测试:智能体的跃升
Qwen3.8-27B 之所以让发布帖出现"DeepSWE 大跃升——新的本地编码冠军诞生?"这样的评论,是因为它相对前代的提升幅度。以下是官方文本基准(注明的使用 Claude Code harness):
| 基准 | Qwen3.8-27B | Qwen3.6-27B | Qwen3.7-Plus | Opus 4.6 Max |
|---|---|---|---|---|
| Terminal Bench 2.1 (Terminus) | 73.0 | 63.4 | 64.0 | 78.2 |
| SWE-bench Pro | 61.7 | 53.5 | 57.6 | 53.4 |
| NL2Repo-Bench | 42.3 | 36.2 | 41.1 | 47.6 |
| DeepSWE 1.1 | 42.2 | 13.3 | 14.2 | – |
| QwenSWEBench | 79.0 | 49.3 | 59.2 | 63.8 |
| CoWorkBench | 70.7 | 61.0 | 65.1 | 68.2 |
| JobBench | 33.4 | 21.8 | 27.6 | – |
| Agents' Last Exam(分数) | 42.9 | 27.3 | 33.6 | – |
| IFBench | 79.5 | 69.1 | 79.1 | 62.5 |
| GPQA Diamond | 89.2 | 87.8 | 90.3 | 91.3 |
| HLE | 30.8 | 24.0 | 34.7 | 40.0 |
| LiveCodeBench v6 | 90.3 | 83.9 | 89.6 | 88.8 |
DeepSWE 数字最为突出:Qwen3.8-27B 把前代成绩翻了三倍多(13.3 → 42.2),并在 SWE-bench Pro、QwenSWEBench、CoWorkBench、LiveCodeBench v6 上超越 Opus 4.6 Max——尽管体量只有后者的零头。独立榜单已经与模型卡一致:datacurve 的 DeepSWE 榜单将 Qwen3.8-27B 列为 42.2,ScaleAI 的 SWE-bench Pro 为 61.7。
Qwen3.8-27B 真正与其它本地模型拉开差距的是多模态智能体:
| VL 基准 | Qwen3.8-27B | Qwen3.6-27B | Opus 4.6 Max |
|---|---|---|---|
| OSWorld-Verified(电脑操作) | 84.3 | 63.9 | 72.7 |
| WebArena-Verified(浏览器操作) | 64.8 | 48.8 | – |
| AndroidWorld(移动端操作) | 81.9 | 70.3 | 62.0 |
| RecreationBench | 47.1 | 29.8 | – |
| ClawEval-MM(Pass@3) | 57.4 | 42.6 | 52.5 |
| SWE-MM | 38.6 | 25.7 | 27.1 |
| Vision2Web | 62.9 | 45.0 | – |
| MathVision(含 CI) | 94.6 | 85.1 | 65.5 |
| CharXiv(含 CI) | 90.2 | 78.4 | 85.9 |
| OmniDocBench 1.5 | 91.1 | 89.4 | 86.6 |
| RealWorldQA | 85.9 | 84.1 | 73.9 |
| ERQA | 65.5 | 62.5 | 40.8 |
Qwen3.8-27B 在 OSWorld、AndroidWorld、SWE-MM、MathVision、CharXiv、OmniDocBench、RealWorldQA、ERQA 上击败 Opus 4.6 Max——电脑操作、移动端操作、文档智能、具身感知,全部装进一个消费级显卡能跑动的模型。
Qwen3.8-27B 定价与 API 访问
Qwen3.8-27B 已在 OpenRouter 上线,模型 ID 为 qwen/qwen3.8-27b:
| 定价项 | Qwen3.8-27B |
|---|---|
| 输入 / 100 万 token | $0.45(加权均价 $0.4499) |
| 输出 / 100 万 token | $3.20(加权均价 $3.199) |
| 上下文窗口 | 262K |
| OpenRouter 上线日期 | 2026 年 8 月 14 日 |
| 供应商 | AkashML(单一) |
| 吞吐 | 18 token/s(P50) |
| 延迟 | 1.50s(P50) |
| 3 天可用率 | 91.97% |
| 3 天可用性 | 79.65% |
| 工具调用错误率 | 1.06% |
| 结构化输出错误率 | 17.52% |
早期生产流量说明了一切:Qwen3.8-27B 在 OpenRouter 上的头部应用是 Kilo Code(798 万 token)、Zed Editor(702 万)、pi(482 万)、Hermes Agent(450 万)——全是智能体编码工具。以 $0.45/$3.20 的价格,Qwen3.8-27B 比多数前沿 API 便宜一个数量级,同时支持工具调用、结构化输出、图像和视频。
API 用法遵循标准 Qwen3.8 模式:思考模式默认开启(enable_thinking: True),reasoning_effort 支持 xhigh/medium/low,preserve_thinking: True 为默认。推荐采样参数:思考模式温度 1.0 / top_p 0.95;指令模式 0.7 / 0.8 加 presence_penalty 1.5。
⚠️ 注意
OpenRouter 目前通过单一供应商(AkashML)路由 Qwen3.8-27B,3 天可用性仅 79.65%,结构化输出错误率 17.52%。生产环境追求可靠性,建议等 Qwen Cloud 托管版或自托管。
本地运行 Qwen3.8-27B
这是 Qwen3.8-27B 最闪光的领域——发布帖的头条评论是"RTX 3090 粉丝:出动"。社区实测汇总:
- 双 RTX 5080(共 32GB): 用户 n0head_r 用 unsloth 的
Qwen38-27B-Q6_KGGUF,172K 上下文(kv q8_0)、MTP + 张量并行,在 60–70K 上下文前稳定跑出 约 100 token/s(100K 时约 95 tps)。一个 15 万 token 的智能体循环——写代码、构建、验证、修 bug——工具调用零失败。 - RTX 4080 16GB: r/ollama 上 Qwen3.8-27B 以 12.6GB 显存 / 5.6GB 内存、8K 上下文运行,完成一个双工具智能体任务(数学评估 + 实时加密货币价格,均正确)约 18 秒。
- RTX 3090 24GB: 预期是 Q4/Q6 量化的甜点;unsloth 的 Q8_0 也有运行报告。
Qwen3.8-27B 的部署选项:
- Hugging Face Transformers —
AutoModelForMultimodalLM.from_pretrained("Qwen/Qwen3.8-27B") - vLLM / SGLang / TokenSpeed —
vllm serve "Qwen/Qwen3.8-27B"提供 OpenAI 兼容 API - llama.cpp / Ollama / LM Studio — 通过 319 个社区量化版本(Q4_K_M、Q6_K、Q8_0 等)
- Docker Model Runner —
docker model run hf.co/Qwen/Qwen3.8-27B
✅ 最佳实践
单卡 16–24GB 显存:用 unsloth 的 Qwen3.8-27B Q4 或 Q6 GGUF;32GB 以上显存或双卡:Q8_0 + 张量并行 + MTP 的速度/质量平衡最佳。
Qwen3.8-27B 与竞品对比
Qwen3.8-27B 和它被拿来比较的模型相比如何?
| 模型 | 规模 | DeepSWE | Terminal Bench | 本地友好 | 视觉 |
|---|---|---|---|---|---|
| Qwen3.8-27B | 27B 稠密 | 42.2 | 73.0 | ✅(16GB+ 显存) | ✅ 图像+视频 |
| DeepSeek V4 Flash 0731 | 284B A13B | 54.4 | 82.7 | ⚠️(体积大) | ❌ |
| Qwen3.6-27B | 27B 稠密 | 13.3 | 63.4 | ✅ | ✅ |
| Opus 4.6 Max | 前沿 | – | 78.2 | ❌ | ✅ |
| Minimax M2.7 | MoE | – | – | ⚠️ | ❌ |
Reddit 的评价:"27B 参数下,Qwen3.8-27B 已经非常接近 284B A13B 的 DeepSeek V4 Flash 0731!"也有人表示"看起来比 900B+ 的 MoE 还好",并讨论 Qwen3.8-27B 能否在智能体编码上胜过 Minimax M2.7。目前的结论:Qwen3.8-27B 以参数量的零头提供了接近前沿的智能体与多模态性能,是 27B 级别迄今最强的本地编码选手。
常见问题解答
Q: Qwen3.8-27B 是什么?
A: Qwen3.8-27B 是阿里 Qwen 于 2026 年 8 月以 Apache 2.0 开源权重发布的 270 亿参数稠密视觉语言模型。它理解图像和视频,支持灵活的思考控制,面向编码、专业工作、研究和长程智能体任务。
Q: Qwen3.8-27B 多少钱?
A: OpenRouter 上 Qwen3.8-27B 每百万输入 token $0.45、每百万输出 token $3.20。Apache 2.0 许可下自托管免费,带 1M 上下文的 Qwen Cloud 托管版即将推出。
Q: Qwen3.8-27B 的上下文长度是多少?
A: Qwen3.8-27B 原生支持 262,144 token(262K),可通过 vLLM、SGLang 或 TokenSpeed 的 YaRN RoPE 缩放扩展到 1,000,000 token。
Q: Qwen3.8-27B 支持图像和视频吗?
A: 支持。Qwen3.8-27B 是原生视觉语言模型,支持从 STEM 图表、文档到小时级视频的图像与视频输入,并具备电脑操作(OSWorld-Verified 84.3)和浏览器操作(WebArena-Verified 64.8)能力。
Q: 可以本地运行 Qwen3.8-27B 吗?
A: 可以。Qwen3.8-27B 能在消费级显卡上运行:已有 RTX 3090 24GB、双 RTX 5080(Q6_K 约 100 tps、172K 上下文)、RTX 4080 16GB(Ollama 下 12.6GB 显存)等实测。共有 319 个量化版本可用。
Q: Qwen3.8-27B 支持工具调用和结构化输出吗?
A: 支持。Qwen3.8-27B 支持工具调用、JSON 输出和 OpenAI 兼容的 Chat Completions API,Kilo Code、Zed、pi、Hermes Agent 已通过 OpenRouter 在生产中使用它。
Q: Qwen3.8-27B 是开源的吗?
A: Qwen3.8-27B 以 Apache 2.0 许可证发布——完全开源权重、允许商用。可在 Hugging Face(Qwen/Qwen3.8-27B)和 ModelScope 获取。
Q: Qwen3.8-27B 什么时候发布的?
A: Qwen3.8-27B 于 2026 年 8 月 14 日发布(Hugging Face 和 ModelScope 上线开源权重,同日登上 OpenRouter),此前的发布消息与 Qwen3.8-Max 一同宣布。
Q: Qwen3.8-27B 相比 Qwen3.6-27B 提升多少?
A: Qwen3.8-27B 将 DeepSWE 提升约 3 倍(13.3 → 42.2)、Terminal Bench 提升约 10 分(63.4 → 73.0)、SWE-bench Pro +8.2、OSWorld +20(63.9 → 84.3)——整整一代的进步。
总结与行动建议
Qwen3.8-27B 是本地 AI 社区期待已久的模型:接近前沿的智能体性能——DeepSWE 42.2、SWE-bench Pro 61.7、OSWorld 84.3、LiveCodeBench v6 90.3——浓缩进单块 24GB 显卡即可运行的 27B 稠密包,多项基准超越 Opus 4.6 Max,OpenRouter 上每百万 token 仅 $0.45/$3.20。它还有视觉(图像+视频)、灵活思考控制、262K 原生上下文和 Apache 2.0 许可。
注意点:基准数据为 Qwen 官方自测,尚待独立验证;OpenRouter 单一 AkashML 供应商可用性 79.65%;结构化输出可靠性(17.52% 错误率)需要关注。但正如一位评论者所说:"照这个速度,明年我们可能就不需要 AI-aaS 公司了。"
下一步行动:
- 试试 API——在 OpenRouter 上用 Qwen3.8-27B 跑一个智能体编码任务,与当前模型对比。
- 下载 GGUF——从 unsloth 拿一份 Qwen3.8-27B 的 Q4/Q6_K 量化版,今天就在本地 GPU 上试试。
- 关注 Qwen Cloud——带 1M 上下文和内置工具的托管版 Qwen3.8-27B 即将推出,留意 Hugging Face 动态。
参考资料: Hugging Face 上的 Qwen3.8-27B · r/LocalLLaMA 发布帖 · OpenRouter 上的 Qwen3.8-27B · Qwen3.8-Max 博客 · r/ollama 基准测试 · Medium: 2026 年最重要的本地 AI 发布
浙公网安备 33010602011771号