27B参数挑战更大模型:Qwen3.8-27B开源,千问新一代主力模型来了

近日,千问团队正式开放Qwen3.8-27B模型权重。这是一款拥有27B参数的稠密模型,但它带来的变化并不只是常规的性能升级。相比上一代Qwen3.6-27B,Qwen3.8-27B进一步强化了编程、复杂推理、智能体执行和长流程任务能力,同时原生加入图像与视频理解能力。

从官方公布的评测结果看,Qwen3.8-27B在多项编程和多模态智能体测试中取得明显提升,部分成绩已经超过参数规模更大的模型。它不仅能够回答问题、生成代码或理解图片,还开始具备理解软件界面、操作浏览器、处理移动端任务以及完成多步骤工作的能力。

对于Qwen系列而言,这款模型真正值得关注的地方,是它正在把语言、视觉、代码和智能体能力集中到一个27B规模的模型中。

01 Qwen3.8-27B带来的,不只是一次性能升级

Qwen3.8-27B是一款27B参数的稠密模型,原生支持文本、图像和视频理解。相比上一代Qwen3.6-27B,它进一步强化了编程、复杂推理、智能体执行和长流程任务能力。

过去衡量模型时,人们往往关注知识问答、数学推理和代码生成等单项能力。但在更复杂的任务中,模型不仅要给出答案,还需要理解任务背景、判断下一步行动,并根据环境反馈持续调整。

Qwen3.8-27B的升级方向正是如此。它尝试将语言、视觉、代码和任务执行能力整合到同一个模型中,从完成一次回答,进一步走向理解并处理一项完整任务。

概括来看,Qwen3.8-27B主要带来了以下能力:

  • 支持文本、图片和视频的统一理解;
  • 强化代码生成、代码仓库分析与软件工程能力;
  • 支持默认思考模式和非思考模式切换;
  • 可以调节推理深度,在速度与思考质量之间进行选择;
  • 面向浏览器、计算机和移动端等数字环境执行任务;
  • 支持长上下文和连续多步骤任务。

因此,Qwen3.8-27B更准确的定位并不是“一个回答能力更强的27B模型”,而是一款面向综合任务的原生多模态模型。

02 混合注意力架构,面向更长的任务过程

Qwen3.8-27B共包含64层,隐藏维度为5120。它延续了Qwen3.5建立的混合架构思路,在Gated DeltaNet线性注意力和标准Gated Attention之间进行组合。

其核心排列方式可以概括为:每三层Gated DeltaNet之后,加入一层标准Gated Attention。整套结构重复16次,组成模型的64层语言网络。

为什么要同时保留两种注意力机制?

标准注意力擅长分析上下文中不同信息之间的复杂关系,但随着输入长度增加,计算开销也会快速上升。线性注意力更适合高效处理长序列,但在捕捉某些远距离、复杂信息关系时,也可能存在局限。

Qwen3.8-27B通过混合排列,让多数层负责高效处理长序列,再定期使用标准注意力重新整合全局信息。这种设计试图在长上下文效率和复杂推理能力之间取得平衡。

模型原生支持262,144 tokens的上下文长度,并可通过扩展方案提升至约100万tokens。更长的上下文并不只是意味着能够输入更多文字,它还关系到模型能否连续理解大型代码仓库、研究资料、长视频内容、多轮任务记录和复杂文档。

Qwen3.8-27B还引入了多步多Token预测机制。传统自回归模型通常根据已有内容预测下一个Token,而多Token预测让模型在训练阶段同时学习后续多个Token之间的关系,为生成连续性和推理效率提供支持。

此外,模型默认启用思考模式。在复杂任务中,它可以先生成推理过程,再给出最终结果;面对信息提取、内容分类或简短回答等任务时,也可以关闭思考模式,直接输出答案。

03 编程能力提升,不再局限于生成一段代码

Qwen3.8-27B在编程方面的提升,并不只是能够生成更复杂的代码,而是开始具备处理完整软件工程任务的能力。

从官方评测结果看,Qwen3.8-27B相较上一代在Terminal Bench、SWE-bench Pro、DeepSWE和QwenSWEBench等测试中中普遍取得明显提升。这说明它在代码理解、问题定位、工具使用和连续执行方面更加稳定。

它所展现出的能力变化主要体现在三个方面:

首先,模型可以从理解单个函数进一步走向分析整个代码仓库;

其次,它能够在较长的任务过程中保持目标,而不是完成一步后就偏离方向;

最后,它可以根据终端、测试工具和运行环境返回信息修正方案。

在CoWorkBench、JobBench等通用智能体测试中,模型还需要处理研究、办公和专业任务。这些任务往往包含资料整理、信息分析、多步骤操作和结果交付,更考验模型能否持续规划并完成一条完整工作链路。

因此,Qwen3.8-27B的编程能力不应只理解为“代码写得更好”,而应该理解为:它正在从代码生成工具,进一步走向能够理解项目并参与工程任务的模型。

04 多模态能力开始进入真实数字环境

Qwen3.8-27B原生支持图像和视频理解,但它的多模态能力并不只是识别图片内容。

从OSWorld、WebArena和AndroidWorld等测试可以看出,模型正在尝试理解计算机桌面、浏览器网页和移动设备界面。面对这些任务时,模型不仅要识别按钮、文字和页面结构,还要判断当前状态,并选择正确的操作步骤。

RecreationBench、SWE-MM和Vision2Web则进一步考察模型能否根据视觉信息完成应用复现、软件修改和网页开发。这些任务要求模型将视觉理解与代码能力结合起来:先看懂界面,再分析页面结构,最后通过代码还原功能和交互。

在数学图像、科学图表、复杂文档和真实场景测试中,Qwen3.8-27B也表现出较完整的视觉推理能力。它需要理解图形之间的关系、提取文档信息,并将视觉内容转化为可以继续推理的语言信息。

这意味着Qwen3.8-27B的多模态能力正在从“看懂一张图片”走向“理解数字环境并采取行动”。当视觉、代码和智能体能力结合起来,模型才有可能完成浏览器操作、软件使用和多模态开发等更复杂的任务。

05 结语

Qwen3.8-27B最值得关注的地方,不只是“27B模型又刷新了多少分数”。

从混合注意力架构、262K原生上下文,到灵活思考控制、图像与视频理解,再到计算机操作和完整软件工程任务,千问正在把过去分散在不同模型中的能力集中到一个统一模型中。

这也体现出大模型竞争方向的变化。参数规模依然重要,但模型能否理解复杂环境、持续执行任务,并将文本、视觉、代码和工具能力结合起来,正在成为新的衡量标准。

Qwen3.8-27B已经不只是一个更强的对话模型,而是一款开始面向真实数字任务的综合型模型。

它真正需要回答的问题,也不再是“能不能生成内容”,而是“能不能理解任务,并把事情完整地做下去”。

06 模型下载

OpenCSG社区:

https://opencsg.com/models/Qwen/Qwen3.8-27B

Hugging Face社区:

https://huggingface.co/Qwen/Qwen3.8-27B

07 OpenCSG vs 魔搭:如何选择?

模型部署和推理使用在魔搭、OpenCSG 等模型社区中均可实现,但OpenCSG/CSGHub 的核心在于,它不只是让模型“跑起来”,而是进一步支持企业把模型、数据集、代码和应用等 AI 资产放到本地、内网或离线环境中统一管理。它解决的不只是“模型怎么部署、怎么调用”的问题,更是“模型进入企业后如何被安全管理、版本沉淀、权限控制和持续运营”的问题。

对于企业来说,CSGHub 可以帮助构建自己的私有模型资产中心,降低对外部平台的依赖;对于个人开发者来说,也可以用更系统的方式管理模型、实验项目和 AI 应用流程。相比更偏向模型发现、体验和使用入口的魔搭,CSGHub 更适合那些希望把 AI 能力真正沉淀下来,并长期维护、持续迭代的用户。

08 关于OpenCSG

OpenCSG 是全球领先的开源大模型社区平台,致力于打造开放、协同、可持续生态,AgenticOps是人工智能领域的一种AI原生方法论,由OpenCSG(开放传神)提出。AgenticOps是Agentic AI的最佳落地实践也是方法论。核心产品CSGHub提供模型、数据集、代码与 AI 应用的 一站式托管、协作与共享服务,具备业界领先的模型资产管理能力,支持多角色协同和高效复用。

posted @ 2026-08-30 21:48  OpenCSG  阅读(127)  评论(0)    收藏  举报