OpenCSG正式发布Agentic-30B-A3B,让AI从“会回答”走向“会执行”

近日,OpenCSG正式发布首款自研模型——OpenCSG Agentic-30B-A3B。

这是OpenCSG Agentic系列的首个版本,也是OpenCSG第一次将平台长期积累的Skills执行数据、工具调用轨迹和真实任务反馈,系统性地用于模型后训练。

过去几年,大模型最受关注的能力,是能否理解问题并给出高质量答案。如今,随着AI逐渐进入真实工作环境,衡量模型能力的标准正在发生变化。

企业真正需要的是一个能够理解任务、选择工具、构造参数、读取执行结果,并在出现错误后继续完成工作的智能体模型。

Agentic-30B-A3B是基于Qwen3-30B-A3B,围绕本地智能体、企业私有化部署以及个人终端上的Skills执行能力进行针对性后训练。

它想解决的问题非常明确:当AI真正进入用户的工作环境,它能不能不只告诉用户“应该怎么做”,而是调用正确的工具,把事情做完?

01 为什么OpenCSG要做一款Agent模型?

通用大模型已经具备较强的语言理解和内容生成能力,但会回答问题,并不等于能够完成任务。

例如,当用户要求AI整理会议行动项并安排后续日程时,模型不仅要识别任务、负责人和截止时间,还要选择正确的Skill、生成合法参数,并根据工具返回结果继续操作。

其中任何一个环节出现错误,都可能导致任务失败。模型可能知道“如何创建日程”,却无法正确调用日历工具;也可能因为日期、联系人或字段错误而执行失败,甚至在工具返回异常后仍然声称任务已经完成。

这正是Agentic-30B-A3B与普通对话模型的主要区别。

它不追求覆盖超大通用模型的全部知识,而是将有限的激活参数集中用于Agent任务中的关键行为,包括理解指令、选择Skill、生成参数、读取结果、处理错误和交付可核验的结果。

换句话说,Agentic-30B-A3B的目标不是成为一个“什么都知道”的模型,而是成为一个更懂得如何在真实系统中把事情做完的模型。

02 从理解交付:Agentic-30B-A3B如何完成任务

Agentic-30B-A3B已经能够处理一批常见的办公与生产力Skills。

在邮件场景中,它可以根据邮件内容完成分类,识别消息主题、紧急程度和后续处理方式;在待办和日历场景中,它能够提取任务信息、创建日程,并按照工具要求提交结构化参数;在会议场景中,它可以从会议记录中抽取行动项,识别负责人、任务内容和时间要求。

模型也可以承担项目启动计划、项目总结、市场研究和信息检索等工作。面对CRM数据导出过程中出现的错误,它已经表现出一定的恢复能力:不仅能够发现执行失败,还可以根据工具返回的信息调整参数并继续操作。

这些能力并不是彼此独立的功能,而是共同组成了一条完整的Agent任务执行链路,可以概括为五个连续环节。

第一步是理解指令

用户通常只会用自然语言描述想要完成的事情,而不会提供一套完整的执行流程。模型首先需要识别任务目标、涉及的对象、时间要求和限制条件,同时判断现有信息是否足够。

第二步是选择正确的Skill

现实工作环境中可能同时存在邮件、日历、待办、联系人、工单、知识库、CRM、库存和自动化任务等多种工具。模型需要根据任务目标判断应该调用哪个Skill,以及是否需要组合多个Skill完成任务。

第三步是生成合法参数

自然语言需求不能直接交给工具执行,模型还需要按照具体接口的要求,将用户意图转换为结构化参数。

不同Skill对于日期格式、联系人信息、必填字段和权限范围都有不同要求。模型不仅要正确填写参数,还要避免在关键信息缺失时擅自执行。只有自然语言被准确转换为工具可以识别的字段,任务才能真正进入执行阶段。

第四步是读取工具结果

Agent任务通常不会在一次工具调用后结束。模型需要理解工具返回的信息,并据此决定下一步行动。

前一次调用的结果会直接影响下一步决策。因此,模型不能把每次工具调用当作相互独立的问题,而要在整个执行过程中持续保持任务状态。

第五步是异常恢复与结果交付

真实工具可能返回字段缺失、权限不足、结果为空、联系人不明确或接口异常。模型需要识别失败发生在哪个环节,并根据错误信息调整参数、切换执行路径,或者向用户补充询问必要信息。

完成操作后,模型还需要交付可以核验的结果,明确说明任务是否成功、执行了哪些操作、哪些信息仍需确认,而不是在工具调用失败时仍然告诉用户“已经完成”。

Agentic-30B-A3B在CRM导出与错误恢复、日历事件创建、会议行动项抽取、项目计划和信息检索等任务中的表现,正是对这条完整执行链路的验证。

因此,这款模型的能力重点是让AI在获得工具之后,能够按照“理解指令—选择Skill—生成参数—读取结果—异常恢复与结果交付”的流程,更加稳定地把用户意图转化为实际操作。

03 30B总参数、3.3B激活参数,代表什么?

Agentic-30B-A3B采用混合专家架构,总参数量约为30.53B,但处理每个Token时只激活约3.3B参数。

模型内部包含128个专家,每个Token会根据任务内容选择其中8个专家参与计算。这样的设计让模型能够保留较大的整体容量,同时避免在每一次推理中调用全部参数。

对于用户来说,这些数字真正代表的并不是模型名称更复杂,而是模型在能力和部署成本之间做出了一种取舍。

OpenCSG没有选择“先训练一个超大通用模型,再将它压缩成较小版本”的路线,而是从低激活参数的MoE模型起步,将计算能力集中到工具选择、参数生成、结果读取和任务恢复等Agent行为上。

这种路线对于企业私有化部署尤其重要。

当前BF16版本已经能够在单张NVIDIA A800 80GB显卡上独立部署。实测结果显示,单请求固定生成时,聚合输出吞吐中位数超过每秒91个Token;并发提升到8个请求后,聚合输出吞吐接近每秒492个Token。

这里的重点并不是把它与其他模型做简单的速度排名,因为不同模型的硬件、精度和推理配置并不相同。真正值得关注的是:一个围绕Agent任务训练的30B级MoE模型,已经能够在单张高显存GPU上形成完整服务。

这意味着企业可以在自己的服务器和安全边界内运行模型,让邮件、知识库、工单、CRM和内部数据不必离开本地环境,同时减少部署超大模型所需的算力和运维成本。

对于需要数据可控、权限隔离和本地执行的企业而言,Agentic-30B-A3B提供了一条更加现实的智能体模型落地路径。

04 评测不只看“答对”,更要看“能否稳定做完”

为了验证模型是否真正具备执行能力,OpenCSG为Agentic-30B-A3B设计了一套面向真实工作的Agentic Eval。

这套评测让模型进入带有工具和任务目标的环境中,实际完成邮件处理、日历安排、工单路由、知识库检索、CRM导出、库存检查、费用核对、定时任务管理、投诉调查和供应链追查等工作。

整个评测包含119个智能体任务,每个任务独立运行3次,共形成357次试验。任务同时覆盖中文和非中文环境,并按照简单、中等和困难三个层级组织。

从整体结果看,Agentic-30B-A3B的首个版本仍然与GLM-5.2、DeepSeek-V4-Flash、GLM-5.1和Qwen3.7-Plus等更强模型存在明显差距,特别是在复杂跨系统任务、中文长链路任务和失败恢复方面。

但这个首版模型也展现出了较高的智能密度。

Agentic Eval平均分已经达到MiniMax-M2.5的约82.9%,而总参数规模约为后者的七分之一。在邮件分类、待办管理、CRM导出与错误恢复、日历事件创建、项目启动计划、项目总结、市场研究、信息检索和会议行动项抽取等任务中,它已经取得了较好的结果。

这些成绩验证了一条重要路线:围绕真实Skills、工具协议和执行轨迹进行后训练,可以让一个激活参数更小的模型获得可用的Agent执行能力。

比“赢了哪个模型”更有价值的是,这套评测清楚呈现了首个版本的能力边界。

它已经能够完成一批常用生产力Skills,但面对工单与知识库联动、费用核对、库存和利润分析、客户关系跟进、复杂投诉调查,以及多个自动化任务连续失败等情况时,仍需要进一步提升状态保持、实体对齐和任务恢复能力。

这种对能力边界的公开,比只展示几个最好的结果更有意义。因为企业在部署智能体时,真正需要知道的不只是模型可以做什么,也包括哪些任务仍然需要人工确认和更强模型参与。

05 真正重要的能力,来自持续运转的数据闭环

Agentic-30B-A3B背后更值得关注的,不只是模型架构,而是OpenCSG正在建立的数据、评测与训练闭环。

这款模型的后训练数据来自CSGHub 与 CSGClaw 在实际使用过程中沉淀的平台数据。当用户通过Skills完成工具调用和多步任务时,平台会识别其中的失败轨迹、低分问答和工具调用Bad Case。

这些数据不会被直接送入训练流程,而是需要经过脱敏、去重、格式校验、执行结果核验和质量标注,最终被整理成可复现的工具调用轨迹、偏好数据和结果反馈。

这意味着Agentic系列不是一次性训练完成的静态模型。随着CSGHub、CSGClaw和更多Skills进入实际场景,平台会不断产生新的任务、新的失败案例和新的改进信号。

模型在平台中使用,平台为模型积累数据;数据经过治理和验证后进入训练;更新后的模型再回到平台,处理更多真实任务。

当这个循环持续运转,OpenCSG拥有的就不只是一款模型,而是一套能够从真实执行结果中不断学习的Agentic模型进化机制。

06 从平台积累走向模型能力,Agentic-30B-A3B迈出关键一步

Agentic-30B-A3B仍然只是OpenCSG Agentic系列的1.0版本。

它目前更擅长邮件、待办、日历、会议行动项、项目计划、结构化总结和部分CRM任务。

后续版本将重点加强工单与知识库联动、费用核对、库存和利润分析、客户关系跟进,以及多个自动化任务连续失败后的恢复能力。同时,Agentic系列还会继续扩大Skills覆盖范围,提高长任务中的状态保持、参数正确率和重试效率。

Agentic-30B-A3B的意义更在于它进一步连接了OpenCSG长期积累的平台数据、Agent执行场景与模型训练能力。

CSGHub负责沉淀和管理模型、数据与工具资产,CSGClaw承载多智能体协作和Skills执行。平台运行过程中产生的工具调用轨迹、失败案例和结果反馈,经过数据治理与质量验证后,可以继续用于Agentic系列的训练和优化。

由此,OpenCSG正在进一步完善一条从“管理模型与数据资产”,到“运行Agent与Skills”,再到“利用真实执行数据持续优化模型”的Agentic AI技术链路。

未来的智能体竞争,不只取决于模型能回答多少问题,更取决于它能否理解工作环境、正确使用工具、处理执行错误,并在企业自己的安全边界内稳定完成任务。

Agentic-30B-A3B不是OpenCSG模型探索的起点,但它标志着OpenCSG在Agent模型方向进入了一个新的阶段:让平台中的真实执行经验,逐步转化为模型自身的能力。

07 模型下载

OpenCSG 社区:

opencsg.com/models/Open

Hugging Face社区:

huggingface.co/opencsg/

魔搭社区:

modelscope.cn/models/op

08 关于OpenCSG

OpenCSG是全球领先的开源大模型社区平台,致力于打造开放、协同、可持续生态,AgenticOps是人工智能领域的一种AI原生方法论,由OpenCSG(开放传神)提出。AgenticOps是Agentic AI的最佳落地实践也是方法论。核心产品CSGHub提供模型、数据集、代码与 AI 应用的 一站式托管、协作与共享服务,具备业界领先的模型资产管理能力,支持多角色协同和高效复用。

posted @ 2026-08-31 10:43  OpenCSG  阅读(21)  评论(0)    收藏  举报