DeepSeek 发布 V4‑Pro 与首个 Harness:模型之后,Agent 基础设施成为下一战场

DeepSeek‑V4‑Pro‑0813 正式发布,第一代 DeepSeek Harness 对外开放,API 服务同步调整价格策略。单独看,每一项都能找到熟悉的行业叙事;连在一起看,指向却很清楚:DeepSeek 正在把模型、Agent Runtime 与规模化服务放进同一套技术版图。

V4‑Pro 负责提供更强的推理、编程和工具使用能力;Harness 负责把模型接入工具、会话、文件系统、沙箱与执行循环;插件机制则让这些部分可以按场景替换和重组。价格调整落在最现实的一层:当 Agent 开始持续运行,模型厂商必须考虑计算资源如何调度,企业也要重新理解一次任务的真实成本。

这次发布值得关注的,正是 DeepSeek 对 Agent Runtime、插件体系和动态组合能力的进一步探索。

01 DeepSeek‑V4‑Pro 正式发布:Agent 与 Coding 能力表现亮眼

V4‑Pro‑0813 是 V4 系列的高能力版本。它采用 MoE 架构,总参数量1.6T,每个 Token 激活约49B参数,上下文长度达到100 万 Token。MoE 的意义在于保留庞大的专家容量,同时让每个 Token 只调用其中一部分参数,避免推理成本随着总参数量同步增长。V4‑Pro 因而能够把更多容量用于知识密度高、决策链长的复杂任务。

百万上下文并不只是把窗口数字做大。代码 Agent 需要同时容纳仓库结构、多个源文件、依赖关系、终端输出、测试日志和历次工具返回;任务一旦拉长,KV Cache 与逐 Token 推理开销都会迅速增加。V4 使用由 Compressed Sparse Attention(CSA)和 Heavily Compressed Attention(HCA)组成的混合注意力结构:CSA 从压缩后的上下文中筛选重要信息,同时保留局部窗口;HCA 对压缩程度更高的全局信息做密集关注。两类注意力交替工作,兼顾局部细节和长距离联系。

在 100 万 Token 场景下,V4‑Pro 的单 Token 推理 FLOPs 约为 V3.2 的 27%,KV Cache 约为后者的 10%。这组数据比“支持百万上下文”更能说明问题。Agent 能否持续读写长轨迹,受制于显存、延迟和服务成本。上下文只有放得下并且跑得动,才有机会用于大型仓库分析、长文档研究和多阶段工具执行。

模型内部还有两项容易被 Benchmark 遮住的变化。mHC(Manifold‑Constrained Hyper‑Connections)用于改善深层网络中的信号传递稳定性,避免残差路径在大规模训练中失控;Muon 优化器则承担 1.6T MoE 模型的收敛效率与训练稳定性。V4 系列在超过 32T Token 上完成预训练,后训练先分别培养代码、推理等领域能力,再通过 on‑policy distillation 合并到统一模型中。最终发布版本对 MoE 专家参数采用 FP4、其余主要参数采用 FP8,也为大模型部署压低了存储与计算负担。

再看 Agent 成绩,不同任务类型同时都有变强。Terminal Bench 2.1 的87.9说明模型在终端环境中的操作能力稳定;DeepSWE 从 Preview 的 12.8 提升到62.7,变化发生在真实代码仓库理解、修改和验证这一整段链路;DSBench‑Hard 从 31.1 提升到67.2,Toolathlon‑Verified 达到74.1,也说明复杂数据任务和多工具协作没有成为明显短板。

更强的模型提供了能力基础,而这些能力如何连接工具、环境和任务流程,则需要模型之外的运行体系。

V4‑Pro 正式发布后,API 价格也即将上调。

与目前执行的价格相比,新的非高峰价和高峰价均有上涨。按人民币/百万 Token 计算,Flash 的缓存命中输入、缓存未命中输入和输出价格,当前为 0.02 元、1 元和 2 元,新非高峰价为 0.05 元、1.5 元和 4.5 元,新高峰价为 0.10 元、3 元和 9 元。Pro 当前为 0.025 元、3 元和 6 元,新非高峰价为0.15 元、4.5 元和 13.5 元,新高峰价为0.30 元、9 元和 27 元。

也就是说,新非高峰价本身已经高于当前价格,高峰价又在此基础上翻倍。与当前价格直接比较,新高峰价中 Flash 的三项费用提高到3—5倍,Pro提高到3—12倍,V4 API的实际使用成本将明显上升。

02 DeepSeek 发布首个 Harness:Everything is Plugin

DeepSeek Harness 是 DeepSeek 推出的第一代 Agent Harness。它把一次 Agent 运行需要的关键部分组织到一起:模型适配器负责连接不同模型,工具注册表提供可调用能力,会话日志保存运行轨迹,系统提示词定义行为边界,Agent Loop 驱动推理与执行,文件系统和沙箱则承接真实操作。

这套架构最鲜明的设计是Everything is Plugin。模型适配器是插件,工具注册表是插件,会话日志是插件,Agent Loop 同样是插件。Web 界面、一次性 Headless 运行器以及面向具体业务的自定义形态,都由同一棵插件树组合出来。系统没有一块不可替换的“特权内核”,具体能力通过共享 Context 注册服务、事件和副作用。

插件树并不是把一组模块简单堆在一起。Profile 决定一次启动采用哪套具名装配,Bundle 提供可以复用的能力组合,Patch 则允许在启动时覆盖局部配置。团队可以从基础运行包开始,加入模型、工具、持久化、沙箱审批、凭证和遥测,再根据 Web、Headless 或内部工作流的需求继续叠加。更换模型或工具集时,不必复制整套 Agent;调整对应配置和插件即可。

插件的退出机制同样重要。一个插件加载时可能注册工具、订阅事件、修改 Context,甚至创建外部资源。如果卸载只删除插件名称,遗留的监听器、状态和连接会让系统越来越难以预测。

Harness 依赖 Cordis 跟踪这些注册与副作用,在插件退出时按生命周期撤销相关变化。可替换因此不再停留在目录结构上,而成为运行期可执行的能力。

Profile、Bundle、Patch 和可撤销注册共同构成了一套可持续扩展的 Agent 运行体系。开发者可以针对任务组装 Harness,产品团队也能维护多种运行形态,同时保留一致的底层机制。

当 Agent 的各项能力都变成插件,新的问题就出现了:这些组件如何在运行过程中安全加入、退出和重新组合?

03 从 Plugin 到自演化 Agent:DeepSeek 探索动态组合的软件范式

未来的 Agent 不会永远使用一套固定能力。它可能根据任务加载新工具、替换模型、调整执行环境,甚至生成新的能力组件。要做到这一点,插件数量多还不够;运行体系必须解决两个问题:组件离开后能否恢复现场,组件进入新环境后能否找到所需依赖。

Temporal Composability:组件离开后,系统能够恢复

插件进入系统后通常会留下痕迹。一个代码审查组件可能注册若干工具,写入系统提示词,订阅文件变更事件,创建临时目录,再建立与外部服务的连接。任务结束后,如果这些动作无法逐项撤销,下一次运行就可能读到残留状态,或者重复注册同名能力。

Temporal Composability 处理的是组件跨时间变化的问题。它引入Revertible Effects:每次 Context Transformation 都携带对应的 inverse,Runtime 记录组件产生的变化及其恢复操作。

注册工具对应注销工具,添加监听器对应移除监听器,打开资源对应关闭资源。组件退出时,Runtime 沿着已记录的生命周期恢复上下文,不要求每个上层调用者记住全部清理细节。

这套机制让热替换具备实际意义。模型适配器需要升级时,可以先卸载旧版本,再载入新版本;某个临时工具只在特定任务阶段存在,阶段结束便能完整退出;任务失败后,运行环境也可以回到可继续使用的状态。通俗地说:组件可以来,也可以干净地离开。

Spatial Composability:组件能够根据环境自动组合

组件能卸载,还不等于能够自由组合。传统依赖往往直接写死对象或调用路径:某个工具依赖指定数据库客户端,某个 Agent Loop 绑定固定模型服务。一旦运行环境变化,开发者就要手工改线、重启,甚至复制一套实现。

Spatial Composability 换了一种关系。组件声明自己需要什么能力,例如“可写文件系统”“具备审批能力的沙箱”“满足某种接口的模型服务”,而不是把依赖锁定在一个具体对象上。这类需求被描述为 Reactive Coeffects。共享 Context 发生变化时,Runtime 重新解析依赖,并根据结果决定组件激活、停用还是保持当前状态。

时间可组合性管理“修改”,空间可组合性管理“依赖”。前者保证变更可逆,后者保证关系可重算。两者放进同一种 Context 类型后,动态加载、完整卸载和依赖重组才形成闭环。

Cordis:让动态组合真正运行起来

Cordis 将这套机制落到了运行框架中。

  • Declarative Component Loader 负责读取配置条目、协调目标配置与当前状态,并支持热模块替换;
  • First‑class Context 承载服务、状态以及组件之间的依赖关系;
  • Effect Tracking 记录副作用与恢复操作;
  • Coeffect Resolution 则在 Context 变化时重新求解依赖,推动组件激活、停用或重组。

这四部分解决的是同一个工程问题:Agent 的能力结构如何在运行时变化,同时保持可控。声明式装载器告诉系统“希望有哪些组件”,Context 告诉组件“当前拥有哪些能力”,Effects 负责安全修改,Coeffects 负责响应环境。上层只需要表达配置和需求,底层完成生命周期管理。

对 Agent 来说,这意味着能力扩展可以进一步摆脱固定流程。今天的 Agent 调用预先配置好的工具;下一阶段,它可以依据任务动态装载工具包、切换执行环境、替换模型策略,并在任务完成后清理这些临时能力。再向前一步,Agent 还可能根据运行反馈生成或调整自己的组件结构。所谓 Self‑Evolving Agent,关键不在“自动写出一个新工具”的演示,而在新能力能否被验证、加载、约束、撤销并持续管理。Harness 与 Cordis 提供的,正是这条路径所需的运行基础。

04 OpenCSG:连接模型、Runtime 与企业 AI 基础设施

DeepSeek 展示了模型和 Runtime 的发展方向。企业要让 Agent 进入研发、客服、运营和数据分析等核心流程,还要管理模型、数据、Skill、工具、工作流和每一次运行记录。能力越动态,资产来源、访问权限、版本关系和效果评估就越不能分散处理。

OpenCSG 正在围绕这条链路建设企业 AI 基础设施。CSGHub用于统一管理模型、数据集、Prompt、Skill、MCP 与 Agent 组件,让团队知道能力来自哪里、由谁维护、当前使用哪个版本。CSGLite 提供模型下载、本地运行和效果验证入口,便于企业在接入业务前完成小范围测试,也让敏感场景保留本地部署选择。

进入执行层,CSGClaw面向由 Manager、Worker、Skill、Tool 与 Sandbox 组成的多 Agent 协作。Manager 负责拆分和调度任务,Worker 承接具体执行,Skill 与 Tool 提供能力,Sandbox 控制代码和命令的运行边界。它解决的是复杂任务如何分工、协作和受控运行,并非对某一套 Harness 的简单映射。

再向上,AgenticHub 以 Enterprise Agent Control Plane 的方式统一管理 Agent、Workflow、Knowledge、Skill、Tool、MCP 及其生命周期,把分散的能力转成可配置、可复用的企业资产。

AgenticOps则继续覆盖上线后的观察、评估、优化和治理:任务是否完成、在哪一步失败、用了哪些模型和工具、成本是否符合预期,都需要留下可分析的运行依据。

这些产品关注的是企业落地的连续过程:先管理 AI 资产,再验证模型与能力,然后组织 Agent 协作,最后对运行过程进行治理。动态组合为 Agent 打开了更大的能力空间,企业基础设施则要为这种变化补上权限、安全、版本、成本和责任边界。

这也是企业部署 Agent 时容易被低估的一点:能力不是上线一次便固定下来。模型会升级,Prompt 和 Skill 会调整,数据权限会变化,MCP 服务与外部工具也可能临时下线。缺少统一控制面后,一次局部更新就可能影响多条业务流程。完整基础设施需要把“谁在什么时间,用哪个版本的能力,处理了哪些数据,产生了什么结果”记录清楚,才能在效率提升之外守住审计和治理要求。这样,业务创新与平台治理才能同步推进。

05 结语

V4‑Pro 为 Coding Agent、Tool Agent 和复杂任务系统提供了更强的模型基础;DeepSeek Harness 把模型、工具、会话、循环与执行环境组织成可替换的插件树;围绕可逆副作用、反应式依赖和统一 Context 的设计,又让运行时动态组合成为可能。

对企业而言,下一步并非简单增加几个 Agent。模型、Runtime、AI 资产与业务流程需要被连接到同一条可管理的链路中。

模型决定 Agent 能力的上限,而 Runtime、插件体系和企业基础设施,决定这些能力能否真正进入业务。

06

OpenCSG 社区:

opencsg.com/models/deep

Hugging Face 社区:

huggingface.co/deepseek

Deepseek Harness开源链接:

github.com/deepseek-ai/

07 OpenCSG vs 魔搭:如何选择?

模型部署和推理使用在魔搭、OpenCSG 等模型社区中均可实现,但OpenCSG/CSGHub 的核心在于,它不只是让模型“跑起来”,而是进一步支持企业把模型、数据集、代码和应用等 AI 资产放到本地、内网或离线环境中统一管理。它解决的不只是“模型怎么部署、怎么调用”的问题,更是“模型进入企业后如何被安全管理、版本沉淀、权限控制和持续运营”的问题。

对于企业来说,CSGHub 可以帮助构建自己的私有模型资产中心,降低对外部平台的依赖;对于个人开发者来说,也可以用更系统的方式管理模型、实验项目和 AI 应用流程。相比更偏向模型发现、体验和使用入口的魔搭,CSGHub 更适合那些希望把 AI 能力真正沉淀下来,并长期维护、持续迭代的用户。

08 关于OpenCSG

OpenCSG 是全球领先的开源大模型社区平台,致力于打造开放、协同、可持续生态,AgenticOps是人工智能领域的一种AI原生方法论,由OpenCSG(开放传神)提出。AgenticOps是Agentic AI的最佳落地实践也是方法论。核心产品CSGHub提供模型、数据集、代码与 AI 应用的 一站式托管、协作与共享服务,具备业界领先的模型资产管理能力,支持多角色协同和高效复用。

posted @ 2026-08-30 21:27  OpenCSG  阅读(38)  评论(0)    收藏  举报