🐳DeepSeek V4 Pro 正式版来了,但真正值得关注的,可能是它身后的 Harness

当大模型从“回答问题”走向“完成任务”,决定能力上限的,已经不只是模型本身。

DeepSeek V4 Pro 正式版与 DeepSeek Harness 同时出现,释放了一个非常清晰的信号:下一阶段的竞争,将从单纯比拼模型参数和榜单成绩,转向比拼一整套 Agent 系统的执行能力。

最近,DeepSeek 正式发布了 DeepSeek V4 Pro 正式版

按照官方介绍,新模型已经同步上线 APP、网页端和 API。普通用户可以在 APP 或网页端选择“专家模式”体验,开发者则可以继续通过原有 API 模型名调用。

如果只看发布信息,这似乎又是一次旗舰模型升级:推理更强、代码更强、Agent 能力更强。

但这一次,有一个细节格外值得注意。

DeepSeek 在官方说明中特别标注:公开基准测试中的 Code Agent 任务,使用的是 DeepSeek Harness 极简模式

这意味着,DeepSeek 展示的不只是一个更聪明的模型,而是一个由 模型与运行系统共同组成的 Agent

官方给出的公式非常直接:

Agent = Model + Harness

这可能才是此次更新最重要的线索。


一、DeepSeek V4 Pro,升级重点不只是“更会答题”

从官方表述来看,DeepSeek V4 Pro 正式版的重点之一,是 Agent 能力大幅提升,尤其强调了生产环境中的表现。

所谓 Agent 能力,并不是让模型多回答几道逻辑题,而是让它能够围绕一个目标持续行动:

  • 理解代码仓库和运行环境;
  • 拆解一个复杂任务;
  • 调用终端、文件编辑、搜索等工具;
  • 根据执行结果调整下一步计划;
  • 在多轮操作之后交付一个可以验证的结果。

换句话说,过去的大模型更像一个“知识丰富的顾问”,而 Agent 更像一个“能够进入工作现场的执行者”。

从官方公布的部分 Agent 相关评测看,DeepSeek V4 Pro 正式版相较预览版有明显提升:

评测集 V4 Pro 正式版 V4 Pro 预览版
Terminal Bench 2.1 87.9 72.1
NL2Repo 61.5 38.5
Cybergym 83.3 52.7
DeepSWE 62.7 12.8
Toolathlon-Verified 74.1 55.9
AutomationBench(Public) 31.8 12.8
DSBench-FullStack 71.1 41.8
DSBench-Hard 67.2 31.1

这些评测覆盖终端操作、代码仓库理解、软件工程、工具调用、自动化和全栈任务等不同场景。

其中,DeepSWE、AutomationBench、DSBench 等项目上的提升尤其醒目。它们反映的不是模型能否生成一段看起来正确的代码,而是模型能否在更接近真实工程的环境里,持续完成多步骤任务。

当然,基准数字不能脱离测试条件理解。官方也明确说明:上述公开 Code Agent 任务使用 DeepSeek Harness 极简模式,参数为 max 思考强度、top_p=0.95temperature=1.0;换用其他 Agent 框架、工具配置或运行环境,结果可能略有不同。

这个限定非常重要,因为 Agent 的最终表现,从来不只由模型决定。


二、为什么同一个模型,换一个 Harness,表现可能完全不同?

“模型能力强”,不等于“任务一定做得好”。

一个模型要真正完成工作,至少还需要解决下面这些问题:

  1. 它能使用哪些工具?
  2. 工具的调用结果如何返回给模型?
  3. 长任务如何保存状态、恢复和继续?
  4. 文件和命令在什么沙箱中运行?
  5. 失败后是重试、回滚,还是更换方案?
  6. 多个子 Agent 如何分工和汇总?
  7. 每一次上下文注入和工具操作能否追踪?

把这些能力组织起来的运行系统,就是 Harness

可以做一个不完全严谨、但比较直观的比喻:

  • 模型像大脑,负责理解、推理和决策;
  • 工具像双手,负责读取文件、执行命令和操作外部系统;
  • Harness 像神经系统与工作机制,负责把大脑、双手、记忆、环境和行动循环连接起来。

模型决定“聪明程度”,Harness 则影响这种聪明能否稳定地转化为实际结果。

因此,当 Agent 进入复杂编码、数据分析、自动化运维和企业流程等真实场景后,单纯比较模型榜单已经不够了。我们还要看:

模型被放进了怎样的工具环境?获得了怎样的上下文?按照怎样的循环运行?整个过程是否可观察、可恢复、可复现?

这也是 DeepSeek 此时推出 Harness 的意义。


三、DeepSeek Harness 是什么?

DeepSeek Harness 目前以开发者预览版形式开放测试,并同步开放源代码。

它不是一个新模型,也不只是给模型套上一层聊天界面;它更像一套面向 Agent 的开放运行基础设施。

其核心设计理念只有六个字:

一切皆插件。

在 DeepSeek Harness 中,下面这些 Agent 能力都可以由插件提供:

  • 模型;
  • 工具;
  • 技能;
  • 会话;
  • 沙箱;
  • 存储;
  • 运行循环;
  • 调度;
  • UI。

整个系统基于 Cordis 插件系统构建。Cordis 内核本身主要负责插件的加载、卸载和依赖关系,不把某一种具体 Agent 能力写死在内核中。

这带来一个直接好处:开发者不必反复修改 Harness 核心源码,就能在配置层选择、替换和扩展能力。

今天可以连接 DeepSeek V4 Pro,明天也可以根据需求替换模型;可以使用默认沙箱,也可以接入企业自己的安全执行环境;可以添加团队内部的研发 Skill,也可以为某个业务流程设计专用工具。

它提供的不是一个固定形态的“万能 Agent”,而是一套可以自由组合的 Agent 零件与运行机制。


四、“一切皆插件”,为什么可能比预置一百个功能更重要?

很多 AI Agent 产品的做法,是把大量能力预先集成到一个封闭系统中。

这种方式开箱即用,但也容易遇到三个问题:

1. 很难替换

模型、记忆、工具和 UI 往往相互绑定。开发者想替换其中一环,就可能需要修改大量代码。

2. 很难适配企业环境

真实企业往往有自己的权限体系、内部 API、代码规范、审计要求和数据边界。一个封闭 Agent 很难直接进入这些环境。

3. 很难复用

某个团队开发的工具或运行机制,可能只能存在于一个项目里,无法作为标准组件迁移到其他 Agent。

插件化架构试图解决的,正是这些问题。

比如,一个团队可以分别开发:

  • Git 仓库读取插件;
  • 内部知识库检索插件;
  • 工单系统插件;
  • 数据库只读查询插件;
  • 代码安全扫描插件;
  • 人工审批插件;
  • 企业审计日志插件。

然后,根据不同岗位组装出研发 Agent、测试 Agent、运维 Agent 和数据分析 Agent。

这和过去的软件工程很相似:平台的长期价值,不只取决于官方内置多少功能,还取决于它能否形成一个开放、可复用、可组合的生态。


五、Agent 不再是黑盒:每一次运行都有迹可循

Agent 真正进入生产环境时,企业最担心的往往不是它“不够聪明”,而是它的行为不可控。

它为什么执行这条命令?

为什么修改这个文件?

哪一段上下文影响了模型判断?

任务失败后,能不能从中间恢复?

DeepSeek Harness 给出的答案,是一套仅追加设计的会话日志

官方介绍称,模型看到的内容都会被写入事件流,包括:

  • 系统提示词;
  • 模型推理过程;
  • 工具调用与返回结果;
  • 子 Agent 调度;
  • 每一次上下文注入。

开发者可以通过 Trajectory 视图按来源查看运行信息;会话恢复、分叉、检索和回放,也共享同一份事件流。

这套设计的价值,可以概括为四点:

  • 可观察:能够看到 Agent 到底经历了什么;
  • 可追踪:可以定位错误发生在哪一步;
  • 可恢复:长任务中断后不必完全从头开始;
  • 可复现:便于评估不同模型、提示词和工具配置的影响。

对于个人开发者,这意味着更容易调试 Agent;对于企业,这意味着 Agent 才有机会进入需要审计、治理和责任边界的生产流程。


六、四种运行模式,体现了四种不同的 Agent 思路

DeepSeek Harness 当前展示了四种运行模式。

1. 标准模式

提供较完整的编码 Agent 能力,包括文件编辑、Shell、文件与网页检索、Skills、计划、目标、子 Agent 和工作流等。

它适合日常的软件开发、代码修改和复杂任务执行。

2. PTC 模式

PTC 模式具备标准模式的能力,但会通过 Code Mode SDK,让模型生成一段 TypeScript 程序来组合多步工具操作。

与“模型调用一次工具、读取一次结果、再决定下一步”的传统循环相比,这种方式可以把一组操作组织成程序,让复杂工具链更紧凑地执行。

3. 极简模式

极简模式只保留两个核心工具:

  • Shell;
  • 文件编辑工具。

此次 DeepSeek V4 Pro 的公开 Code Agent 基准,使用的正是这一模式。

这不是因为极简模式覆盖的生产能力最多,而是因为它减少了额外工具、工作流和框架策略带来的变量,更适合观察模型在基础环境中的原始编码与执行能力。

因此,极简模式的高分可以证明模型底座很强,但并不意味着真实业务只需要两个工具。进入生产环境后,权限、审计、搜索、外部 API、人工确认和领域 Skill 仍然不可缺少。

4. 创造模式

创造模式用于检查当前运行时、试验 Cordis 插件,并进一步组合和创建自定义 Agent preset。

它最有想象力的地方在于:开发者不只是使用一个现成 Agent,还可以让系统帮助自己创造新的 Agent 形态。


七、V4 Pro 与 Harness 放在一起,意味着什么?

如果说 V4 Pro 解决的是“模型够不够聪明”,Harness 解决的就是“这种智能如何被组织起来”。

两者放在一起,至少释放了三个信号。

第一,Agent 将成为模型能力的主要落点

大模型的下一轮竞争,不会停留在聊天体验。

代码开发、数据处理、浏览器操作、知识检索、企业自动化等场景,都要求模型连续调用工具并对结果负责。Agent 能力将越来越接近模型的核心能力,而不是附加功能。

第二,模型评测将越来越依赖运行框架

同一个模型,使用不同的工具描述、上下文管理、沙箱、循环策略和重试机制,最终结果可能明显不同。

未来看一份 Agent 榜单,不能只问“用了哪个模型”,还要问“用了哪个 Harness、开放了哪些工具、怎样配置推理强度”。

第三,DeepSeek 正在从模型提供者走向 Agent 基础设施提供者

开放 Harness 源码和插件架构,意味着 DeepSeek 不只是希望开发者调用一个 API,还希望开发者围绕模型搭建自己的执行系统。

这条路线一旦形成生态,其价值可能不只是一款工具,而是一套连接模型、插件、Skill、沙箱与企业系统的开放标准。


八、API 更新:为 Agent 开发进一步铺路

除了模型和 Harness,DeepSeek 此次还更新了几项与 Agent 开发直接相关的 API 能力。

原生支持 OpenAI Responses API

DeepSeek API 已原生支持 OpenAI Responses API 格式,并针对 Codex 做了适配。按照官方说明,开发者可以通过配置脚本完成 Codex 接入。

这降低了已有 Agent 工具迁移到 DeepSeek 模型的适配成本。

三档思考强度

V4 Pro 和 V4 Flash 的思考模式支持:

  • low:适合简单、低延迟任务;
  • high:适合日常 Agent 任务;
  • max:适合高度复杂的任务。

这实际上是在效果、速度与成本之间增加一个可调节旋钮。并不是所有任务都需要最高强度推理,生产系统可以根据任务等级动态选择。

峰谷定价

按照官方公告,北京时间 2026 年 8 月 17 日 0 时起,DeepSeek V4 系列 API 将采用峰谷定价,闲时价格为高峰时段的一半。

DeepSeek V4 Pro 的价格如下,单位为元/百万 Tokens:

官方图示中的高峰时段为北京时间 9:00—12:0014:00—18:00,其余为闲时。

对于可以异步执行的代码扫描、批量数据处理和离线 Agent 任务,峰谷定价会给任务调度留下明显的成本优化空间。


九、谁应该关注 DeepSeek Harness?

如果你只是偶尔与 AI 对话,V4 Pro 本身的体验升级更直接。

但下面几类人,更应该关注 Harness:

AI 应用开发者

你可以把模型、搜索、工具、记忆和 UI 组合成面向特定场景的 Agent,而不是从零搭建运行框架。

软件研发团队

可以围绕代码仓库、测试环境、CI/CD 和内部研发规范,搭建自己的编码 Agent,并保留完整的执行轨迹。

企业技术负责人

Harness 的插件化、沙箱和日志设计,为接入企业权限、审计与内部系统提供了基础,但开发者预览版距离严格生产落地仍需要充分评估。

Agent 框架与插件开发者

“一切皆插件”意味着模型之外的大量组件都有独立创新空间。工具、Skill、调度器、存储、沙箱、UI,未来都有可能形成专门的插件生态。


十、如何快速体验?

安装 Node.js 后,可以通过下面的命令启动 DeepSeek Harness Web UI:

npx @deepseek-ai/dsh web

也可以从 GitHub 获取完整源代码:

git clone https://github.com/deepseek-ai/deepseek-harness

需要提醒的是,DeepSeek Harness 当前仍是开发者预览版。官方表示,核心插件与基础 API 仍会持续迭代。

因此,目前更适合用于学习、评估、原型开发和插件探索;在生产环境中使用前,仍需要重点验证权限控制、数据安全、沙箱隔离、操作审批和版本兼容性。


写在最后

过去一年,我们习惯用“哪个模型更强”来讨论 AI。

但当模型开始修改代码、执行命令、调用企业系统,并连续工作数小时后,这个问题已经不完整了。

接下来真正重要的问题是:

  • 模型能够进入什么环境?
  • 它被允许使用什么工具?
  • 它如何保存记忆和任务状态?
  • 它的每一步操作是否可追踪?
  • 不同能力能否被自由组合和替换?

DeepSeek V4 Pro 给出了一个更强的模型底座,DeepSeek Harness 则尝试给这个底座装上工具、环境、运行循环和可观察系统。

一个负责思考,一个负责把思考变成行动。

V4 Pro 决定 Agent 能走多远,Harness 决定它能不能真正上路。

这一次,DeepSeek 发布的也许不只是一个新模型。

它正在展示一种更完整的 AI 产品形态:

模型提供智能,Harness 组织智能,插件把智能带进真实世界。


posted @ 2026-08-14 11:40  丿似锦  阅读(65)  评论(0)    收藏  举报