第02篇·DeepSeek Harness 四种运行模式实测:标准、PTC、极简、创造到底差在哪

原文链接:第02篇·DeepSeek Harness 四种运行模式实测:标准、PTC、极简、创造到底差在哪

【欢迎关注作者微信公众号,第一时间获取最新好文和AI日报。👇】
独码侠微信公众号二维码

上一篇把 dsh 跑了起来,完成了第一个「读目录」任务。这一篇进入 DeepSeek Harness 的核心设定:它提供了标准、PTC、极简、创造四种运行模式。很多初学者的第一个困惑是——模式到底差在哪?是不是只是提示词不同?

这篇你能得到三样东西:一张把四种模式拆成「工具集 + 提示词 + 循环策略」的对比图;一套在同一任务上跑四遍的对照方法。所有结论都基于 dsh 当前 developer preview(0.1.1-rc.2)的配置结构,命令与参数名可能随版本微调,请以官方文档为准。


一、四种模式,本质是三种东西的排列组合

官方把 dsh 的运行模式设计为「可替换的配置包」。通俗理解,模式不是换皮肤,而是把下面三样东西重新打包:

  • 工具集:agent 能调用哪些工具;
  • 提示词:system prompt 的风格与约束;
  • 循环策略:agent 如何决定下一步、何时停止。

图 1|DeepSeek Harness 四种运行模式对比

从这张图可以直观看到,DeepSeek Harness 四种运行模式区别并不神秘:标准模式给完整工具集,PTC 模式偏向评测过程,极简模式大刀阔斧只留两个工具,创造模式则允许更多探索空间。

其中最关键的一点是:极简(Minimal)模式是官方跑分的基准口径。


二、同一任务跑四遍,差别立刻显现

对照实验的设计很简单:固定输入、固定模型、只改模式。沿用上一篇的目录摘要任务:

请阅读“/Users/root/deepseek-harness/docs”目录下的文档,产出一份文档说明摘要。

采用DeepSeek-V4-Flash大模型,推理等级默认是「High」,分别在标准、PTC、极简、创造四种模式下下发同一任务,记录八项指标(§2.2 四项行为/结果指标 + §2.3 四项耗时/Token 指标):工具调用次数、总耗时、轮数/步数、输出质量(§2.2 记加权分、§2.4 统一百分制,二者 ×20 等价);以及 LLM 耗时、工具调用耗时、输入/输出 token、缓存命中率。

2.1 启动方式与模式切换

启动命令只需敲一次,模式可直接在WebUI指定:

pnpm dsh web

图 2-1(上)|终端执行 pnpm dsh web 的启动输出,蓝色处为本地访问地址。

启动后在浏览器打开本地地址进入对话界面,通过 Web UI 的模式(Profile)选择器 直接点选切换即可:

图 2-1(下)|Web UI 内的模式选择器,展开后可见 标准 / PTC / 极简 / 创造 四个选项。

下表记录各模式在 UI 中的实际显示名,方便与后文对照表逐行对应:

模式 UI 中的选择项
标准 Standard 标准模式
PTC PTC模式
极简 Minimal 极简模式
创造 Creative 创造模式

注:若你用命令行而非 Web UI 跑,可改用 --mode 参数指定模式,具体以 dsh --help 输出为准。

2.2 四模式对照表(核心行为与结果)

下面四张截图是同一任务在四种模式下的运行结果页:

图 2-2(1/4)|标准 Standard 模式:底部状态栏显示 7 轮 · 26 步、LLM 2m10s、缓存命中 95%。

图 2-2(2/4)|PTC 模式:底部状态栏显示 11 轮 · 28 步、LLM 4m20s、缓存命中 95%。

图 2-2(3/4)|极简 Minimal 模式:底部状态栏显示 1 轮 · 22 步、LLM 1m13s、缓存命中 92%。

图 2-2(4/4)|创造 Creative 模式:底部状态栏显示 1 轮 · 14 步、LLM 1m18s、缓存命中 88%。

模式 工具调用次数 总耗时 输出质量(加权分) 轮数 / 步数
标准 Standard 30次 4m05s 4.7 7 轮 · 26 步
PTC 59次 6m38s 3.5 11 轮 · 28 步
极简 Minimal 24次 1m33s 4.4 1 轮 · 22 步
创造 Creative 35次 1m21s 4.8 1 轮 · 14 步

2.3 耗时与 token 拆解

下面四张截图分别是四种模式下的 Web UI 底部状态栏细节:

图 2-3(1/4)|标准 Standard 模式:LLM 2m10s · 工具调用 2s · 输入 914K / 输出 14.1K · 缓存命中 95%。

图 2-3(2/4)|PTC 模式:LLM 4m20s · 工具调用 3.6s · 输入 2M / 输出 29.9K · 缓存命中 95%。

图 2-3(3/4)|极简 Minimal 模式:LLM 1m13s · 工具调用 19.3s · 输入 874K / 输出 6K · 缓存命中 92%。

图 2-3(4/4)|创造 Creative 模式:LLM 1m18s · 工具调用 3.6s · 输入 650K / 输出 8.6K · 缓存命中 88%。

模式 LLM 耗时 工具调用耗时 输入 / 输出 token 缓存命中率
标准 Standard 2m10s 2s 914K / 14.1K 95%
PTC 4m20s 3.6s 2M / 29.9K 95%
极简 Minimal 1m13s 19.3s 874K / 6K 92%
创造 Creative 1m18s 3.6s 650K / 8.6K 88%

页面底部还会显示「首 token 平均」和「tok/s」。它们主要反映模型侧响应速度,同一模型下受网络波动影响较大,不建议作为模式横向对比的主指标,只作为补充参考。

只要跑出一次对照表,就会发现:工具集越少的模式,agent 的行为越可预测;工具集越宽,潜在能力越强,但也越容易「想太多」。不过,「工具调用次数」和「耗时」只说了行为,没说结果好坏。下面这一节才是本文的核心。

2.4 输出质量统一评分:同一道题,四种答卷

图 2-4|四模式输出质量评分(百分制):创造 96% / 标准 94% / 极简 88% / PTC 70%。同一任务、同一 rubric、统一加权。

评分坚持一把尺子量四条:提前定好 5 个维度与权重,逐份按同一百分制标准打分并加权汇总,避免「凭感觉打印象分」。

维度 权重 看什么
覆盖完整性 25% 八大区域是否齐
事实准确度 25% 数字/文件名无误
结构组织 20% 层级清晰
细节深度 15% 有可验证细节
实用导向 15% 给路径可落盘

逐份看:

  • 标准(94%):覆盖最均衡,教科书式答卷;唯一小瑕疵是篇数口径前后略不统一。
  • 创造(96%):多挖出「维护机制」一节,细节最深;页数计数与标准差 1 页,属口径差异。
  • 极简(88%):仅两个工具、耗时最短,仍交出完整清爽摘要,短板在细节深度。
  • PTC(70%):调用最多、耗时最长,答卷却最薄,精力耗在流程上;文件数前后矛盾,准确度扣分最多。

核心结论:对「读目录、产出摘要」这类信息整合任务,工具多 ≠ 答得好。PTC 用最多工具、跑最久,分数反而最低;极简用最少工具、跑最快,仍拿 88%。标准与创造并列第一,差异只在侧重。模式选择看「任务类型匹配」,不是堆工具。

评分为按上述 rubric 的人工评定(非 dsh 官方自动化指标),读者可按同一标准复评;四个模式的原始输出与五维明细见文末「阅读原文」的对比卡。


三、为什么极简模式是官方评测的基准口径

极简(Minimal)模式为什么是官方评测的基准口径?答案不在文档口号里,而是在源码层面——这个模式从配置文件起,就把工具集锁死了。

钥匙是仓库里的这个 preset 文件,顶部注释已经写清楚了:

| apps/cli/config/agent-presets/minimal/agent.cordis.yml
# the model composes only the persistent shell

# (bash on POSIX, pwsh on win32) and str_replace_editor

翻译过来就一句话:模型在这里只能组合两个工具——persistent-bash 与 str-replace-editor。该配置文件实际注册的插件,也正是这两个。

这不是简陋,而是为了评测可控。

仓库 BENCHMARK.md 规定,评测跑的是 jsonrpc-agent 的 minimal variant;而极简 preset 把工具集锁死成同一套 bash + str_replace_editor

为什么要锁死?评测要能横向比,前提是所有跑分的工具集完全一致。否则分数涨了跌了,你分不清是模型变强了,还是工具在帮忙。

所以读各家模型卡时,先确认一点:它是在「同一套固定工具集(minimal)」下跑出来的吗?不是,那数字直接对比就没意义。


四、四行对照表:把差距摊开来

用文字再总结一次四模式的核心差异:

模式 工具集特点 提示词风格 循环策略
标准 完整内置工具 通用助手指令 标准 agent loop
PTC 评测特化工具 过程式分步 PTC 风格循环
极简 bash + str_replace_editor 极简收敛 最小化 loop
创造 可扩展工具 发散探索 创造式 loop

上面的定性表只讲「差异长什么样」。四模式的实测数据(工具调用次数、总耗时、轮数 / 步数、输出质量、LLM 耗时、工具调用耗时、输入/输出 token、缓存命中率)已在第二节 2.2、2.3 逐行摊开,这里不再重复贴表。

这张表的价值不是记住四个名字,而是以后拿到官方跑分或社区测试时,能第一反应去核对「这是在哪种模式下跑的」。


五、当前版本的几个常见坑

由于 dsh 还处于 developer preview,模式相关配置可能有变化。下面这几个点跑之前先注意:

坑点 说明 处理建议
模式名可能变 preview 版本迭代快,名称与参数以文档为准 跑前先执行 --help 确认
Minimal 不是万金油 它只适用于可控评测,日常任务可能能力不够 先判断任务是「跑分」还是「干活」
工具少 ≠ 成本低 极简模式下模型可能反复调用同一工具,实际 token 不一定最少 以实测数据为准

说明:dsh 当前为 developer preview,命令可能随版本变化,遇到问题优先查阅官方 README 与 BENCHMARK.md。


小结

四种模式不是四个「皮肤」,而是三套可替换的引擎组合。标准模式适合日常泛用,PTC 模式偏向过程评测,极简模式是官方跑分的基准口径,创造模式则给探索性任务留足空间。

讨论:你更倾向用极简模式做可控评测,还是用标准模式让 agent 自己发挥?评论区聊聊你的选择。

如果这篇帮你厘清了四种模式的关系,点个「分享」或「收藏」。

【欢迎访问我的个人博客主页,这里有我的精选文章和AI大模型日报专栏。👇)
我的个人博客

posted @ 2026-08-27 12:38  独码侠  阅读(71)  评论(0)    收藏  举报