第02篇·DeepSeek Harness 四种运行模式实测:标准、PTC、极简、创造到底差在哪
原文链接:第02篇·DeepSeek Harness 四种运行模式实测:标准、PTC、极简、创造到底差在哪
【欢迎关注作者微信公众号,第一时间获取最新好文和AI日报。👇】

上一篇把 dsh 跑了起来,完成了第一个「读目录」任务。这一篇进入 DeepSeek Harness 的核心设定:它提供了标准、PTC、极简、创造四种运行模式。很多初学者的第一个困惑是——模式到底差在哪?是不是只是提示词不同?
这篇你能得到三样东西:一张把四种模式拆成「工具集 + 提示词 + 循环策略」的对比图;一套在同一任务上跑四遍的对照方法。所有结论都基于 dsh 当前 developer preview(0.1.1-rc.2)的配置结构,命令与参数名可能随版本微调,请以官方文档为准。
一、四种模式,本质是三种东西的排列组合
官方把 dsh 的运行模式设计为「可替换的配置包」。通俗理解,模式不是换皮肤,而是把下面三样东西重新打包:
- 工具集:agent 能调用哪些工具;
- 提示词:system prompt 的风格与约束;
- 循环策略:agent 如何决定下一步、何时停止。

图 1|DeepSeek Harness 四种运行模式对比
从这张图可以直观看到,DeepSeek Harness 四种运行模式区别并不神秘:标准模式给完整工具集,PTC 模式偏向评测过程,极简模式大刀阔斧只留两个工具,创造模式则允许更多探索空间。
其中最关键的一点是:极简(Minimal)模式是官方跑分的基准口径。
二、同一任务跑四遍,差别立刻显现
对照实验的设计很简单:固定输入、固定模型、只改模式。沿用上一篇的目录摘要任务:
| 请阅读“/Users/root/deepseek-harness/docs”目录下的文档,产出一份文档说明摘要。 |
|---|
采用DeepSeek-V4-Flash大模型,推理等级默认是「High」,分别在标准、PTC、极简、创造四种模式下下发同一任务,记录八项指标(§2.2 四项行为/结果指标 + §2.3 四项耗时/Token 指标):工具调用次数、总耗时、轮数/步数、输出质量(§2.2 记加权分、§2.4 统一百分制,二者 ×20 等价);以及 LLM 耗时、工具调用耗时、输入/输出 token、缓存命中率。
2.1 启动方式与模式切换
启动命令只需敲一次,模式可直接在WebUI指定:
| pnpm dsh web |
|---|

图 2-1(上)|终端执行 pnpm dsh web 的启动输出,蓝色处为本地访问地址。
启动后在浏览器打开本地地址进入对话界面,通过 Web UI 的模式(Profile)选择器 直接点选切换即可:

图 2-1(下)|Web UI 内的模式选择器,展开后可见 标准 / PTC / 极简 / 创造 四个选项。
下表记录各模式在 UI 中的实际显示名,方便与后文对照表逐行对应:
| 模式 | UI 中的选择项 |
|---|---|
| 标准 Standard | 标准模式 |
| PTC | PTC模式 |
| 极简 Minimal | 极简模式 |
| 创造 Creative | 创造模式 |
注:若你用命令行而非 Web UI 跑,可改用
--mode参数指定模式,具体以dsh --help输出为准。
2.2 四模式对照表(核心行为与结果)
下面四张截图是同一任务在四种模式下的运行结果页:

图 2-2(1/4)|标准 Standard 模式:底部状态栏显示 7 轮 · 26 步、LLM 2m10s、缓存命中 95%。

图 2-2(2/4)|PTC 模式:底部状态栏显示 11 轮 · 28 步、LLM 4m20s、缓存命中 95%。

图 2-2(3/4)|极简 Minimal 模式:底部状态栏显示 1 轮 · 22 步、LLM 1m13s、缓存命中 92%。

图 2-2(4/4)|创造 Creative 模式:底部状态栏显示 1 轮 · 14 步、LLM 1m18s、缓存命中 88%。
| 模式 | 工具调用次数 | 总耗时 | 输出质量(加权分) | 轮数 / 步数 |
|---|---|---|---|---|
| 标准 Standard | 30次 | 4m05s | 4.7 | 7 轮 · 26 步 |
| PTC | 59次 | 6m38s | 3.5 | 11 轮 · 28 步 |
| 极简 Minimal | 24次 | 1m33s | 4.4 | 1 轮 · 22 步 |
| 创造 Creative | 35次 | 1m21s | 4.8 | 1 轮 · 14 步 |
2.3 耗时与 token 拆解
下面四张截图分别是四种模式下的 Web UI 底部状态栏细节:

图 2-3(1/4)|标准 Standard 模式:LLM 2m10s · 工具调用 2s · 输入 914K / 输出 14.1K · 缓存命中 95%。

图 2-3(2/4)|PTC 模式:LLM 4m20s · 工具调用 3.6s · 输入 2M / 输出 29.9K · 缓存命中 95%。

图 2-3(3/4)|极简 Minimal 模式:LLM 1m13s · 工具调用 19.3s · 输入 874K / 输出 6K · 缓存命中 92%。

图 2-3(4/4)|创造 Creative 模式:LLM 1m18s · 工具调用 3.6s · 输入 650K / 输出 8.6K · 缓存命中 88%。
| 模式 | LLM 耗时 | 工具调用耗时 | 输入 / 输出 token | 缓存命中率 |
|---|---|---|---|---|
| 标准 Standard | 2m10s | 2s | 914K / 14.1K | 95% |
| PTC | 4m20s | 3.6s | 2M / 29.9K | 95% |
| 极简 Minimal | 1m13s | 19.3s | 874K / 6K | 92% |
| 创造 Creative | 1m18s | 3.6s | 650K / 8.6K | 88% |
页面底部还会显示「首 token 平均」和「tok/s」。它们主要反映模型侧响应速度,同一模型下受网络波动影响较大,不建议作为模式横向对比的主指标,只作为补充参考。
只要跑出一次对照表,就会发现:工具集越少的模式,agent 的行为越可预测;工具集越宽,潜在能力越强,但也越容易「想太多」。不过,「工具调用次数」和「耗时」只说了行为,没说结果好坏。下面这一节才是本文的核心。
2.4 输出质量统一评分:同一道题,四种答卷

图 2-4|四模式输出质量评分(百分制):创造 96% / 标准 94% / 极简 88% / PTC 70%。同一任务、同一 rubric、统一加权。
评分坚持一把尺子量四条:提前定好 5 个维度与权重,逐份按同一百分制标准打分并加权汇总,避免「凭感觉打印象分」。
| 维度 | 权重 | 看什么 |
|---|---|---|
| 覆盖完整性 | 25% | 八大区域是否齐 |
| 事实准确度 | 25% | 数字/文件名无误 |
| 结构组织 | 20% | 层级清晰 |
| 细节深度 | 15% | 有可验证细节 |
| 实用导向 | 15% | 给路径可落盘 |
逐份看:
- 标准(94%):覆盖最均衡,教科书式答卷;唯一小瑕疵是篇数口径前后略不统一。
- 创造(96%):多挖出「维护机制」一节,细节最深;页数计数与标准差 1 页,属口径差异。
- 极简(88%):仅两个工具、耗时最短,仍交出完整清爽摘要,短板在细节深度。
- PTC(70%):调用最多、耗时最长,答卷却最薄,精力耗在流程上;文件数前后矛盾,准确度扣分最多。
核心结论:对「读目录、产出摘要」这类信息整合任务,工具多 ≠ 答得好。PTC 用最多工具、跑最久,分数反而最低;极简用最少工具、跑最快,仍拿 88%。标准与创造并列第一,差异只在侧重。模式选择看「任务类型匹配」,不是堆工具。
评分为按上述 rubric 的人工评定(非 dsh 官方自动化指标),读者可按同一标准复评;四个模式的原始输出与五维明细见文末「阅读原文」的对比卡。
三、为什么极简模式是官方评测的基准口径
极简(Minimal)模式为什么是官方评测的基准口径?答案不在文档口号里,而是在源码层面——这个模式从配置文件起,就把工具集锁死了。
钥匙是仓库里的这个 preset 文件,顶部注释已经写清楚了:
| apps/cli/config/agent-presets/minimal/agent.cordis.yml
# the model composes only the persistent shell
| # (bash on POSIX, pwsh on win32) and str_replace_editor |
|---|
翻译过来就一句话:模型在这里只能组合两个工具——persistent-bash 与 str-replace-editor。该配置文件实际注册的插件,也正是这两个。
这不是简陋,而是为了评测可控。
仓库 BENCHMARK.md 规定,评测跑的是 jsonrpc-agent 的 minimal variant;而极简 preset 把工具集锁死成同一套 bash + str_replace_editor。
为什么要锁死?评测要能横向比,前提是所有跑分的工具集完全一致。否则分数涨了跌了,你分不清是模型变强了,还是工具在帮忙。
所以读各家模型卡时,先确认一点:它是在「同一套固定工具集(minimal)」下跑出来的吗?不是,那数字直接对比就没意义。
四、四行对照表:把差距摊开来
用文字再总结一次四模式的核心差异:
| 模式 | 工具集特点 | 提示词风格 | 循环策略 |
|---|---|---|---|
| 标准 | 完整内置工具 | 通用助手指令 | 标准 agent loop |
| PTC | 评测特化工具 | 过程式分步 | PTC 风格循环 |
| 极简 | bash + str_replace_editor | 极简收敛 | 最小化 loop |
| 创造 | 可扩展工具 | 发散探索 | 创造式 loop |
上面的定性表只讲「差异长什么样」。四模式的实测数据(工具调用次数、总耗时、轮数 / 步数、输出质量、LLM 耗时、工具调用耗时、输入/输出 token、缓存命中率)已在第二节 2.2、2.3 逐行摊开,这里不再重复贴表。
这张表的价值不是记住四个名字,而是以后拿到官方跑分或社区测试时,能第一反应去核对「这是在哪种模式下跑的」。
五、当前版本的几个常见坑
由于 dsh 还处于 developer preview,模式相关配置可能有变化。下面这几个点跑之前先注意:
| 坑点 | 说明 | 处理建议 |
|---|---|---|
| 模式名可能变 | preview 版本迭代快,名称与参数以文档为准 | 跑前先执行 --help 确认 |
| Minimal 不是万金油 | 它只适用于可控评测,日常任务可能能力不够 | 先判断任务是「跑分」还是「干活」 |
| 工具少 ≠ 成本低 | 极简模式下模型可能反复调用同一工具,实际 token 不一定最少 | 以实测数据为准 |
说明:dsh 当前为 developer preview,命令可能随版本变化,遇到问题优先查阅官方 README 与 BENCHMARK.md。
小结
四种模式不是四个「皮肤」,而是三套可替换的引擎组合。标准模式适合日常泛用,PTC 模式偏向过程评测,极简模式是官方跑分的基准口径,创造模式则给探索性任务留足空间。
讨论:你更倾向用极简模式做可控评测,还是用标准模式让 agent 自己发挥?评论区聊聊你的选择。
如果这篇帮你厘清了四种模式的关系,点个「分享」或「收藏」。
【欢迎访问我的个人博客主页,这里有我的精选文章和AI大模型日报专栏。👇)


浙公网安备 33010602011771号