什么是 Harness?
1. 从单词原意理解 Harness
Harness 的原意是套在马身上的一整套马具、挽具。它把马、缰绳和操作者连接起来,使马的力量能够被引导、控制并用于完成目标。

马具不会让马变得更聪明,也不会凭空增加马的力量,但它解决了三个关键问题:
| 问题 | 马具的作用 | 对应到 AI 系统 |
|---|---|---|
| 往哪里走? | 接收并传递方向 | 接收用户目标、准备任务上下文 |
| 怎样行动? | 控制速度和动作 | 调用工具、执行步骤、管理流程 |
| 如何保持可控? | 提供连接与约束 | 管理权限、安全边界和执行状态 |
类比记忆:大模型像一匹有能力的马,Harness 像一套马具。Harness 不替代模型,而是让模型的能力变得可连接、可控制、可执行。
2. AI 系统中的 Harness
在 AI 场景中,Harness 可以理解为一套完整的执行环境或运行时框架。它位于大语言模型(LLM)与外部世界之间,负责组织模型完成任务所需要的各种资源和流程。

一句话定义:Harness 负责管理大模型与外部世界之间的交互——接收输入、准备上下文、调用工具、编排流程、整合结果,并生成或交付最终输出。
一个典型的运行过程可以概括为:
| 阶段 | Harness 的工作 | 产生的结果 |
|---|---|---|
| 1. 接收目标 | 理解用户输入,建立任务状态 | 明确“要做什么” |
| 2. 准备上下文 | 收集文件、历史记录、环境信息和约束 | 形成模型需要的背景信息 |
| 3. 调用模型 | 把目标和上下文交给 LLM 推理 | 获得计划、判断或待执行动作 |
| 4. 执行动作 | 调用工具、Skill、接口或外部系统 | 对真实环境产生结果 |
| 5. 观察与调整 | 收集执行结果并再次交给模型判断 | 决定继续、修正或结束 |
| 6. 评估与交付 | 检查结果是否满足目标 | 输出最终结果或请求人工确认 |
Harness 不是什么?
- 不是模型本身:模型负责理解、推理和生成;Harness 负责组织模型运行。
- 不是一条提示词:提示词只是输入的一部分,Harness 还要管理状态、工具、权限和流程。
- 不是一次 API 调用:单次调用通常只有“输入—输出”,Harness 支持多轮执行与持续调整。
- 不是 Agent 的同义词:Harness 是运行环境,Agent 是在这个环境中围绕目标持续行动的角色。
[!IMPORTANT]
“能够回答问题”和“能够在真实环境中持续完成任务”并不是一回事。两者之间缺少的运行与执行机制,正是 Harness 的核心价值。
3. Model、Harness 与 Agent 的区别

| 概念 | 主要职责 | 解决的问题 | 类比 |
|---|---|---|---|
| Model(模型) | 理解、推理、生成内容 | “系统有多聪明?” | 智能发动机 |
| Harness(执行环境) | 管理上下文、记忆、工具、流程、权限与评估 | “智能怎样稳定运行?” | 整车运行与控制系统 |
| Agent(智能体) | 围绕目标规划、行动、观察并持续推进 | “谁来把事情办完?” | 面向目标工作的整体角色 |
因此,可以得到三个判断:
- 模型不等于 Harness:模型提供智能,Harness 提供运行条件。
- 模型不等于 Agent:一次模型回答不等于一个能够持续行动的智能体。
- Harness 影响 Agent 的实际能力:同一个模型在不同 Harness 中,能够使用的上下文、工具、流程和权限可能不同,最终任务表现也会不同。
核心结论:Model 负责“思考”,Harness 负责“让系统运转”,Agent 负责“围绕目标把事情办完”。
4. Harness、LLM、Agent 与 Skill 如何协作

四个角色
| 角色 | 作用 | 关键词 |
|---|---|---|
| Harness | 承载并管理整个执行过程 | 环境、调度、状态、权限 |
| LLM | 提供理解、推理和生成能力 | 智能、判断、生成 |
| Agent | 围绕目标制定计划并推进任务 | 目标、行动、反馈 |
| Skill | 封装某一类可复用的专业能力 | 知识、步骤、工具用法 |
一次任务的协作过程
- 用户向 Agent 提出目标;
- Harness 准备上下文、可用工具和权限边界;
- Agent 调用 LLM 理解目标并形成下一步计划;
- 需要专业能力时,Agent 按需加载对应 Skill;
- Harness 调用工具执行动作,并把结果返回给 Agent;
- Agent 再次判断,继续执行、调整方案或结束任务;
- Harness 评估并交付最终结果,必要时请求人工确认。
[!TIP]
可以把 Skill 理解成“专业工作手册”:它告诉 Agent 在某类任务中应该掌握哪些知识、遵循哪些步骤、怎样正确使用工具。
5. 记忆公式
Model + Harness = Agent
这个公式不是严格的数学等式,而是一条概念记忆公式:
Model提供智能;Harness提供上下文、工具、流程、权限和执行循环;- 两者结合后,系统才表现出围绕目标持续工作的
Agent能力。
| 组合 | 常见表现 |
|---|---|
| 只有 Model | 更像一次问答、生成或推理 |
| 只有 Harness | 有运行框架,但缺少理解和推理的智能核心 |
| Model + Harness | 可以形成持续规划、执行、观察和调整的 Agent |
6. Harness 的核心能力
成熟的 Harness 通常会把多种运行能力组织成一个闭环。

6.1 信息基础:系统“知道什么”

6.2 行动能力:系统“能做什么”

6.3 执行控制:系统“怎样持续推进”

6.4 安全与质量:系统“能否可靠完成”

6.5 交互与扩展:系统“怎样接入和成长”

完整闭环:准备信息 → 规划步骤 → 调用 Skill 和工具 → 观察结果 → 在权限边界内调整 → 评估并交付。
7. 示例:让 Agent 生成一份调研报告
假设用户提出任务:“读取指定资料,整理一份调研报告,并保存为文档。”
| 步骤 | 对应能力 | 发生了什么 |
|---|---|---|
| 1 | Context | 读取任务要求、资料位置、格式与截止条件 |
| 2 | Planning | 把任务拆成资料读取、信息归纳、写作和检查等步骤 |
| 3 | Skill | 加载文档阅读、内容分析或报告写作能力 |
| 4 | Tools / MCP | 访问文件、搜索数据或调用文档工具 |
| 5 | Loop | 根据中间结果继续补充信息、修正结构和完善内容 |
| 6 | Permissions | 对敏感读取、外部访问或文件写入进行权限控制 |
| 7 | Evaluation | 检查报告是否完整、准确并符合格式要求 |
| 8 | UI / Gateway | 将结果交付给用户,或提示需要进一步确认的事项 |
在这个过程中,LLM 负责理解和生成,但让任务持续推进并真正落地的是 Harness 所组织的整套运行机制。
8. 常见误区
| 误区 | 正确认识 |
|---|---|
| 模型越强,Agent 就一定越强 | Agent 的表现还取决于 Harness 提供的上下文、工具、流程、权限和评估机制。 |
| 调用一次模型 API 就是 Agent | Agent 通常需要目标管理、多步执行、状态反馈和循环调整。 |
| Skill 就是一个工具 | Skill 更像一套专业能力说明,可以组织知识、步骤和多个工具。 |
| Harness 只负责调用工具 | 工具调用只是其中一部分;Harness 还要管理上下文、记忆、规划、权限、评估和交付。 |
| 权限会妨碍自动化 | 合理的权限边界能让自动化更加安全、可控和可审计。 |

浙公网安备 33010602011771号