[Harness] Loop Engineering

 

 

背景知识思考


Loop Engineering 建立在 Harness Engineering 之上,并自动化了重复过程。

Inference in Probabilistic Graphical Models的思想? 但相反,有记忆,且没有收敛保证。所以要反复强调 termination(何时停止)和 verification(如何验证正确性)

EM?

马尔科夫链?

 
工程启发式(Engineering Heuristic),而不是 数学收敛算法(Provably Convergent Algorithm)。
 
 

本来就有的 Loop 概念

例如 Coding Agent:

读取代码
→ 修改文件
→ 运行测试
→ 看到报错
→ 再修改
→ 返回结果
 这是 Harness 最核心的运行机制。
 
 

三层嵌套的 Loop

真正理解 Loop Engineering,最好把它看成三个嵌套循环。

第一层:模型—工具循环

思考 → 行动 → 观察 → 再思考

目标:让Agent能够使用工具完成一次任务。

 

第二层:任务—验证循环

实现 → 测试 → 失败 → 修复 → 再测试

目标:不是“觉得完成” by Model,而是外部验证证明完成。

 

第三层:Harness 改进循环 (也就是 “有能力” 发现当前循环有局限?)

发现Agent反复犯错
→ 找出根因 (不仅仅是外部验证证明,而且要找出根本原因,不能随意修改自己)
→ 增加文档、测试、Linter或工具
→ 后续Agent不再犯同类错误

目标:不仅完成当前任务,还让整个系统越来越可靠。

 

Thus:

  • 内层:Agent在学习怎么完成当前任务
  • 中层:任务在测试反馈下逐渐收敛
  • 外层:Harness根据历史失败持续进化
 
 

有循环,不代表循环会收敛

  —— 至少 不再重复类似错误 ~

Loop Engineering关注的是:

怎样设计这个循环,使它能够发现进展、识别失败、改变策略,并在正确条件下结束。

 

Loop Engineering不是完全独立于Harness Engineering的新体系,更像是:

把Harness中最容易造成长期失败的“循环控制部分”单独拿出来,进行精细化设计。

 
Loop Engineering的核心,不只是意识到Loop可能有问题,而是建立一套方法,诊断Loop为什么不收敛,并通过改进目标、状态、反馈、验证、策略切换和终止机制,使它更可靠地朝目标推进。
 
 
 
 

实践出真知


Link :You Can Learn AI Agent Harness & Loop Engineering In 19 Min | LLM Ops, Eval, Tracing, RAG

 

Harness
├── 输入管理
│ ├── User Prompt
│ ├── System Prompt
│ └── Current Chat History

├── Context / Working Memory

├── 长期记忆
│ ├── Procedural Memory # 做事的方法,固定流程定义
│ ├── Semantic Memory # 系统长期知道哪些相对稳定的事实,例如“小众领域”的名人名言等等
│ └── Episodic Memory # 记忆如何长出来?通过智能压缩

├── Retrieval
│ ├── SQL
│ ├── RAG
│ └── Top-k Search

├── Agent Loop
│ ├── LLM
│ ├── Tool Calling
│ ├── Tool Response
│ └── End-loop Guardrails

└── 最终 Reply

 image
 
 

关键问题与反思

只讲左边,会产生一个严重问题:

你做出了一个能跑的 Agent,却不知道它到底跑得好不好

 
另外,

绝大多数业务自动化,其实不需要开放式 Agent Loop。

能用 n8n、Power Automate 这种预先设计好的流程稳定解决,就不应该为了“Agent 化”而强行循环。

所以,与其说某些问题需要“反复思考”,不如说:

某些问题必须 边做、边观察、边修正,因为一开始根本不知道完整路径。

 
 
与人博弈的地方 才可能需要 Agent 的 Loop 大法
—— CBA Bank 的案例
 
Workflow 负责控制;Agent 负责处理无法穷举的认知工作。

它可能允许一个范围小得多的目标:

针对这一个可疑交易模式,
收集与它相关的证据,
找出最相关的内部政策,
提出候选风险解释和检测规则,
不得执行任何客户操作。

 

欺诈规则生成 agent(三个月自建,参与四分之三卡欺诈规则)。但应该是建立在已有数据之前的“增强”。
 
 
posted @ 2026-08-03 16:01  郝壹贰叁  阅读(8)  评论(0)    收藏  举报