[Harness] Loop Engineering
背景知识思考
Loop Engineering 建立在 Harness Engineering 之上,并自动化了重复过程。
Inference in Probabilistic Graphical Models的思想? 但相反,有记忆,且没有收敛保证。所以要反复强调 termination(何时停止)和 verification(如何验证正确性)
EM?
马尔科夫链?
本来就有的 Loop 概念
例如 Coding Agent:
读取代码
→ 修改文件
→ 运行测试
→ 看到报错
→ 再修改
→ 返回结果
三层嵌套的 Loop
真正理解 Loop Engineering,最好把它看成三个嵌套循环。
第一层:模型—工具循环
思考 → 行动 → 观察 → 再思考
目标:让Agent能够使用工具完成一次任务。
第二层:任务—验证循环
实现 → 测试 → 失败 → 修复 → 再测试
目标:不是“觉得完成” by Model,而是外部验证证明完成。
第三层:Harness 改进循环 (也就是 “有能力” 发现当前循环有局限?)
发现Agent反复犯错
→ 找出根因 (不仅仅是外部验证证明,而且要找出根本原因,不能随意修改自己)
→ 增加文档、测试、Linter或工具
→ 后续Agent不再犯同类错误
目标:不仅完成当前任务,还让整个系统越来越可靠。
Thus:
内层:Agent在学习怎么完成当前任务中层:任务在测试反馈下逐渐收敛外层:Harness根据历史失败持续进化
有循环,不代表循环会收敛
—— 至少 不再重复类似错误 ~
Loop Engineering关注的是:
怎样设计这个循环,使它能够发现进展、识别失败、改变策略,并在正确条件下结束。
Loop Engineering不是完全独立于Harness Engineering的新体系,更像是:
把Harness中最容易造成长期失败的“循环控制部分”单独拿出来,进行精细化设计。
实践出真知
Link :You Can Learn AI Agent Harness & Loop Engineering In 19 Min | LLM Ops, Eval, Tracing, RAG
Harness
├── 输入管理
│ ├── User Prompt
│ ├── System Prompt
│ └── Current Chat History
│
├── Context / Working Memory
│
├── 长期记忆
│ ├── Procedural Memory # 做事的方法,固定流程定义
│ ├── Semantic Memory # 系统长期知道哪些相对稳定的事实,例如“小众领域”的名人名言等等
│ └── Episodic Memory # 记忆如何长出来?通过智能压缩
│
├── Retrieval
│ ├── SQL
│ ├── RAG
│ └── Top-k Search
│
├── Agent Loop
│ ├── LLM
│ ├── Tool Calling
│ ├── Tool Response
│ └── End-loop Guardrails
│
└── 最终 Reply

关键问题与反思
只讲左边,会产生一个严重问题:
你做出了一个能跑的 Agent,却不知道它到底跑得好不好
绝大多数业务自动化,其实不需要开放式 Agent Loop。
能用 n8n、Power Automate 这种预先设计好的流程稳定解决,就不应该为了“Agent 化”而强行循环。
所以,与其说某些问题需要“反复思考”,不如说:
某些问题必须 边做、边观察、边修正,因为一开始根本不知道完整路径。
它可能允许一个范围小得多的目标:
针对这一个可疑交易模式, 收集与它相关的证据, 找出最相关的内部政策, 提出候选风险解释和检测规则, 不得执行任何客户操作。

浙公网安备 33010602011771号