2026年,AI工程化的四次范式跃迁——从Prompt到Loop,你在哪一层?
现状之痛:你调了100次prompt,加了一堆few-shot,设了temperature=0——输出还是不稳定。
读完你将:看清四级演进的完整地图,知道自己处在哪个阶段,以及下个阶段怎么升级。
一、一个尴尬的共识
2026年,LangChain年度调查揭了一个老底:约三分之一的受访者把「输出质量」列为Agent上生产的最大障碍,连续两年位居第一。在万人以上大企业中,幻觉与输出一致性被列为首要质量问题。
这不是模型的问题。GPT-4、Claude 4、Gemini 2.5——任何一个前沿模型的单次推理能力都已足够强。问题出在系统——你把模型放进了一个什么样的环境里?你有没有给它正确的上下文?有没有在它行动之前拦住错误?有没有在它行动之后检查结果?有没有让它在每次失败中学习?
过去四年,围绕「怎么让LLM按人的要求工作」,工程实践经历了四次范式跃迁。我今天用一张图、一个矩阵,帮你看清自己当前所处的阶段。
二、四级演进:从措辞手艺到系统工程

Level 1:Prompt Engineering(尚在摸索)
关注点:管一次说什么。把任务写成模型最易理解的格式,本质上是一门措辞手艺。
典型特征:
- 花大量时间调prompt、调temperature、加few-shot
- 每次模型升级都要重新调参
- 输出质量天花板低,不稳定
识别信号:你还在这层,如果你的Agent「换了一个模型就全崩了」。
Level 2:Context Engineering(多数人在此)
关注点:管模型每一步看到什么。Andrej Karpathy 在2025年明确提出这个范式:提示词工程低估了真实工作的复杂度,真正的功夫在于把正确的信息以正确的格式填进上下文窗口。
LangChain把它定义为「为LLM提供正确的信息与工具,使其能够完成任务」。Agent失败时,更多时候不是模型不够强,而是正确的上下文没有被传进去。
典型特征:
- 开始用RAG、知识库、工具调用
- 关注上下文窗口管理(写选压隔)
- 但依然依赖人工调试,缺乏系统化保障
识别信号:你开始搭知识库了,但Agent还是会「胡言乱语」。
Level 3:Harness Engineering(少数团队到达)
关注点:管系统如何保证按标准做。这个词在2025年底到2026年初正式成型。核心公式非常简单:
Agent = Model + Harness
Harness是Agent中除模型以外的一切。一个良好的驾驭层有两个目标:
- 提高Agent第一次就做对的概率(前馈,Guides)
- 提供在到达人眼之前尽可能自纠错的反馈回路(反馈,Sensors)
Böckeler把它抽象为一张2×2矩阵——按前馈/反馈 × 计算型/推理型分为四个象限。这就是我目前体系的理论底座。
典型特征:
- Maker/Checker分离,物理管道强制验证
- 结构化输出约束Schema
- 分层校验,计算型检查走前提,推理型检查走抽样
- 失败捕获→归类→进评测集→修规则的闭环
识别信号:你不再等「输出不稳定」再修——你在它输出之前就拦住了。
Level 4:Loop Engineering(前沿实践)
关注点:管系统如何在时间中持续做对、越做越好。Harness约束的是空间结构(模型周围包什么),Loop约束的是时间结构(运行如何随时间收敛与进化)。
三级循环嵌套:
- L1 任务内Agent循环(秒级):感知→推理→行动→观察→反思,提成功率
- L2 跨会话外循环(分钟级):每轮全新上下文启动,状态落盘,迭代至完成
- L3 学习循环/评估飞轮(天级):线上运行→失败聚类→转评测用例→修规则→回归验证
识别信号:你的系统不会在同一种错误上失败两次——每次失败都变成了一条新规则。
✅ 你读的这个公众号,整套体系就在Level 4。
三、Guides × Sensors 矩阵:你的体系在四个象限都有落地
这是报告里最实用的框架。Böckeler把一切控制手段放进一个2×2矩阵:
| 前馈(做之前约束) | 反馈(做之后检查) | |
|---|---|---|
| 计算型(确定性) | 价值实践卡校验 + STANDING.md铁律 | 4道物理管道 + auto-verify |
| 推理型(语义判断) | SOUL.md品牌DNA + 三阶叙事模板 | 写作评测集 + L3学习循环 |
我的体系现在在全部四个象限都有物理覆盖:
- A 计算型前馈 →
check_card_completeness.py+STANDING.md铁律注入 - B 推理型前馈 →
SOUL.md品牌DNA + 三阶叙事框架 - C 计算型反馈 →
validate_article.py/check_series_continuity.py/article_checker.py/publish_gate.py - D 推理型反馈 →
evals_writing.py写作评测集 +writing_lessons.mdL3学习循环
✅ 验证: 踩坑: 价值:▸ 跃迁——这四个符号不只是装饰,它们是每一篇文章必须穿过的物理门禁。
四、这三件事你今天就能做
不管你现在处在哪一层,三天内可以开始的三件事:
1. 如果你在Level 1-2:把一条核心SOP从prompt里拿出来,写成代码。比如不是告诉模型「先审核再发布」,而是在代码里写一个if审核通过才执行的检查点。这一步直接跳到Level 3。
2. 如果你在Level 3:建一个最小评估集。20个来自真实失败的任务就够了。把它接进你的开发节奏——所有改动上线前,必须跑一遍评估集不能退化。这就是Level 4的起点。
3. 无论你在哪一层:定义一条纪律——任何坏事发生两次,就必须变成一条规则。Hashimoto的原话:「坏事——让它永远不再发生;好事——让它可被工具验证。」
五、此刻的你
此刻的你,已经不再是那个「反复调prompt碰运气」的调试者。你正在成为一个能设计环境、定义标准、构建反馈回路的系统思考者。
真正的不稳定不是模型的脾气,而是系统的缺席。Harness给了系统骨架,Loop给了系统心跳。两者合在一起,你的Agent才能从「能用」进化到「敢用」。
在下一篇里,我们将回到OPC的操作系统层面,把这篇文章里提到的四级框架落地到你的工程体系中。我们看一个具体的案例——一个函数怎么穿过5层校验,把输出准确率从80%提到99.99%。
️ 实体:Harness Engineering, Loop Engineering, Agent工程化 价值:范式跃迁, 工程体系, 评估驱动开发 认知:从调参到设计系统 搜索关键词:四级演进, Guides矩阵, Sensors矩阵, 前馈反馈

浙公网安备 33010602011771号