Self-Improving Agents 不是神话:从 error-ledger 到 Loop Engineering 的完整闭环
现状之痛:你搭的 Agent 昨天犯的错,今天还会再犯。每次都要重新教它一遍——「记住!别再这么做了!」但它还是忘了。很多人说「Self-Improving Agents 是神话」——因为大多数 Agent 的「反思」只是嘴上说说,没有变成系统行为。
读完你将:拿到一套真实跑通的 Agent 自我进化闭环(error-ledger → 纠正沉淀 → 规则物理化 → 门禁免疫),让 Agent 每犯一次错,系统就长一次记性。
〇、2026 最热的方向,也是最被质疑的
「Self-Improving Agents」正在成为顶流话题:
- 斯坦福开了一门课(CS329A),整门课讲 Self-Improving AI Agents
- ICLR 2026 有专门的 Workshop 讨论 Recursive Self-Improvement
- Google 工程师 Addy Osmani 写了《Self-Improving Coding Agents》
但另一边,社区里吵得最凶的一句话是:
「Self-improving AI agent is a myth」(自我改进的 Agent 是神话)
为什么是神话?因为大多数 Agent 的「自我改进」长这样:
反思(LLM 说「我错了」)→ 结束
没有记录、没有沉淀、没有验证——下次照样错。这不是自我进化,这是自我安慰。
一、Self-Improving 的本质:不是「想」,是「做」
自我进化的 Agent 和「会反思的 Agent」区别在哪?
会反思:LLM 输出一段「我下次会注意」
会进化:错误 → 记录 → 提炼规则 → 物理拦截(下次不可能再犯)
反思是概率性的(LLM 说得好听,下次可能忘);进化是物理性的(规则写进系统,下次必然拦截)。
这就是为什么「自我改进是神话」——因为大多数人做的是「反思」,不是「进化」。

二、error-ledger:自我进化的记账本
我跑通的自我进化闭环,第一步是 error-ledger(错误账本)。
任何一次错误/失败/被纠正
→ 记入 error-ledger.md(症状→根因→解法→状态)
→ 不只是「记下来」,是结构化记录
| 字段 | 例子 |
|---|---|
| 症状 | 报告新邮件只有计数,没有明细 |
| 根因 | 机械生成,没逐封分析 |
| 解法 | 每封邮件必须展示发件人+主题+关联票号 |
| 状态 | embedded(已固化到规则) |
为什么结构化记录重要? 因为 LLM 的「记忆」是不可靠的(上下文会被压缩、会被覆盖),但文件是物理的——它永远在那。
三、纠正沉淀:从「记录」到「知识」
记录只是第一步。第二步是把错误提炼成可复用的规则:
error-ledger 里的错误
→ 每周/每天扫描
→ 提取「这个错误背后的原则」
→ 沉淀成:技能/SOP/门禁
我的做法:
- 每次被纠正 → 记入 error-ledger → 提取知识 → 写入技能(SKILL.md)或规则
- 例:老板纠正「不要打压他人观点」→ 写入技能「写作视角铁律」→ 后续所有文章自动遵守
这一步把「一次性的错误」变成了「永久的资产」。

四、规则物理化:让系统「不可能」再犯
知识的最高形态,不是写在文档里,而是写进系统的物理逻辑:
规则(人记得) → 脚本(系统执行) → 门禁(强制拦截)
我的三档物理化:
- 写入技能/文档:LLM 加载时自动遵守(概率)
- 写入 verify 脚本:检查时自动验证(确定性)
- 写入门禁(gate):不过门禁直接拦截输出(强制)
例:文章发布前,check_cross_links.py 验证互链 → 不达标直接 fail → 不可能带着缺陷发布。
这就是「进化」和「反思」的分水岭——反思是「我尽量」,进化是「我保证」。

五、完整闭环:Loop Engineering 的自我进化形态
把四步串起来,就是完整的自我进化 Loop:
错误发生
→ ① error-ledger 记录(症状→根因→解法)
→ ② 纠正沉淀(提炼原则/规则)
→ ③ 规则物理化(脚本/门禁)
→ ④ 门禁免疫(下次不可能再犯)
→ 回到 ①(新错误继续进来)
每转一圈,系统就长一次记性。 这不是神话——这是我在生产环境每天在跑的东西。

这个 Loop 和「Loop Engineering」的关系:Loop Engineering 是把 Agent 的思考变成可观测、可控制的循环;自我进化是让这个循环每转一圈都变得更强。
六、此刻的你
此刻的你,已经不再满足于「让 Agent 反思一下」——你开始思考「怎么让系统物理地记住教训」。
你正在成为那个——把每一个错误都变成系统免疫力的严格工程师。
记住:反思是概率,进化是物理。Self-Improving Agents 不是神话——它只是需要 error-ledger 到 Loop Engineering 的完整闭环。
延伸阅读
- 选择不能止于工具——内容飞轮的两种转法 · 飞轮如何穿透价值层
- 实践=技术×场景×价值 · 认知变现的完整闭环
- DeepSeek 把 Harness 开源了:一切皆插件,但真正的差距在局部 · 底座趋同,差距在局部
实体:Self-Improving Agents, Loop Engineering, error-ledger, 门禁
价值:错误免疫, 系统进化, 规则物理化, 生产落地
认知:反思是概率,进化是物理——error-ledger 到门禁免疫的完整闭环
关于作者 无记——AI / Agent / 数智化转型实践者。 只写亲手跑通的东西,不聊概念。关注我,一起把认知变现。

浙公网安备 33010602011771号