Fork me on GitHub

RSI综述:Agent 的 RSI(递归自进化)与 Self-Evolving Agents

检索日期:2026-08-07
主题范围: Agentic AI 中由大模型驱动的 Agent 自进化、递归自改进(Recursive Self-Improvement, RSI)、自反思、自奖励、自课程、自动工作流优化、自动科研与安全治理。

1. 执行摘要

Agentic AI 的“自进化”研究正在从早期的 test-time self-refinement,快速转向更接近 RSI 的闭环系统:Agent 不仅修改一次性输出,还会修改自身的记忆、上下文、工具调用策略、工作流、评估器,甚至代码化的 Agent 架构。严格意义上的 RSI 指系统能够持续参与自身能力提升,并使下一代系统具备更强的自我改进能力;当前主流论文尚未证明无边界、开放式智能爆炸,但已经在若干可验证任务中展示了“局部、受约束、可评估”的递归增益。

从文献格局看,顶尖研究可以分为五个层级。第一层是输出级自修正,代表为 Self-Refine 与 Reflexion,核心资产是语言反馈和短期/情景记忆。第二层是上下文与记忆自进化,代表为 ACE、RSEA、ALMA,核心资产从 prompt 升级为可累计的 playbook、skill library 或可执行 memory design。第三层是工作流/脚手架自优化,代表为 STOP、GPTSwarm、AFlow、ADAS、RHI,系统开始修改 Agent loop、图结构、节点提示词与代码化工作流。第四层是训练与反馈闭环,代表为 Self-Rewarding Language Models、Agent0、Agent0-VL、RLEF,重点是自生成任务、自奖励、自验证或执行反馈驱动的策略学习。第五层是自动科研与算法发现,代表为 The AI Scientist、AlphaEvolve、Darwin Gödel Machine(DGM),系统在“提出假设-写代码-运行实验-评估-迭代”的链条中承担越来越多的研发职能。

综合判断:短期可落地价值最高的是“可验证任务中的受控自进化”,特别是代码、数据分析、客服运营、研发自动化和垂直知识工作。中长期竞争焦点不在单个模型参数,而在“模型-工具-记忆-评估器-工作流”的协同优化能力。最大风险来自评价信号失真、上下文退化、模型塌缩、奖励黑客、不可审计的自改代码和跨 Agent 扩散。优秀架构应采用外部可验证信号、held-out gate、审计日志、沙箱执行、人类审批边界与回滚机制,而不是依赖 Agent 的内生自信评分。

2. 概念边界:从 Self-Refine 到 RSI

本文将“Agent 自进化”定义为:Agent 在任务执行后,基于环境反馈、执行轨迹、评估器或自身生成的反思,更新影响未来行为的持久性资产。该资产可以是输出、prompt、memory、workflow、tool policy、reward model、训练数据、代码或研究路线。

RSI 则是更强的子集。2026 年的综述将相关工作按“改进对象”和“闭环程度”区分:系统可能改进部署时行为、训练策略、评估器或研究过程;闭环程度从 human-in-the-loop 到 fully closed loop 不等。Chen et al., 2026 特别指出,开放式 RSI 仍受制于 grounding、collapse dynamics 与 compute constraints,而每个自改进循环本质上都在声称“某种评估信号可以替代人类判断”。这一观点非常关键:RSI 的技术瓶颈往往不是“能否生成修改”,而是“能否可靠判断修改是否真正改进”。

最新 survey 也开始形成较一致的框架。Gao et al., 2025 用 “what to evolve, when to evolve, how to evolve” 组织 self-evolving agents:可进化对象包括模型、记忆、工具和架构;进化时点包括测试时、跨任务、持续部署阶段;进化机制包括标量奖励、文本反馈、单 Agent 与多 Agent 系统。Fang et al., 2025 则将自进化 Agent 抽象为 System Inputs、Agent System、Environment、Optimisers 四部分,强调其是 foundation model 静态能力与 lifelong agentic system 持续适应性之间的桥梁。

3. 技术谱系与关键论文

3.1 输出级自修正:低成本,但闭环较浅

Self-Refine 是早期重要基线。它让同一 LLM 扮演 generator、feedback provider 与 refiner,在不进行额外训练的情况下迭代优化输出;作者报告其在 7 类任务上平均带来约 20% 绝对性能提升。Madaan et al., 2023 的贡献在于证明“语言反馈-再生成”可作为通用 test-time 优化原语,但其改进主要作用于当前输出,长期记忆和跨任务迁移能力有限。

Reflexion 将反馈固化为 episodic memory。Agent 根据任务反馈生成 verbal reflection,并在后续 trial 中复用,从而在 HumanEval、ALFWorld 等任务上显著提升表现。Shinn et al., 2023 的关键价值是把强化学习中的 reward update 替换为语言记忆更新,使 Agent 可以在不改权重的情况下从 trial-and-error 中学习。其局限是反馈质量和记忆检索策略高度决定上限,且错误反思可能被反复放大。

RISE 进一步尝试通过 fine-tuning 教会 Agent “如何自我修正”。Qu et al., 2024 提出 Recursive IntroSpEction,让模型在获得更多交互或计算预算后连续改进自己的响应。这类工作把“会反思”从 prompt 技巧推进为模型能力,但仍依赖训练数据设计和任务反馈可得性。

3.2 记忆与上下文自进化:从 prompt 到 playbook

Voyager 是 embodied lifelong learning 的标志性工作。该系统在 Minecraft 中通过自动课程、可执行 skill library 与环境反馈驱动的 iterative prompting,不经人工干预持续探索并积累技能;论文报告其获得的独特物品数、探索距离和科技树解锁速度均显著优于既有方法。Wang et al., 2023 的核心启示是:当技能以可执行代码形式保存,Agent 的经验可以具备组合性和可迁移性。

ACE(Agentic Context Engineering)把上下文视为可演化 playbook,通过 generation、reflection、curation 累积和组织策略,避免迭代摘要中的 brevity bias 与 context collapse。Zhang et al., 2025 报告 ACE 在 Agent 与金融基准上分别带来 10.6% 与 8.6% 的平均提升,并可利用自然执行反馈进行无标签适应。对企业应用而言,这类方法具有较高实用性,因为它无需重训模型,却能把组织流程知识沉淀为可审计上下文资产。

RSEA 直接面向“递归自进化 Agent”的评估可靠性问题。它维护 strategy、skills、playbook 三层自然语言状态,从自身轨迹中重写,并且只有在 disjoint held-out split 不退化时才提交候选更新。Nguyen et al., 2026 的重要发现是:没有任何一种 context artifact 在所有基准上通胜;未经门控的上下文进化方差高且可能崩塌,而严格 held-out selection 可以使递归更新更接近“单调安全”。

ALMA 将自进化推进到 memory design 本身。Xiong et al., 2026 让 Meta Agent 以可执行代码搜索记忆模块的 schema、检索与更新机制,在多个 sequential decision-making 域中优于人工设计记忆。其战略意义在于,未来 Agent 的核心差异化可能不只是“记住什么”,而是“自动发现怎样记、何时忘、如何检索”。

3.3 工作流、图结构与脚手架自优化:接近工程化 RSI

STOP 是 RSI 语境中的重要里程碑。它从一个 seed improver 出发,用语言模型驱动的 scaffolding program 改进任意输入程序,再递归地用该 improver 改进自身。Zelikman et al., 2023/2024 展示了固定 LM 也可以通过改写外部脚手架获得更强求解能力。它的边界也很清楚:系统主要优化 scaffolding code,而非基础模型权重;收益依赖明确定义的 utility function。

GPTSwarm 将语言 Agent 形式化为可优化计算图:节点执行函数或调用 LLM,边定义信息流,复合图代表多 Agent 协作。Zhuge et al., 2024 提出节点 prompt 优化与边连接优化,使 Agent orchestration 本身成为搜索对象。该工作为“Agent 架构即程序、程序即可优化”的范式奠定了工程语言。

AFlow 将 agentic workflow generation 表述为代码化工作流空间中的搜索问题,使用 Monte Carlo Tree Search、执行反馈与代码修改迭代优化工作流。Zhang et al., 2024/2025 在六个基准上报告平均 5.7% 提升,并使较小模型在部分任务上以更低成本超过 GPT-4o。其商业含义是:企业未必总要购买最强模型,工作流自优化可以在固定模型预算下提升 ROI。

ADAS 提出 Automated Design of Agentic Systems,并用 Meta Agent Search 自动编程产生新的 Agent 设计。Hu et al., 2024 的论点更激进:历史上手工特征和手工架构常被学习型方法替代,Agent 系统设计也可能被自动化。该方向与 DGM 形成连续谱:从自动设计 Agent workflow,到自动改写 Agent codebase。

RHI(Recursive Harness Self-Improvement)关注 model-harness co-evolution:harness 不只是推理脚手架,也是未来训练轨迹的数据生成器。Lee et al., 2026 将 harness 表示为 Agent loop 的 prompt-level specification,并用 pairwise feedback 迭代改进;作者在 30 个合成机器学习研究任务中报告,少量 RHI 迭代即可提高低 reasoning-effort Agent 的性能上限,并降低最高达 60% 的推理成本。该工作提示企业应把 Agent harness 当作“可持续优化的软件资产”,而非一次性 prompt。

3.4 自奖励、自课程与工具化验证:从反馈工程到训练闭环

Self-Rewarding Language Models 研究用 LLM-as-a-Judge 为自身生成奖励,并通过 Iterative DPO 同时提升 instruction following 与 reward quality。Yuan et al., 2024 提出了一个具有 RSI 味道的关键命题:如果模型要达到超越人类反馈上限的能力,未来可能需要超人类反馈信号。但该路线也最容易遇到 self-confirming feedback、reward hacking 与 judge drift。

Agent-as-a-Judge 将 LLM-as-a-Judge 扩展为 Agent-as-a-Judge,评估不再只看最终输出,而是覆盖 Agent 执行过程。Zhuge et al., 2024 在 DevAI 基准上展示 Agent Judge 比静态 LLM Judge 更接近人类评估,并可提供中间过程反馈。对自进化系统而言,评估器的 Agent 化是必要步骤,但它也引入成本、延迟、隐私与共谋式评估风险。

Agent0 则构建了 curriculum agent 与 executor agent 的共演化闭环。Xia et al., 2025 从同一基础 LLM 初始化两个 Agent:课程 Agent 生成更具挑战性的 frontier tasks,执行 Agent 学会求解;工具集成提升执行者能力,反过来迫使课程 Agent 生成更复杂任务。论文报告 Qwen3-8B-Base 在数学推理和通用推理上分别提升 18% 与 24%。Agent0-VL 将该思想扩展到视觉语言推理,通过工具化验证、自修复和 self-reward 实现零外部奖励的多轮提升。Liu et al., 2025

RLEF 代表执行反馈驱动的训练范式。Gehring et al., 2024/2025 在代码生成中使用 reinforcement learning 教模型利用 execution feedback,减少样本需求并提升 competitive programming 表现。其可靠性高于纯语言自评,因为编译器、测试用例和运行结果提供了更强 grounding。

3.5 自动科研与算法发现:最高价值,也最需要治理

The AI Scientist 试图自动完成机器学习研究生命周期:提出研究想法、写代码、运行实验、可视化结果、撰写论文并进行模拟评审。Lu et al., 2024 后续 Nature 论文将其表述为端到端自动化科学流程,覆盖 ideation、literature search、experiment planning、implementation、analysis、manuscript writing 与 peer review。Nature, 2026 该方向的 RSI 价值在于把“改进 AI 的研究过程”也纳入闭环;风险在于低质量研究、自动评审偏差和科研污染。

AlphaEvolve 是工业界算法发现的重量级案例。Google DeepMind 将其描述为使用 Gemini 驱动的 evolutionary coding agent,通过自动评估器持续改进算法代码。Novikov et al., 2025 报告其优化了 Google 数据中心调度、硬件加速器电路设计,并加速了支撑 AlphaEvolve 的 LLM 训练;在数学与计算机科学问题上发现新的可证明算法,包括 4x4 复数矩阵乘法的改进。AlphaEvolve 的核心启示是:强 RSI 不一定先发生在通用对话场景,而可能先发生在“评价函数清晰、实验可自动执行”的高杠杆工程域。

DGM(Darwin Gödel Machine)更直接触及“自改代码”。Zhang et al., 2025 让系统维护一个生成的 coding agents archive,通过 foundation model 产生新变体,并用 SWE-bench、Polyglot 等基准经验验证;作者报告 SWE-bench 从 20.0% 提升到 50.0%,Polyglot 从 14.2% 提升到 30.7%。DGM 的贡献是把 Gödel machine 的理论自改进,转化为 Darwinian open-ended exploration 与 empirical validation。但它同样表明,自改代码必须配套沙箱、人类监督和回滚策略。

4. 关键论文矩阵

类别 代表论文 主要贡献 RSI 闭环程度 主要局限
输出级自修正 Self-Refine, 2023 同一模型生成反馈并迭代修改输出 缺少长期资产积累
语言反思记忆 Reflexion, 2023 verbal reflection + episodic memory 低-中 反思质量不稳定
具身 lifelong learning Voyager, 2023 自动课程 + 可执行技能库 依赖环境反馈与代码技能表示
递归脚手架 STOP, 2023/2024 improver 递归改写自身 scaffolding 中-高 utility function 窄,非模型权重自改
自奖励训练 Self-Rewarding LM, 2024 LLM 自评奖励 + Iterative DPO 中-高 judge drift 与 reward hacking
Agent 图优化 GPTSwarm, 2024 Agent 表示为可优化图 搜索空间与评估成本高
文本梯度 TextGrad, 2024 用自然语言反馈近似反向传播 反馈主观性与可重复性问题
LM 程序优化 MIPRO, 2024 优化多阶段 LM 程序的 instruction 与 demos 依赖代表性开发集
自动 Agent 设计 ADAS, 2024 Meta Agent Search 自动发明 Agent 安全与可解释性压力大
自动科研 The AI Scientist, 2024/2026 自动科研生命周期闭环 自动评审偏差与科研质量控制
执行反馈 RL RLEF, 2024 用代码执行反馈训练模型 中-高 主要适用于可执行验证任务
工作流搜索 AFlow, 2024/2025 MCTS 搜索代码化 Agent workflow 中-高 任务迁移与成本控制仍需验证
Agent 评估器 Agent-as-a-Judge, 2024 过程级 Agent 评估 评估器自身需被校准
算法发现 AlphaEvolve, 2025 进化式 coding agent 发现算法 依赖强自动评估器
自改 Agent code DGM, 2025 自改代码 + archive + empirical validation 必须沙箱化和严格监管
零数据共演化 Agent0, 2025 curriculum/executor 共演化 任务生成质量与外部泛化待验证
上下文 playbook ACE, 2025 上下文作为可演化 playbook context collapse 需治理
记忆设计元学习 ALMA, 2026 自动搜索 memory design 工程复杂度与审计难度
held-out 自进化 RSEA, 2026 严格 held-out gate 防退化 中-高 仍是自然语言状态进化
harness 自改进 RHI, 2026 优化 Agent loop harness 主要验证于合成研究任务

5. 方法论比较:什么在进化、何时进化、如何判断有效

第一,进化对象正在上移。 早期工作主要优化输出;随后优化 prompt、reflection、memory;最新工作优化 workflow、harness、Agent code、评估器和研究流程。越靠近系统结构层,潜在收益越大,风险和验证成本也越高。

第二,反馈信号决定天花板。 可执行测试、形式化 verifier、真实环境 reward 通常比 LLM 自评更可靠。Agent0-VL 和 RLEF 的共同启示是:工具不仅用于解题,也应用于自评和自修复。Chen et al. 的 RSI 综述也强调,验证信号强度与可证明自改进强度高度相关。Chen et al., 2026

第三,持久资产需要选择门控。 ACE、RSEA、DGM 等工作都表明,长期积累不是无条件写入。企业实践中应把每次自改进视为一次受控发布:有候选、有评估、有 held-out、有回滚、有审计。RSEA 对未门控 context evolution 的崩塌案例尤其值得重视。Nguyen et al., 2026

第四,自动化研发首先会在“可测量”场景突破。 AlphaEvolve、DGM、AFlow、RLEF 的共同点是都嵌入明确 evaluator:测试集、benchmark、编译器、仿真器、性能函数或数学验证。相反,开放式战略、审美、伦理和复杂组织决策更难闭环,因为评估器本身缺少稳定客观性。

6. 风险、失败模式与治理重点

模型塌缩是 RSI 的基础风险之一。Nature 论文显示,若后续模型不加区分地学习由其他模型生成的数据,会出现分布退化,即 model collapse。Shumailov et al., 2024 2026 年关于 self-improving limits 的研究进一步形式化指出,当外部 grounding signal 的比例趋近于零时,递归自训练会发生退化动力学。On the Limits of Self-Improving in LLMs, 2026

安全治理的核心不是禁止所有自进化,而是区分“可验证、可回滚、可审计”的自进化与“闭环失控”的自进化。Anthropic Institute 对 RSI 的讨论强调,如果 AI 系统能够构建后继系统,技术和治理层面都必须预先处理能力跃迁问题。Anthropic, 2026

建议采用以下治理原则:

  1. 外部信号优先。 优先使用测试、仿真、事实检索、形式化验证和人工抽检;LLM 自评只能作为弱信号。
  2. 分层权限。 允许 Agent 修改 prompt 和临时 memory,但对工具权限、代码、评估器、生产配置和训练数据写入设置审批。
  3. held-out gate。 所有持久性更新需通过未参与生成的验证集或线上灰度指标。
  4. 沙箱执行。 自改代码、工具调用和自动实验必须在隔离环境运行。
  5. 审计与回滚。 每次自进化需保留 diff、轨迹、评估结果和版本指纹。
  6. 反共谋设计。 生成器、评估器、奖励模型和验证器应尽量异构,避免同源偏差自我强化。
  7. 数据卫生。 标注 AI 生成数据来源,控制自生成数据在训练集中的比例,防止模型塌缩。

7. 商业化与组织启示

对企业而言,Agent RSI 的近期价值不在“完全自治 AGI”,而在可控场景中的持续性能复利。最具商业可行性的落点包括:软件工程 Agent 的代码修复与测试生成、数据分析 Agent 的指标诊断 playbook、客服 Agent 的流程优化、销售/运营 Agent 的策略库、科研与研发 Agent 的实验设计自动化,以及内部知识工作流的自动编排。

技术采购与自研评估不应只看基础模型榜单,而应评估四类能力:第一,Agent 是否能把执行经验沉淀为可复用资产;第二,是否能自动提出候选改进;第三,是否有强验证器筛选改进;第四,是否支持版本化、灰度和回滚。未来的 Agent 平台竞争,很可能从“谁的模型更强”转向“谁的自进化闭环更稳、更便宜、更可治理”。

8. 结论

Agentic AI 的自进化研究已经跨过概念阶段,进入“受约束 RSI”的工程化试验期。Self-Refine、Reflexion、Voyager 奠定了反馈、反思和记忆基础;STOP、GPTSwarm、AFlow、ADAS、RHI 证明工作流和脚手架可以成为被优化对象;Self-Rewarding、Agent0、RLEF 推进了自奖励和自课程;AlphaEvolve、DGM、The AI Scientist 则展示了自动科研和自改代码的高杠杆潜力。

然而,当前证据也清楚表明:自进化越接近闭环,越依赖高质量外部验证。没有 grounding、held-out gate 和审计机制的 RSI 很容易从能力复利变成错误复利。未来三年,顶尖 Agentic AI 系统的核心分水岭将是:能否在保持安全边界的同时,让 Agent 持续改进自身的上下文、记忆、工具、工作流和评估器,并把这些改进稳定转化为跨任务、跨场景的生产力。

参考文献

posted @ 2026-08-07 10:45  stardsd  阅读(224)  评论(0)    收藏  举报