SkillRL:通过递归技能增强强化学习进化智能体

摘要

大型语言模型(LLM)智能体在复杂任务中展现出惊人的成果,但它们通常孤立运行,未能从过往经验中学习。现有的基于记忆的方法主要存储原始轨迹,这些轨迹往往冗余且包含大量噪声。这阻碍了智能体提取对泛化至关重要的、高级且可复用的行为模式。在本文中,我们提出了 SkillRL,一个通过自动技能发现与递归演化来弥合原始经验与策略改进之间差距的框架。我们的方法引入了基于经验的蒸馏机制来构建分层技能库 SkillBank、用于通用和任务特定启发式方法的自适应检索策略,以及一种递归演化机制,使得技能库能够在强化学习过程中与智能体的策略协同进化。这些创新显著减少了令牌占用,同时增强了推理效用。在 ALFWorld、WebShop 以及七个搜索增强任务上的实验结果表明,SkillRL 实现了最先进的性能,以超过 15.3% 的优势超越了强基线,并在任务复杂性增加时保持了鲁棒性。

代码可在 https://github.com/aiming-lab/SkillRL 获取。

1 引言

大语言模型(LLM)智能体(Yao等人,2022b; Shinn等人,2023)已通过自然语言与复杂环境交互,在各种复杂任务中展现出卓越能力,例如网络导航(Google,2025; OpenAI,2025b)和深度研究(OpenAI,2025c; Google,2024; Team等人,2025)。尽管取得了这些进展,但每次任务执行在很大程度上仍然是片段式的。当前的LLM智能体孤立运行,无法从过去的成功或失败中学习(Zhang等人,2025b),这严重阻碍了它们的进化。因此,一个根本性的挑战依然存在:智能体如何高效地从经验中学习,并将该知识迁移到其他任务?

参考图注

图 1: (a) SkillRL 流程概览。与先前存储原始轨迹并丢弃失败的方法(灰色虚线)不同,SkillRL 采用基于经验的提炼机制,将多样化的经验转化为结构化技能。(b) ALFWorld 验证集上的性能(Shridhar等人)。与原始的 GRPO 和记忆增强 RL 相比,SkillRL 实现了更快的收敛速度和更高的成功率。

现有的基于记忆的 LLM 智能体方法主要涉及在采样过程中将原始轨迹直接保存到外部数据库中,作为未来类似任务的参考(Shinn等人,2023; Zhao等人,2024)。虽然直观,但这些原始轨迹通常冗长且包含大量冗余和噪声(Chhikara等人,2025),使得模型难以提取关键信息。最近的工作尝试通过在线训练来压缩轨迹并更新记忆库(Zhang等人,2025b, 2026),提高了记忆效率。然而,这些方法仅仅是模仿过去的解决方案,未能提炼核心原则或调整智能体的内部策略以利用记忆进行引导决策。如图 1(a) 中的虚线流程所示,此类方法通常难以在信息密度和噪声之间取得平衡,导致性能次优甚至下降,如图 1(b) 所示。

我们认为这些方法忽略了一个关键见解:有效的经验迁移需要抽象。人类专家不会记住每种情况下的每个动作;相反,他们会发展出技能(Anthropic,2024),即紧凑且可复用的策略,这些策略抓住了如何完成特定子任务的精髓。受此观察启发,我们提出了 SkillRL,一个通过自动技能发现和递归技能进化来弥合原始经验与高效策略改进之间差距的框架。

SkillRL 首先引入了一种基于经验的技能提炼机制,该机制从环境推演中收集多样化的轨迹,并应用差异化处理:成功的片段被保留为演示,而失败的片段则被合成为简洁的失败教训,以减少上下文噪声。其次,我们将这些经验转化为分层技能库 SkillBank,区分用于通用策略指导的通用技能和用于任务级启发式的任务特定技能。这种抽象使得智能体能够在决策过程中自适应地检索相关技能,显著减少了令牌占用空间,同时增强了推理效用。最后,SkillRL 在强化学习(RL)过程中融入了递归技能进化机制,其中技能库被视为动态组件而非静态知识源。通过在每个验证周期后分析失败模式以生成新技能或改进现有技能,我们的方法确保了技能库和智能体策略协同进化,随着任务复杂度的增加保持鲁棒性。如图 1(b) 所示,SkillRL 实现了显著更快的收敛速度和更高的渐近性能。

主要贡献是 SkillRL,一个使 LLM 智能体能够通过自动技能发现和递归进化来弥合原始经验与策略改进之间差距的框架。通过将冗余轨迹提炼成分层的 SkillBank,我们的方法抽象出通用和任务特定的技能,以高效地指导决策。此外,我们引入了一种递归进化机制,确保技能库和智能体策略在强化学习过程中协同进化。在 ALFWorld、WebShop 和七个搜索增强基准测试上的实证结果表明,SkillRL 实现了最先进的性能,提升了 15.3%,在任务成功率和推理效用方面均显著优于当前基于记忆的智能体调优基线。

2 预备知识

LLM 智能体。我们考虑一个在交互环境 \(\mathcal{E}\) 中运行的智能体。在每个时间步 \(t\),智能体观察到一个状态 \(o_{t}\in\mathcal{O}\),选择一个动作 \(a_{t}\in\mathcal{A}\),并收到一个奖励 \(r_{t}\) 和下一个观察 \(o_{t+1}\)。一条轨迹 \(\tau=(o_{0},a_{0},r_{0},\ldots,o_{T},a_{T},r_{T})\) 捕获了一次交互片段。任务由自然语言描述 \(d\) 指定。一个由 \(\theta\) 参数化的基于 LLM 的智能体实现了一个策略 \(\pi_{\theta}(a_{t}|o_{\leq t},d,c)\),其中 \(c\) 代表额外的上下文(例如,技能、演示)。我们的目标是学习一个策略,在上下文长度约束 \(|c|\leq L_{\max}\) 下,最大化期望回报 \(\small\max_{\theta}\mathbb{E}_{\tau\sim\pi_{\theta}}\left[\sum_{t=0}^{T}\gamma^{t}r_{t}\right]\)

组内相对策略优化 (GRPO)。GRPO (Shao et al., 2024) 是一种强化学习方法,它通过使用组内相对奖励来优化策略,从而避免了训练评论家。对于每个查询 \(x\),模型采样 \(G\) 个响应 \(\{y^{(1)},\ldots,y^{(G)}\}\),这些响应被评分以获得奖励 \(\{R_{1},\ldots,R_{G}\}\)。GRPO 计算归一化优势,并使用 PPO 风格的裁剪目标 (Schulman et al., 2017) 更新策略:

\[\displaystyle\mathcal{J}_{\text{GRPO}}(\theta)=\mathbb{E}_{x,\{y_{i}\}}\Bigg[\frac{1}{G}\sum_{i=1}^{G}\min\Big(r_{i}A_{i} \displaystyle\text{clip}(r_{i},1-\epsilon,1+\epsilon)A_{i}\Big)-\beta D_{\text{KL}}(\pi_{\theta}\|\pi_{\text{ref}})\Bigg], \]

其中 \(\small r_{i}=\frac{\pi_{\theta}(y_{i}|x)}{\pi_{\text{old}}(y_{i}|x)}\) 是重要性比率,\(\small A_{i}=\frac{R_{i}-\text{mean}(\{R_{j}\}_{j=1}^{G})}{\text{std}(\{R_{j}\}_{j=1}^{G})}\) 是归一化优势,\(\epsilon\), \(\beta\) 是超参数,\(\pi_{\text{old}}\) 是当前更新前的策略。

3 SkillRL

在本节中,如图 2所示,我们提出了 SkillRL,这是一个旨在通过自动技能发现和递归进化来弥合原始交互经验与策略改进之间差距的框架。SkillRL 包含三个核心组件。首先,我们开发了一种基于经验的技能蒸馏机制,将冗余的轨迹转化为简洁、可操作的知识。其次,我们将这些蒸馏后的经验组织成一个分层技能库 \(\mathcal{S}\),以实现对通用和特定任务专业知识的有效检索。最后,我们引入了一种递归技能进化机制,该机制利用强化学习,与智能体的策略同步动态优化技能库。我们详细阐述这些组件如下:

请参阅图注

图 2:SkillRL 框架概述。我们使用基础模型收集轨迹,将其蒸馏为分层技能库,执行冷启动 SFT 以实现技能利用,然后基于验证失败进行动态技能进化的强化学习训练。

3.1 基于经验的技能提炼

从环境交互中收集的原始轨迹 \(\tau\) 冗长繁杂,包含探索性动作、回溯和冗余步骤,这些内容掩盖了导致成功或失败的关键决策。为了将这些经验转化为可操作的知识,我们采用一个教师模型 \(\mathcal{M}_{T}\) 来将轨迹提炼成紧凑、可重用的技能。

具体而言,我们首先在目标环境 \(\mathcal{E}\) 中部署一个基础的 LLM 智能体 \(\pi_{\text{base}}\) 来收集多样化的轨迹。与先前仅保留成功片段的方法不同,我们有意同时保留成功轨迹 \(\mathcal{T}^{+}=\{\tau_{i}:r(\tau_{i})=1\}\) 和失败轨迹 \(\mathcal{T}^{-}=\{\tau_{i}:r(\tau_{i})=0\}\),其中 \(r(\tau)\) 表示二元任务成功指示器。失败轨迹揭示了失败模式和边界条件,即仅从成功案例中难以推断的信息。

我们根据轨迹结果应用差异化处理。对于成功轨迹 \(\tau^{+}\in\mathcal{T}^{+}\),我们提取导致任务完成的策略模式:

\[\small s^{+}=\mathcal{M}_{T}(\tau^{+},d) \]

教师模型识别关键决策点、正确行动背后的推理,以及可超越特定任务实例进行泛化的模式。

对于失败轨迹 \(\tau^{-}\in\mathcal{T}^{-}\),由于其长度和噪声,直接将其纳入上下文是不可行的。相反,我们合成简洁的失败教训:

\[s^{-}=\mathcal{M}_{T}(\tau^{-},d) \]

该分析识别:(1) 失败点,(2) 错误的推理或行动,(3) 本应采取的行动,以及 (4) 防止类似失败的一般原则。这将冗长的失败片段转化为反事实。

3.2 分层技能库(SkillBank)构建

遵循智能体技能的设计原则(Anthropic,2024),我们将提炼出的知识组织成一个分层技能库 SkillBank,以便在决策过程中高效检索相关专业知识。

技能组织。

我们将 SkillBank 组织为两个层级:1) 通用技能 \(\mathcal{S}_{g}\) 捕捉适用于环境中所有任务类型的通用策略原则。这些通常包括探索策略(例如,系统性的搜索模式、优先访问未探索的位置)、状态管理原则(例如,在执行动作前验证前置条件)以及目标跟踪启发式方法(例如,维护进度计数器、仅在验证完成时终止)。通用技能提供了可跨不同任务类别迁移的基础性指导。2) 任务特定技能 \(\mathcal{S}_{k}\) 为任务类别 \(k\) 编码了专门的知识。这些技能捕捉了特定领域的动作序列、任务特有的前置条件和约束、该任务类型独有的常见失败模式,以及利用任务结构的优化流程。通过在轨迹收集过程中按任务类型进行组织,我们能够提取细粒度的、特定类别的策略,以补充更广泛的通用技能。

完整的技能库 SkillBank 是 \(\mathcal{S}_{g}\cup\bigcup_{k=1}^{K}\mathcal{S}_{k}\)。每个技能 SkillBank 的结构包含:一个简洁的名称(例如,系统性探索)、一个描述该策略的原则,以及指定适用性的 when_to_apply 条件。这种格式既能实现高效的检索,又能为应用提供清晰的指导。

技能检索。

在推理时,给定任务描述 \(d\),智能体检索相关技能以增强其上下文。通用技能 \(\mathcal{S}_{g}\) 始终作为基础指导被包含在内。任务特定技能通过语义相似度进行检索:

\[\mathcal{S}_{\text{ret}}=\text{TopK}\left(\{s\in\mathcal{S}_{k}:\text{sim}(e_{d},e_{s})>\delta\},K\right), \]

其中 \(e_{d},e_{s}\) 分别是任务描述和技能的嵌入表示,\(\delta\) 是相似度阈值,\(K\) 控制检索技能的数量。策略随后基于检索到的技能进行条件化:

\[a_{t}\sim\pi_{\theta}(a_{t}|o_{\leq t},d,\mathcal{S}_{g},\mathcal{S}_{\text{ret}}). \]

值得注意的是,与原始轨迹相比,技能蒸馏实现了 10–20\(\times\) 的令牌压缩,同时增强而非降低了原始经验的效用。这种压缩使得智能体能够在有限的上下文窗口内利用丰富的经验知识。

算法 1 SkillRL:递归技能增强的强化学习

Require:  基础模型 \(\pi_{\text{base}}\),教师模型 \(\mathcal{M}_{T}\),环境 \(\mathcal{E}\)

Ensure:  训练后的策略 \(\pi_{\theta^{*}}\),进化的技能库 \(SkillBank{}^{*}\)

1:  \(\triangleright\) 基于经验的技能蒸馏

2:  \(\mathcal{T}^{+},\mathcal{T}^{-}\leftarrow\text{Rollout}(\pi_{\text{base}},\mathcal{E})\)

3:  对于所有 \(\tau^{+}\in\mathcal{T}^{+}\) 执行

4:  \(s^{+}\leftarrow\mathcal{M}_{T}(\tau^{+})\)

5:  结束循环

6:  对于所有 \(\tau^{-}\in\mathcal{T}^{-}\) 执行

7:  \(s^{-}\leftarrow\mathcal{M}_{T}(\tau^{-})\)

8:  结束循环

9:  \(\triangleright\) 分层技能库构建

10:  \(\mathcal{S}_{g}\leftarrow\) 从蒸馏经验中提取的通用技能

11:  对于所有任务类型 \(k\) 执行

12:  \(\mathcal{S}_{k}\leftarrow\) 针对类别 \(k\) 的任务特定技能

13:  结束循环

14:  \(SkillBank{}\leftarrow\mathcal{S}_{g}\cup\bigcup_{k}\mathcal{S}_{k}\)

15:  \(\triangleright\) 通过强化学习进行递归技能进化

16:  // 冷启动初始化

17:  \(\mathcal{D}_{\text{SFT}}\leftarrow\mathcal{M}_{T}(\mathcal{E},SkillBank{})\)

18:  \(\theta\leftarrow\text{SFT}(\pi_{\text{base}},\mathcal{D}_{\text{SFT}})\);    \(\pi_{\text{ref}}\leftarrow\pi_{\theta}\)

19:  // 带有递归进化的强化学习

20:  对于 epoch \(=1\)\(N\) 执行

21:  对于所有任务 \(d\) 执行

22:   \(\mathcal{S}_{\text{ret}}\leftarrow\text{Retrieve}(d,SkillBank{})\)

23:   采样 \(\{\tau^{(i)}\}_{i=1}^{G}\sim\pi_{\theta}(\cdot|d,\mathcal{S}_{g},\mathcal{S}_{\text{ret}})\)

24:   计算 \(\{R_{i}\}_{i=1}^{G}\) 并通过 GRPO 更新 \(\theta\)

25:  结束循环

26:  如果是验证 epoch 则

27:   \(\mathcal{T}_{\text{val}}^{-}\leftarrow\) 失败的验证轨迹

28:   \(\mathcal{S}_{\text{new}}\leftarrow\mathcal{M}_{T}(\mathcal{T}_{\text{val}}^{-},SkillBank{})\)

29:   \(SkillBank{}\leftarrow SkillBank{}\cup\mathcal{S}_{\text{new}}\)

30:  结束条件

31:  结束循环

32:  返回 \(\pi_{\theta}\), SkillBank

3.3 递归技能演化

静态的技能库无法预知智能体将遇到的所有场景。随着策略的改进和对新状态区域的探索,智能体会面临现有技能无法提供足够指导的情况。我们通过在强化学习中引入递归技能演化来解决这一限制,使技能库和智能体策略能够共同进化。

冷启动初始化。在强化学习训练之前,我们解决一个关键挑战:基础智能体尚未学会如何有效利用技能。简单地向未改变的模型提供技能收益有限(Guo et al., 2025)。因此,我们执行一个冷启动监督微调阶段(Ouyang et al., 2022),其中教师模型 \(\mathcal{M}_{T}\) 生成 \(N\) 个技能增强的推理轨迹 \(\mathcal{D}_{\text{SFT}}=\{(d_{i},\mathcal{S}_{i},\tau_{i}^{*})\}_{i=1}^{N}\),展示如何在决策过程中检索、解释和应用技能。然后基础模型在这些演示上进行微调:

\[\theta_{\text{sft}}=\arg\min_{\theta}\mathcal{L}_{\text{CE}}(\mathcal{D}_{\text{SFT}};\theta) \]

其中 \(\mathcal{L}_{\text{CE}}\) 表示交叉熵损失。得到的模型 \(\pi_{\theta_{\text{sft}}}\) 既作为强化学习训练的起点,也作为 KL 正则化的参考策略 \(\pi_{\text{ref}}\)

递归技能演化。静态的技能库无法预知智能体将遇到的所有场景。随着策略的改进和对新状态区域的探索,智能体会面临现有技能无法提供足够指导的情况。我们引入递归技能演化来解决这一限制。该过程始于一个包含基线任务-行动原则的初始技能库。

在每个验证周期后,我们监控每个任务类别 \(C\) 的成功率 \(Acc(C)\)。为确保有针对性的增长,演化仅在 \(Acc(C)<\delta\) 的类别中触发。然后,我们使用一种考虑多样性的分层抽样策略收集失败的轨迹 \(\mathcal{T}_{\text{val}}^{-}=\{\tau_{j}:r(\tau_{j})=0\}_{j=1}^{M}\):轨迹按类别分组,根据失败严重程度(负奖励)确定优先级,并通过轮询抽样选择以保持类别熵。接着我们将分析这些样本来识别差距:

\[\mathcal{S}_{\text{new}}=\mathcal{M}_{T}(\mathcal{T}_{\text{val}}^{-},SkillBank{}) \]

提示教师模型:(1)识别当前技能未解决的失败模式,(2)提出新技能来填补这些空白,(3)建议对证明无效的现有技能进行改进。然后更新技能库:\(SkillBank{}\leftarrow SkillBank{}\cup\mathcal{S}_{\text{new}}\)

这就形成了一个良性循环:随着智能体的改进,它会遇到新的挑战,从而推动技能库的扩展,进而实现进一步的改进。

基于强化学习的策略优化。我们使用 GRPO 优化技能增强策略。对于每个描述为 \(d\) 的任务,智能体首先检索相关技能,然后从当前策略 \(\pi_{\theta}\) 中采样 \(G\) 条完整轨迹 \(\{\tau^{(1)},\ldots,\tau^{(G)}\}\)。每条轨迹 \(\tau^{(i)}\) 获得一个二元奖励 \(R_{i}=r(\tau^{(i)})\in\{0,1\}\),表示任务成功与否。每条轨迹的归一化优势值计算如下:

\[A_{i}=\frac{R_{i}-\text{mean}(\{R_{j}\}_{j=1}^{G})}{\text{std}(\{R_{j}\}_{j=1}^{G})} \]

策略根据以下公式更新:

\[\displaystyle\mathcal{J}(\theta)=\mathbb{E}_{d,\{\tau^{(i)}\}}\Bigg[\frac{1}{G}\sum_{i=1}^{G}\min\Big(\rho_{i}A_{i}\displaystyle\text{clip}(\rho_{i},1-\epsilon,1+\epsilon)A_{i}\Big)-\beta D_{\text{KL}}(\pi_{\theta}\|\pi_{\text{ref}})\Bigg], \]

其中 \(\rho_{i}=\frac{\pi_{\theta}(\tau^{(i)}|d,\mathcal{S}_{g},\mathcal{S}_{\text{ret}})}{\pi_{\text{old}}(\tau^{(i)}|d,\mathcal{S}_{g},\mathcal{S}_{\text{ret}})}\) 是在技能增强上下文中计算的重要性比率。以 \(\pi_{\text{ref}}=\pi_{\theta_{\text{sft}}}\) 为锚点的 KL 惩罚确保强化学习优化在提高任务性能的同时,保留已学习的技能利用能力。完整的训练过程总结在算法 1 中。

4 实验

表 1:在 ALFWorld 和 WebShop 上的性能表现。对于 ALFWorld,我们报告了每个子任务以及整体结果的平均成功率(%)。对于 WebShop,我们报告了平均得分和平均成功率(%)。∗ 表示从 (Feng et al., 2025) 复现的结果。最佳结果和次佳结果分别用红色和蓝色高亮显示。

method Alfword webshop
Pick Look Clean Heat Cool Pick2 All 得分 成功率
闭源 LLMs
GPT-4o 75.3 60.8 31.2 56.7 21.6 49.8 48.0 31.8 23.7
Gemini-2.5-Pro 92.8 63.3 62.1 69.0 26.6 58.7 60.3 42.5 35.9
Qwen2.5-7B-Instruct
Qwen2.5 33.4 21.6 19.3 6.90 2.80 3.20 14.8 26.4 7.80
基于提示的智能体或基于记忆的方法
ReAct∗ 48.5 35.4 34.3 13.2 18.2 17.6 31.2 46.2 19.5
Reflexion∗ 62.0 41.6 44.9 30.9 36.3 23.8 42.7 58.1 28.8
Mem0 54.0 55.0 26.9 36.4 20.8 7.69 33.6 23.9 2.00
ExpeL 21.0 67.0 55.0 52.0 71.0 6.00 46.3 30.9 11.2
MemP 54.3 38.5 48.1 56.2 32.0 16.7 41.4 25.3 6.40
SimpleMem 64.5 33.3 20.0 12.5 33.3 3.84 29.7 33.2 8.59
基于 RL 的方法
RLOO∗ 87.6 78.2 87.3 81.3 71.9 48.9 75.5 80.3 65.7
GRPO∗ 90.8 66.1 89.3 74.7 72.5 64.7 77.6 79.3 66.1
记忆增强的基于 RL 的方法
MemRL 62.8 38.5 22.2 12.5 8.00 0.00 21.4 29.5 9.20
EvolveR 64.9 33.3 46.4 13.3 33.3 33.3 43.8 42.5 17.6
Mem0+GRPO 78.1 54.8 56.1 31.0 65.0 26.9 54.7 58.1 37.5
SimpleMem+GRPO 89.5 36.3 60.0 50.0 64.9 26.3 62.5 67.8 46.9
SkillRL 97.9 71.4 90.0 90.0 95.5 87.5 89.9 85.2 72.7

表 2:在搜索增强 QA 任务上的性能表现。SkillRL 在 NQ 和 HotpotQA 上进行训练。† 和 ⋆ 分别表示域内和域外数据集。∗ 表示从 (Sun et al., 2025) 复现的结果。

方法 单跳 QA 多跳 QA 平均
NQ† TriviaQA⋆ PopQA⋆ HotpotQA† 2Wiki⋆ MuSiQue⋆ Bamboogle⋆
Qwen2.5-7B-Instruct
Qwen2.5∗ 11.6 35.6 1.20 16.4 22.2 4.80 14.4 15.2
CoT∗ 12.8 35.6 3.80 16.2 22.6 6.60 24.0 17.4
RAG∗ 27.4 58.2 17.8 25.8 23.2 9.40 16.8 25.5
Search-o1∗ 19.4 40.6 11.4 17.0 27.0 8.60 30.4 22.1
R1-Instruct 21.0 44.9 17.1 20.8 27.5 6.00 19.2 22.4
Search-R1 39.3 61.0 39.7 37.0 40.1 14.6 36.8 38.5
ZeroSearch 43.6 61.8 51.5 34.6 35.2 18.4 27.8 39.1
StepSearch - - - 38.6 36.6 22.6 40.0 -
EvolveR 43.5 63.4 44.6 38.2 42.0 15.6 54.4 43.1
SkillRL 45.9 63.3 45.9 43.2 40.3 20.2 73.8 47.1

我们在九个具有挑战性的 LLM 智能体基准测试上评估了 SkillRL:ALFWorld、WebShop 以及七个搜索增强的 QA 任务。我们的实验旨在回答以下问题:1) SkillRL 与最先进的方法相比如何?2) 每个组件的贡献是什么?3) 技能库在训练过程中如何演化?4) 技能是否加速了模型收敛?

4.1 实验设置

环境。ALFWorld (Shridhar et al.,) 是一个基于文本的游戏,与 ALFRED 具身人工智能基准对齐。智能体必须通过文本命令导航和与对象交互来完成家庭任务。WebShop (Yao et al., 2022a) 模拟网络购物。智能体在逼真的网络界面中导航,以查找并购买符合用户规格的产品。此外,我们还评估了 SkillRL 在搜索增强 QA 任务上的性能,包括单跳 QA 数据集(NQ (Kwiatkowski et al., 2019)、TriviaQA (Joshi et al., 2017) 和 PopQA (Mallen et al., 2023))以及多跳 QA 数据集(HotpotQA (Yang et al., 2018)、2Wiki (Ho et al., 2020)、MuSiQue (Trivedi et al., 2022) 和 Bamboogle (Press et al., 2023))。

基线。我们将 SkillRL 与四类竞争性方法进行比较。首先,我们包括闭源大语言模型,特别是 GPT-4o (OpenAI, 2024) 和 Gemini-2.5-Pro (Comanici et al., 2025),它们代表了通用推理和指令跟随的最先进水平。其次,我们评估基于提示的智能体或基于记忆的方法,包括 ReAct (Yao et al., 2022b) 和 Reflexion (Shinn et al., 2023),它们依赖于上下文提示进行多步推理,以及 Mem0 (Chhikara et al., 2025)、ExpeL (Zhao et al., 2024) 和 MemP (Fang et al., 2025),它们利用外部记忆或经验池来指导行为而无需参数更新。第三,我们考虑基于强化学习的方法,包括基于组的在线强化学习算法,如 RLOO (Ahmadian et al., 2024) 和 GRPO (Shao et al., 2024),它们通过对轨迹组的优势估计来优化策略。最后,我们与记忆增强的基于强化学习的方法进行比较,例如 EvolveR (Wu et al., 2025)、MemRL (Zhang et al., 2026),以及 Mem0+GRPO 和 SimpleMem (Liu et al., 2026)+GRPO 的组合,这些方法将持久记忆机制直接集成到强化学习优化过程中以处理长期依赖关系。对于搜索增强 QA,我们将 SkillRL 与 R1-Instruct、Search-o1 (Li et al., 2025)、Search-R1 (Jin et al., 2025)、ZeroSearch (Sun et al., 2025) 和 StepSearch (Zheng et al., 2025) 进行比较。

实现细节。我们使用 Qwen2.5-7B-Instruct (Bai et al., 2023) 作为我们的基础模型,并使用 OpenAI o3 (OpenAI, 2025a) 作为技能蒸馏和 SFT 数据生成的教师模型。对于强化学习训练,我们使用 GRPO,学习率为 \(1\times 10^{-6}\),批量大小为 16,组大小为 8,梯度累积步数为 4。我们设置 \(K=6\) 用于任务特定技能检索,设置 \(\delta=0.4\) 用于收集失败轨迹。有关训练超参数的更多详细信息,请参见附录 B.1

4.2 主要结果

与基线的比较。如表 1 所示,我们在两个基准测试中将 SkillRL 与基线方法进行了比较。我们的方法始终优于所有基线,关键观察结果如下:

  1. 显著优于基于提示的方法。SkillRL 在 ALFWorld 上取得了 89.9% 的成功率,在 WebShop 上取得了 72.7% 的成功率,大幅超越了最佳的基于提示的基线方法。这一差距表明,虽然上下文学习可以利用过去的经验,但它常常无法从冗长的轨迹中提炼出可操作的知识,或者从根本上调整智能体的策略。

  2. 优于普通强化学习。强化学习训练带来了显著的提升,但 SkillRL 始终优于标准的强化学习基线。与 PPO、RLOO 和 GRPO 相比,SkillRL 实现了最佳的整体性能。值得注意的是,由于 SkillRL 使用 GRPO 作为其基础优化器,其在 ALFWorld 上相对于 GRPO 的 12.3% 绝对提升(从 77.6% 到 89.9%)可直接归因于我们的技能增强机制,而非算法差异。在像 Cool 和 Pick2 这样的复杂子任务中,SkillRL 分别比 GRPO 高出 23.0% 和 22.8%,这证明结构化的技能先验有效地加速并增强了稀疏奖励环境中的策略学习。

  3. 优于记忆增强的强化学习。SkillRL 大幅超越了现有的记忆增强强化学习框架,这些框架在管理和更新经验的方式上有所不同。MemRL 仅使用强化学习来更新其记忆库,同时保持策略不变,无法适应复杂环境,在 ALFWorld 上仅获得 21.4% 的成功率。EvolveR 联合更新策略和记忆库,显示出改进(43.8%),但仍然受限于其对粗略轨迹存储的依赖。为了提供一个更具竞争力的基线,我们实现了 Mem0+GRPO,它将最先进的基于提示的记忆机制与优化的策略模型相结合。虽然这种混合方法将 ALFWorld 上的性能提升至 54.7%,WebShop 上提升至 37.5%,但它仍然大幅落后于 SkillRL(绝对成功率差距约 35.2%)。这些结果验证了我们的核心假设:有效的经验迁移需要高层次的技能抽象和协同进化的库,而不是简单的轨迹压缩或基于提示的记忆检索。

与闭源模型的比较。值得注意的是,如表 1 所示,使用 Qwen2.5-7B-Instruct 的 SkillRL 显著优于规模大得多的闭源模型。在 ALFWorld 上,我们的方法比 GPT-4o (OpenAI, 2024) 高出 41.9%,比 Gemini-2.5-Pro (Comanici et al., 2025) 高出 29.6%。这表明有效的技能学习可以弥补模型规模的不足,使较小的开源模型能够通过结构化的经验知识实现更优的任务性能。

在搜索增强问答上的性能。如表 2 所示,SkillRL 取得了 47.1% 的最先进平均分数,显著优于 Search-R1 (38.5%) 和 EvolveR (43.1%)。关键观察包括:1) 卓越的多跳推理能力:SkillRL 在像 Bamboogle 这样的复杂任务中表现出色,比 EvolveR 高出 19.4%。这表明分层技能能有效指导多步信息综合。2) 强大的泛化能力:尽管在有限的数据集(NQ, HotpotQA)上进行训练,SkillRL 在 TriviaQA 和 2Wiki 等 OOD 任务上仍保持了有竞争力的性能,证实了提炼出的搜索策略是与任务无关的。

4.3 分析

本节我们将详细分析每个模块的有效性以及技能演化动态。

消融研究。我们进行了消融实验以评估每个组件的贡献,结果如表 3 所示。根据结果:(1) 移除层次结构(即仅保留任务特定技能)会使 ALFWorld 上的性能下降 13.1%,WebShop 上下降 11.3%,这表明通用的策略原则提供了必要的基础指导。(2) 用原始轨迹替换技能库会导致最大的性能下降(高达 25%),这直接支持了我们的动机,即抽象优于记忆。原始经验引入了显著的冗余和噪声,阻碍了有效的知识迁移。(3) 冷启动 SFT 被证明至关重要(没有它性能下降 20%),这证实了基础模型在进入 RL 阶段之前,需要一个初始的显式演示阶段来学习如何自适应地检索和利用抽象技能。(4) 动态演化带来了 5.5% 的性能提升,它确保了技能库是一个动态组件而非静态数据库。这种协同演化使得智能体能够通过解决初始技能集未覆盖的新兴失败模式,迭代地完善其内部策略。

表 3:消融研究结果。我们报告了在 ALFWorld 和 WebShop 上的平均成功率(%)。

方法 ALFWorld WebShop
SkillRL 89.9 72.7
技能库消融
无层次结构 76.8 61.4
无技能库(原始轨迹) 61.7 50.2
训练流程消融
无冷启动 SFT 65.2 46.5
无动态演化 84.4 70.3

ALFWorld 上的逐任务分析表 1 按任务类型细分了 ALFWorld 的性能。提升最大的是 PickTwo(+23%)、Cool(+22%)和 Heat(+15%),这些是最具挑战性的任务,需要多步规划和状态跟踪。任务特定技能在这里尤其有价值,它们捕捉了诸如“当拾取两个物体时,在寻找第二个之前确认第一个已固定”等策略,以解决常见的失败模式。

技能库增长图 3 展示了技能库在训练过程中的演化情况。初始技能库包含 55 个技能(12 个通用技能,43 个任务特定技能)。通过动态演化,到训练结束时(第 150 步)增长到 100 个技能。增长主要由任务特定技能驱动(从 43 个增加到 80 个),而通用技能的增长则更为平稳(从 12 个增加到 20 个)。值得注意的是,我们观察到不同任务类别间的平衡扩展,确保了智能体为每个环境展开开发出专业化的专长。这种整体扩展反映了智能体不断增强其技能库并应对特定任务类型内多样化场景的能力。

参考标题

图 3:RL 训练期间技能库规模的演化。动态技能演化在验证检查点添加技能。

参考标题

图 4:原始记忆检索与我们提炼的技能抽象之间的提示长度(词元数)比较。SkillRL 在保持推理效用的同时,持续降低了上下文开销。

参考标题

图 5:ALFWorld 验证集上的成功率。递归技能演化显著加速了收敛并提升了整体性能上限。

上下文效率。为了评估技能抽象对推理开销的影响,我们在图 5 中比较了 SkillRL 与使用原始轨迹的记忆增强基线(Qwen2.5-7B with Raw Memory)的平均提示长度。结果显示,虽然原始记忆方法存在较高且波动的词元占用(平均约 \(\sim\) 1,450 个词元),但 SkillRL 保持了显著更精简的提示(平均 \(<\) 1,300 个词元),实现了约 10.3% 的上下文长度缩减。这种效率源于我们的提炼机制,它将冗长的环境交互压缩成高密度、可操作的技能。值得注意的是,SkillRL 在实现更优性能时所需的上下文比基于记忆的基线更少,这表明技能抽象有效地缓解了传统基于记忆的智能体中常见的上下文膨胀问题。

演化动态。图 5 展示了有和没有递归技能演化机制的强化学习训练曲线。我们观察到,虽然没有演化的 SkillRL 显示出稳定的改进,但带有技能演化的 SkillRL 表现出明显更高的学习速率和更优的渐近性能。具体来说,SkillRL 在 60 个训练步内实现了超过 80% 的成功率,而基线需要大约 90 步才能达到一个较低的峰值。这种收敛的加速表明,新技能的动态引入和现有技能的完善有效地为智能体提供了及时的策略指导,以克服局部最优。此外,更高的性能上限验证了技能库和策略的协同演化使得智能体能够适应日益复杂的任务场景,而这些场景是静态记忆方法无法解决的。

定性分析。为了进一步研究 SkillRL 如何利用学到的知识,我们在图 6 中可视化了在 ALFWorld 和 WebShop 上的推理过程。案例研究表明,我们训练后的智能体能够有效地从 SkillBank 中检索并执行相关技能来指导其决策。例如,在 WebShop 任务中,智能体调用通用策略如“优先处理核心关键词”以及任务特定启发式方法“聚焦关键查询”,以确保产品在有限预算内满足所有约束。类似地,在 ALFWorld 中,智能体协调层次化技能,即使用“渐进式目标分解”进行高层规划,并使用“先有物体后有器具”来避免常见的逻辑陷阱。这种通用技能和特定技能的无缝整合证实了智能体不仅仅是记忆轨迹,而是发展了对任务逻辑的结构化理解,从而实现更稳健和高效的问题解决。

参考标题

图 6:SkillRL 在 WebShop 和 ALFWorld 上的案例研究。这些示例展示了智能体如何在其推理过程中自适应地检索和整合通用技能与任务特定技能,以实现精确高效的任务执行。

5 相关工作

LLM 智能体。能力强大的 LLM 的出现,催化了自主智能体系统的快速发展 (Wei et al., 2026)。ReAct (Yao et al., 2022b) 交错进行推理与行动,实现了交互过程中的思维链式规划,而 Reflexion (Shinn et al., 2023) 则通过对过往失败的自我反思引入了语言强化。像 AutoGen (Wu et al., 2024) 和 CAMEL (Li et al., 2023) 这样的框架展示了通用的多智能体能力,具备自动化编排和多样化工具集成功能。虽然早期工作主要集中在编码或基础算术等受限任务上,但这些方法主要依赖于上下文学习 (ICL) (Dong et al., 2024)。然而,随着任务变得复杂,这些智能体难以扩展,因为它们将每次交互都视为孤立事件,并且必须在没有任何先验知识的情况下从头开始每个新任务。

智能体中的记忆机制。为了克服有限上下文窗口的限制以及智能体无法从经验中学习的不足,外部记忆架构已成为智能体设计的基石 (Hu et al., 2025; Wang, 2025)。早期系统主要采用静态的 RAG 范式或将原始轨迹存储为少样本示例 (Wang et al., ; Chhikara et al., 2025; Zhang et al., 2025a; Wang et al., 2024)。然而,原始轨迹通常包含大量 token,且存在显著的冗余和噪声,这可能导致性能下降。当前的研究已转向自我改进的记忆,将交互提炼为更高层次的见解或程序性提示 (Wang and Chen, 2025; Tang et al., 2025; Fang et al., 2025; Zhao et al., 2024; Ouyang et al., 2025; Wei et al., 2025)。尽管最近的一些工作探索通过在线训练更新记忆库以提高效率 (Zhang et al., 2025b, 2026),但许多现有方法仍然难以区分高价值经验与噪声,或者未能提炼出能够指导内部决策的核心原则。

智能体技能与强化学习的演进。智能体技能 (Anthropic, 2024) 是捕捉子任务本质的紧凑、可重用策略,其发展越来越多地通过持续学习 (CL) 和强化学习 (RL) 的视角来看待。传统的 CL (Parisi et al., 2019) 侧重于在预定义任务中保留知识,但自我进化的智能体 (Gao et al., 2025; Xia et al., 2025; Liu et al., 2025) 旨在开放环境中主动获取技能 (Fang et al., 2025; Wang et al., 2025)。虽然 RL 被广泛用于对齐 LLM (Schulman et al., 2017; Ouyang et al., 2022),或通过基于规则的验证器改进推理 (Shao et al., 2024),但由于稀疏奖励和长时程问题,将其应用于智能体技能仍然具有挑战性。与以往将记忆视为静态或辅助来源的记忆增强 RL 不同,最近的趋势表明,高效经验迁移的关键在于抽象 (Wu et al., 2025)。我们的工作在此基础上,将技能库视为与智能体策略共同演化的动态组件,利用 RL 通过递归失败分析来精炼结构化技能。

6 结论

我们介绍了 SkillRL,一个用于大语言模型智能体中技能增强强化学习的框架。通过将原始轨迹提炼成紧凑、可重用的技能,并在训练过程中实现动态技能演化,SkillRL 在 ALFWorld 和 WebShop 上实现了最先进的性能,同时使用的上下文量远少于基于记忆的方法。我们的工作表明,从经验到技能的抽象是构建能力强、样本效率高的智能体的一个强大原则。

附录

附录 A 提示词

在本节中,我们提供了贯穿我们框架不同阶段所使用的完整提示词模板。这些模板旨在确保跨不同环境时智能体行为的一致性和结构化数据生成。

A.1 智能体执行提示

以下提示用于在线推理阶段。这些模板为智能体提供了当前任务描述、先前交互的历史记录以及一组检索到的技能(经验)以指导其决策过程。这些提示明确要求在动作选择之前进行链式思维推理步骤。

提示 A.1:带技能的 ALFWorld 智能体执行
系统提示:
你是在 ALFRED 具身环境中操作的专业智能体。你的任务是:
## 检索到的相关经验
## 当前进度
在此步骤之前,你已经执行了 {step_count} 步。以下是你最近 {history_length} 次的观察以及你采取的相应动作:
你现在处于第 {current_step} 步,你当前的观察是:
你当前情况下的可允许动作是:[{admissible_actions}]。
现在轮到你采取一个动作了。你应该首先对当前情况进行逐步推理。这个推理过程必须包含在 <reasoning></reasoning> 标签内。一旦你完成了推理,你应该为当前步骤选择一个可允许的动作,并将其呈现在 <action></action> 标签内。
提示 A.2:带技能的 WebShop 智能体执行
系统提示:
你是在 WebShop 电子商务环境中操作的专业自主智能体。你的任务是:{task_description}。
## 检索到的相关经验
## 当前进度
在此步骤之前,你已经执行了 {step_count} 步。以下是你最近 {history_length} 次的观察以及你采取的相应动作:
你现在处于第 {current_step} 步,你当前的观察是:
你当前情况下的可允许动作是:[ {available_actions} ]。
现在轮到你为当前步骤采取一个动作了。你应该首先对当前情况进行逐步推理,然后仔细思考哪个可允许的动作最能推进购物目标。这个推理过程必须包含在 <reasoning></reasoning> 标签内。一旦你完成了推理,你应该为当前步骤选择一个可允许的动作,并将其呈现在 <action></action> 标签内。

A.2 技能生成与提炼提示词

这些提示词在技能发现和库初始化阶段使用。它们指导一个高能力的教师模型分析交互轨迹,识别失败模式,并将可重用、可操作的技能提炼成结构化的 JSON 格式。

提示词 B.1:从失败中动态发现技能
分析这些失败的 {env_description} 智能体轨迹,并建议要添加的技能。
失败轨迹:
现有技能标题:
生成 1-3 个有助于避免这些失败的可操作技能。每个技能必须包含:skill_id、title(3-5 个词)、principle(1-2 句话)、when_to_apply。skill_id 应唯一并遵循模式:"dyn_001"、"dyn_002" 等。
仅返回技能的 JSON 数组,不要有其他文本。
提示词 B.2:初始技能提炼(ALFWorld)
你是一位专家,擅长将智能体行为模式提炼成简洁、可操作的技能。分析这些来自在家庭环境(ALFWorld)中运行的具身 AI 智能体的成功和失败轨迹。
成功轨迹:
失败轨迹:
生成 8-12 个适用于所有任务类型的通用技能。这些技能应具备:1. 简洁;2. 可操作;3. 可迁移;4. 具备失败意识。重点关注:导航、物体操作、状态跟踪、错误恢复和容器交互规则。
仅返回 JSON 数组,不要有其他文本。
提示词 B.3:初始技能提炼(WebShop)
你是一位专家,擅长将智能体行为模式提炼成简洁、可操作的技能。分析这些来自在在线购物环境(WebShop)中运行的 AI 智能体的成功和失败轨迹。
成功轨迹:
失败轨迹:
生成 10-15 个通用技能。重点关注:搜索查询构建、产品选择启发式方法、选项配置(尺寸、颜色等)、约束验证、导航模式和价格处理。
仅返回 JSON 数组,不要有其他文本。

A.3 冷启动轨迹生成提示词

为了弥合基础模型与目标性能之间的差距,我们使用以下提示词来生成用于监督微调(SFT)的高质量合成轨迹。这些提示词指导教师模型解决任务,同时明确展示特定技能的应用,从而为学生模型提供清晰的学习信号。

提示词 C.1:合成轨迹生成(ALFWorld)
你是 ALFRED 具身环境中的专家智能体。你将收到一个任务和需要应用的相关技能。你的目标是生成一个成功的轨迹,以展示这些技能的正确使用。
你应该生成一个分步轨迹,该轨迹:
1. 适当地使用所提供的技能;
2. 在环境中采取符合实际的操作;
3. 成功完成任务;
4. 展现出良好的规划和系统性探索。
对于每一步,你应该:
\(\bullet\) 使用

附录 B 额外实验细节

B.1 超参数

表 4:SkillRL 的超参数。

超参数
冷启动 SFT
学习率 \(1\times 10^{-4}\)
批次大小 16
训练轮数 3
SFT 样本数 7,500 (AlfWorld) / 2,400 (WebShop)
RL 训练
学习率 \(1\times 10^{-6}\)
批次大小 64
KL 损失系数 0.01
无效动作惩罚系数 0.1
最大提示长度 6,000
最大响应长度 1,024
训练轮数 150
技能检索
Top-K 检索 6
验证间隔 5 步
更新阈值 \(\delta\) 0.4
分析的最大失败次数 10 (SR \(<\) 0.4) / 5 (SR \(>\) 0.4)
每次演化的最大新技能数 3

B.2 计算资源

所有实验均在配备8个NVIDIA H100 80GB GPU的集群上进行。训练时间:

  • 轨迹收集:3小时
  • 技能蒸馏:0.5小时
  • 冷启动SFT:2小时
  • RL训练:24小时

总运行时间:每个实验大约30小时。

附录 C 技能库图示

在本节中,我们为 ALFWorld 和 WebShop 环境提供了一些提炼技能和错误分类的示例目录。表 57 分别详细说明了为具身操作和基于网络的购物提炼的通用技能,强调了系统化探索和约束满足所需的可操作原则。此外,我们在表 6 和表 8 中对失败案例进行了结构化分析,这些表格对常见错误进行了分类,范围从 ALFWorld 中的空间推理循环到 WebShop 中的价格变动疏忽,同时列出了其根本原因和提出的缓解策略。

表 5:从 SkillBank 中提炼的 ALFWorld 技能示例(Shridhar 等人)。本表总结了从原始轨迹中推导出的通用模式和应用逻辑。

ID 技能名称 原则(可操作模式) 何时应用
通用探索与获取技能
gen_001 系统化探索 在重新访问之前,精确搜索每个合理的表面或容器一次;优先处理未探索的位置。 当目标计数未满足且存在未探索区域时。
gen_002 即时获取 一旦所需对象变得可见且可触及,立即拾取它。 首次视觉确认与目标相关的对象时。
gen_003 目标优先策略 拾取目标对象后,直接导航到已知的目标容器并放置它。 持有任何目标对象且目标位置已确定时。
状态改变与空间关系技能
gen_005 尽早使用状态改变工具 获取对象后,在放置之前立即使用最近的合适器具(加热/冷却/清洁)。 拾取需要改变温度或清洁度的对象后。
gen_006 建立空间关系 首先定位参考对象,如果需要则调整其状态,然后在指定区域搜索或放置。 任务包含"下"、"内"或"上"等介词时。
可靠性与错误恢复
gen_014 循环逃逸触发 如果最近 3-5 个动作没有改变状态,则切换到未尝试的搜索分支或动作类型。 连续多次观察到无进展后。
gen_015 行动前完整性检查 在执行操作命令之前,确认先决条件(手空闲、容量、电源)。 在发出任何可能合法失败的命令之前。

表 6:ALFWorld 中常见的智能体失败及缓解策略。

ID 失败描述 根本原因(为何发生) 缓解措施(如何避免)
err_001 冗余重访 缺乏对已探索区域的明确记忆;策略退化为局部循环。 维护探索地图;优先处理未访问的候选位置。
err_006 跳过状态检查 将对象存在与目标满足混为一谈;忽略清洁度/温度检查。 在放置前将状态前提条件检查集成到规划器中。

表 7:WebShop 导航的提炼技能示例(Yao 等人,2022a)。这些技能代表了智能体用于处理大规模产品搜索和约束满足的策略模式。

ID 技能名称 原则(可操作模式) 何时应用
搜索与查询工程
gen_001 优先核心关键词 包含产品类型、1-2 个功能属性和硬约束;省略次要描述符。 在发出首次搜索或优化过于具体的查询之前。
gen_002 迭代优化 调整关键词或应用网站过滤器,而不是重复相同的失败查询。 当结果不相关或多次搜索后仍重复时。
产品评估与验证
gen_003 点击前扫描 在打开链接之前,阅读结果中的标题、缩略图和价格以确保合理性。 在搜索结果页面上选择下一个要检查的产品时。
gen_004 尽早验证,快速放弃 在产品页面上立即检查类别、属性和价格;如果任何约束被违反,则离开。 在每个产品详情页面的首次观察时。
gen_006 确认隐藏属性 打开"描述"/"特性"部分以确保非可见规格(例如,材料)满足约束。 当约束从标题或变体列表中不明显时。
配置与交易
gen_005 设置必需变体 在评估价格或购买之前,始终选择必需的选项(尺寸、颜色等)。 确认产品匹配后,但在任何购买操作之前。
gen_007 检查变体定价 对于价格范围,选择确切的变体组合以验证特定价格在预算内。 每当价格随变体选择而变化或显示为范围时。
gen_013 果断购买 一旦在当前产品变体上确认了所有约束和价格,立即执行"立即购买"。 在当前产品变体上验证了所有约束之后。

表 8:基于网络的购物任务中的常见失败。

ID 失败描述 根本原因 缓解策略
err_001 查询中缺少约束条件 遗漏了尺寸或价格上限,导致结果集过大或不相关。 首先汇总完整的需求列表;确保每个硬性约束都包含在查询字符串中。
err_004 价格变动疏忽 在选择特定尺寸或颜色变体后,未能注意到价格变化。 在每次选项更改后、继续结账前,重新读取价格元素。
err_005 过早购买 未设置必选变体就点击“立即购买”,导致错误或购买错误商品。 在购买前,验证每个必填的下拉菜单/单选选项都已明确选择。
err_009 忽略库存状态 忽略禁用按钮或库存标签,试图购买缺货商品。 确认“加入购物车”按钮已启用,并且在选择后没有“缺货”信息。
err_011 赞助链接干扰 点击匹配度不高的广告,使工作流偏离了自然、合适的商品。 实施广告标签检测;优先考虑自然搜索结果,以获得更高的约束可靠性。

附录 D 额外案例

案例 1:WebShop 鞋类(功能约束)

任务:我想要一双男士黑色防滑工作鞋,尺码 10,橡胶底,价格低于 50.00 美元。

技能

[foo_002] 验证描述中的功能;[foo_004] 确认变体选择后的价格。

避免

[err_001] 遗漏价格上限;[err_003] 选择错误的产品类别。

智能体轨迹与技能引导推理

步骤 1

观察:WebShop 主页。

思考:根据 [gen_001],我将在查询中包含关键约束(类型、功能、颜色、价格)。

动作:搜索[男士 黑色 防滑 工作鞋 橡胶底 低于 50]

步骤 2

观察:结果:[1] 厨师鞋 38.99 美元;[2] 厨房鞋 42.50 美元;[3] 钢头靴 55.99 美元。

思考:[gen_003] 商品 [1] 在预算内且功能匹配。商品 [3] 超出预算(跳过)。

动作:点击[商品 1]

步骤 3

观察:产品页面。价格:35.99-45.99 美元。颜色:黑色、白色。尺码:7-12。

思考:[foo_002] 描述确认是橡胶底。现在选择黑色和尺码 10 [foo_003]。

动作:点击[黑色] \(\rightarrow\) 点击[10]

步骤 5

观察:已选择:黑色,尺码 10。价格更新为 38.99 美元。

思考:[foo_004] 38.99 美元 < 50 美元。所有约束(颜色、尺码、功能、价格)均满足。

动作:点击[立即购买]

结果:成功 — 以 38.99 美元购买。关键技能:[foo_002](验证),[foo_004](价格检查)。

案例 2:电子产品(带中止并重试的扬声器)

任务:我需要一个便携式蓝牙扬声器,防水,黑色,价格低于 30.00 美元。

技能

[ele_001] 约束丰富的搜索;[ele_004] 快速中止不匹配项;[gen_002] 迭代优化。

避免

[err_002] 在搜索中使用过于具体的变体名称;[ele_006] 避免点击循环。

智能体轨迹:处理缺失约束

步骤 1

观察:WebShop 主页。

思考:[ele_001] 打包所有必需属性:便携、蓝牙、防水、黑色、<30 美元。

动作:搜索[便携 蓝牙 扬声器 防水 黑色 低于 30]

步骤 2

观察:结果:[1] 防水扬声器 28.99 美元;[2] 迷你 LED 扬声器 19.99 美元;[3] 20W 扬声器 35.50 美元。

思考:[ele_005] 商品 [1] 匹配大多数关键词和价格。

动作:点击[商品 1]

步骤 3

观察:产品页面(商品 1)。颜色:蓝色、红色、绿色、军绿色。黑色不可用。

思考:[gen_004] 尽早验证,快速中止:没有黑色选项![ele_004] 立即中止以寻找其他候选。

动作:点击[返回搜索]

步骤 4

观察:返回搜索结果页面。

思考:[gen_002] 迭代优化。商品 [2] 19.99 美元是下一个最佳候选。

动作:点击[商品 2]

步骤 5

观察:产品页面(商品 2)。颜色:黑色、蓝色、红色。规格:IPX5 防水。

思考:[ele_002] 黑色可用!IPX5 确认防水。选择黑色。

动作:点击[黑色]

步骤 6

观察:黑色已选择。最终价格:19.99 美元。

思考:[ele_003] 19.99 美元 < 30 美元。所有规格(黑色、便携、防水)已验证。

动作:点击[立即购买]

结果:成功 — 通过早期退出有效处理了属性不匹配。应用的关键技能:[gen_004](快速中止),[ele_004](不匹配时中止)。

案例 1:ALFWorld 清洁任务(生菜 \(\rightarrow\) 水槽 \(\rightarrow\) 台面)

任务:清洗一些生菜并放在台面上。

核心技能

[cle_001] 分阶段有序计划(定位 \(\rightarrow\) 清洁 \(\rightarrow\) 放置);[cle_006] 使用位置先验知识(食物在冰箱里)。

避免的错误

[err_002] 跳过关闭的容器;[err_003] 忽略可见的目标物体。

步骤 1-3

观察:冰箱 1 是关闭的。动作:打开冰箱 1 \(\rightarrow\) 拿取生菜 1

推理:根据 [cle_006],食物可能在冰箱里。[gen_002] 一看到生菜立即拿取。

步骤 4-6

观察:到达水槽盆 1。动作:用水槽盆 1 清洗生菜 1

推理:根据 [cle_001] 阶段 2:带到水源处。[cle_003] 直接去水槽。

步骤 7

观察:到达台面 1。动作:将生菜 1 放入/放在台面 1 上

推理:根据 [gen_003] 目的地优先:立即放置清洗过的物体以完成任务。结果:成功(7 步)— 使用的技能:[gen_010](分解),[cle_003](水槽优先)。

案例 2:ALFWorld 加热任务(鸡蛋 \(\rightarrow\) 微波炉 \(\rightarrow\) 台面)

任务:加热一些鸡蛋并放在台面上。

核心技能

[hea_001] 首先确保获得确切目标;[hea_003] 打开-放置-加热顺序;[hea_004] 在拿到物体前不使用电器。

步骤 1-3

观察:台面 1(没有鸡蛋)\(\rightarrow\) 台面 2(找到鸡蛋)。动作:拿取鸡蛋 1

推理:[hea_004] 在持有物体前避免使用微波炉。[hea_002] 系统地搜索台面。

步骤 4-6

观察:微波炉 1 是关闭的。动作:打开微波炉 1 \(\rightarrow\) 加热鸡蛋 1

推理:[hea_003] 正确顺序:先开门,然后启动状态改变。

步骤 7-8

观察:鸡蛋已加热。动作:前往台面 1 \(\rightarrow\) 放置鸡蛋 1

推理:[hea_005] 加热后直接放置:无绕路移动到目标位置。结果:成功(8 步)— 使用的技能:[hea_001](目标优先),[hea_004](顺序控制)。

案例 3:ALFWorld 检查任务(铅笔 \(\oplus\) 台灯 \(\rightarrow\) 成功)

任务:在台灯下看铅笔。

核心技能

[loo_001] 寻找有灯的表面(书桌/边桌);[loo_002] 打开灯;[exa_001] 尽早配对物体(目标与工具共置)。

避免的错误

[err_003] 忽略可触及的目标;[loo_005] 防止动作循环(只切换一次)。

智能体轨迹:高效共置处理

步骤 1

观察:房间中央。可见:书桌 1/2,抽屉 1-3,边桌 1 等。

推理:[loo_001] 台灯通常放在书桌上。优先检查书桌 1,以便一次性找到铅笔和灯。

动作:前往书桌 1

步骤 2

观察:书桌 1 上:闹钟 1,台灯 1,铅笔 1。

推理:[exa_001] 成功共置!两个物体都在场。[exa_002] 在与工具交互前先拾取目标。

动作:从书桌 1 拿取铅笔 1

步骤 3

观察:持有铅笔 1。

推理:[loo_002] 切换灯的状态以满足"在光下"的条件。[exa_004] 单次切换规则确保无重复动作。

动作:使用台灯 1

结果:成功(最优 3 步)— 展示了卓越的空间推理能力和零浪费导航。关键技能:[exa_001](物体配对),[loo_001](空间先验知识)。

posted @ 2026-03-19 17:32  一介布衣、  阅读(546)  评论(0)    收藏  举报