论文笔记:THE LANDSCAPE OF EMERGING AI AGENT ARCHITECTURES FOR REASONING, PLANNING, AND TOOL CALLING: A SURVEY
笔记:THE LANDSCAPE OF EMERGING AI AGENT ARCHITECTURES FOR REASONING, PLANNING, AND TOOL CALLING: A SURVEY
新兴人工智能智能体架构在推理、规划与工具调用方面的全景概览:一项综述
(来自学长建议:对于综述类文章,应当关注提炼其中出现的每一个具体的技术并对自己不熟悉的概念进行查找和记 录。)
重要概念与技术:
一些名词:
垂直架构。 在这种结构中,一个智能体充当领导者,其他智能体直接向其汇报。根据架构的不同,汇报的智能体可能只与主导智能体通信。或者,领导者可能是在所有智能体之间的共享对话中定义的。垂直架构的定义特征包括拥有一个主导智能体以及协作智能体之间明确的分工。
水平架构。 在这种结构中,所有智能体被视为平等,并参与关于任务的一个小组讨论。智能体之间的通信发生在一个共享线程中,每个智能体都可以看到其他所有智能体的消息。智能体也可以自愿完成某些任务或调用工具,这意味着它们不需要由主导智能体指派。水平架构通常用于那些协作、反馈和小组讨论对任务整体成功至关重要的任务。
ReAct:智能体首先就给定任务写出一个想法。然后它基于该想法执行一个动作,并观察输出。这个循环可以重复直到任务完成。
ReAct 方法展示了更高的有效性。它还提供了改进的人类互操作性和可信度,因为模型的整个思维过程都被记录下来。在 HotpotQA 数据集上进行评估时,ReAct 方法仅出现 6% 的幻觉
但模型可能会重复生成相同的想法和行动,无法产生新的想法来促使完成任务并退出 ReAct 循环。在执行任务过程中加入人类反馈可能会提高其在现实世界场景中的有效性和适用性。
RAISE:RAISE 方法建立在 ReAct 方法之上,增加了一个模仿人类短期和长期记忆的记忆机制 。它通过使用便签簿进行短期存储和一个包含类似先前示例的数据集进行长期存储来实现这一点。
RAISE 提高了智能体在较长对话中保持上下文的能力。 在效率和输出质量上都优于 ReAct。
RAISE 难以理解复杂逻辑,限制了其在许多场景中的实用性。此外,RAISE 智能体经常在其角色或知识方面产生幻觉。
补充:“ReAct 适合短任务,RAISE 适合长对话但易幻觉”
PS: RAISE 为什么难以理解复杂逻辑?为什么更容易产生幻觉?
ANS:
复杂逻辑理解困难
RAISE 依赖于“记忆机制”,包括短期记忆(便签簿)和长期记忆(历史示例库)。但当遇到需要多步推理、条件判断或抽象逻辑的任务时,它容易迷失在记忆片段中,无法像人类那样进行深度推理。就像你背了很多数学题,但遇到没见过的题型时,你可能不知道如何组合已有的知识。
更容易产生幻觉
由于 RAISE 严重依赖记忆中的“类似示例”,如果记忆库中没有足够准确或相关的例子,它就会“编造”内容来填补空白,这就产生了幻觉。尤其是在角色扮演或知识问答中,它可能会错误地“回忆”出不存在的情节或事实。
总而言之,就是被“记忆”限制了。
Reflexion:是一种单智能体模式,它通过语言反馈进行自我反思,与Raise和 ReAct 相比,这导致了成功率的提高以及幻觉的减少。要是,Reflexion 容易陷入"非最优局部极小解"。它还使用滑动窗口来处理长期记忆,而不是数据库。这意味着长期记忆的量受到语言模型令牌限制的限制。
滑动窗口:是一种只保留最近一段对话或记忆的方法,就像你只能记住最近几分钟的谈话内容一样。
PS:为什么滑动窗口会有限制?
ANS:
记忆丢失:一旦超出窗口大小,之前的对话内容就会被“遗忘”,无法再被参考。
依赖模型长度:窗口大小受限于语言模型的最大输入长度(比如 GPT-4 最多 32K token),所以无法处理非常长的任务或对话。
不适合长期依赖任务:比如写一本书、进行多轮复杂规划,滑动窗口会丢失关键的前文信息。
LATS:语言智能体树搜索(LATS)是一种单智能体方法,它通过使用树来协同规划、行动和推理,这种受蒙特卡洛树搜索启发的技术,将状态表示为节点,将采取行动表示为节点间的遍历。
蒙特卡洛树:这是一种“试错+学习”的搜索方法。就像你在迷宫中尝试多条路,记录哪些路走得通,哪些走不通,最后选择最优路径。
多智能体系统的成功要素:
论文指出,成功的多智能体系统通常具备以下一个或多个特征:
- 清晰的领导与分工
- 明确的领导者可以大幅减少智能体在协调和相互指挥上浪费的精力。
- 动态团队构建
- 根据任务的不同阶段,动态地引入或移除具有特定技能的智能体,确保团队始终由最合适的“专家”组成。AgentVerse 是这方面的典型。
- 结构化的沟通机制
- 为了避免无效的“闲聊”,需要设计高效的通信协议。
- MetaGPT 的解决方案是:要求智能体输出结构化的成果(如文档、图表),而非非结构化的聊天;并采用 “发布-订阅” 机制,让智能体只接收与自己任务相关的信息。
- 专门的协作阶段
- 将任务执行划分为明确的阶段,如招募、协作决策、独立行动、评估(如AgentVerse),这能引导团队有条不紊地工作。
多智能体与单智能体的选择:
论文给出了一个清晰的决策指南:
- 选择多智能体当:
- 任务需要多个不同领域的专家(如编写一份技术文档,需要架构师、程序员、测试员)。
- 任务可以被分解并并行处理。
- 反馈和讨论对任务成功至关重要(如辩论、方案评审)。
- 选择单智能体当:
- 任务目标明确、工具固定。
- 需要简单、快速的实现。
- 担心多智能体系统中的“闲聊”和协调开销。
自己不熟悉的概念:
名词性:
API :应该用程序编辑接口,可以理解为“大手”,可以连接到XX的API从而来使用XX的功能
检索增强生成模式:也称为RAG 系统,可以检索问题->把检索到的资料和原始问题打包在一起->把打包给LLM干活。
鲁棒:遇到异常时,维持稳定性的能力。
LLM:大语言模型,可以理解为“文本预测器”,负责理解文字命令
规划:通常属于五种主要方法之一:任务分解、多计划选择、外部模块辅助规划、反思与精化以及记忆增强规划
AUTOGPT + P:AutoGPT + P(规划)是一种解决智能体用自然语言指挥机器人时推理局限性的方法 。AutoGPT+P 将目标检测和对象可供性映射与由 LLM 驱动的规划系统相结合。这使得智能体能够探索环境以寻找缺失的对象、提出替代方案或请求用户协助以实现其目标。*
*AutoGPT+P 首先使用场景图像来检测存在的对象。然后,一个语言模型使用这些对象从四个选项中选择要使用的工具:计划工具、部分计划工具、建议替代工具和探索工具。这些工具使机器人不仅能够生成完成目标的完整计划,还能探索环境、做出假设并创建部分计划。
AutoGPT+P 也有其缺点。工具选择的准确性各不相同,某些工具被不恰当地调用或陷入循环。
(PS:这里提到的这个东西更像是实例运用,和前面的四种方法(REACT/RAISE/REFLEXION/LATS)不是平起平坐的关系)
上面提到的计划工具、部分计划工具、建议替代工具和探索工具(也可以理解为上面的常用思考方式):
计划工具:生成一个完整的步骤序列来完成目标。
例子:“拿起杯子 → 走到厨房 → 把杯子放进水池”。
部分计划工具:当信息不全时,先制定一个初步计划,后续再补充。
例子:“先走到客厅,看看有没有钥匙,再决定下一步”。
建议替代工具:当目标无法实现时,提出替代方案。
例子:“如果没有咖啡,可以喝茶吗?”
探索工具:当环境不熟悉时,主动探索以获取更多信息。
例子:“在房间里转转,看看有没有隐藏的开关”。

浙公网安备 33010602011771号