【手搓 Agent 第0关】认知扫盲篇(上):Agent 基本概念和循环

这个系列讲带领大家亲自搭建属于自己的 Agent,深入理解 Agent 是如何组合而成的。在系列的最开始,将对 Agent 相关基本概念进行介绍,分为上下两个章节带领大家完成以下学习目标:

本章将聚焦于前三个学习目标。

一、核心概念区分

想要从零搭建 Agent,第一步必须厘清各类 AI 形态的核心差异。很多开发踩坑、过度工程、方案选错,本质都是概念混淆。我们通过角色比喻、核心特征、适用场景,一次性彻底区分 Chatbot、Workflow、Agent、Multi-Agent 四种形态。

在这里插入图片描述
具体对比如下:

概念 角色比喻 核心特征 适用场景
Chatbot 前台客服 一问一答,依赖脑内知识,没有手脚去操作系统,无自主规划与工具调用能力。 回答常规问题、文本润色、日常陪聊、固定话术应答。
Workflow 流水线工人 严格按照预设的 SOP(标准作业程序)执行,固定 A -> B -> C 线性流程,无动态决策、无自主纠错能力。 每日定时爬取新闻、固定格式的发票识别、规则稳定的标准化自动化任务。
Agent 高级助理 仅接收最终目标,可自主规划执行步骤,支持调用工具、联网检索、自主执行、结果校验迭代,具备动态决策能力。 调研竞品并撰写报告、复杂问题排查、个性化场景适配等开放式、多步骤复杂任务。
Multi-Agent 项目团队 多个具备不同专业技能的智能体互相协作、任务移交、交叉审查,分工完成超复杂大型任务。 虚拟软件公司(分工编码、测试、运维)、全流程企业智能化办公、多模块复杂业务处理。

二、Agent 的基本循环:Observe → Think → Act

Observe → Think → Act 是 Agent 的核心运行心脏,也是经典的 ReAct (Reason+ Act) 模式,是 Agent 区别于 Chatbot、传统 Workflow 的核心壁垒。所有智能体的自主工作能力,都源于这个无限循环的执行逻辑。

  • Observe(观察): 接收用户的指令,或者读取上一步工具执行返回的结果、系统报错信息,感知当前完整任务状态。

  • Think(思考): LLM 根据当前上下文状态,自主推理、规划下一步动作、判断所需工具与执行逻辑。这是传统 Workflow 完全不具备的动态决策能力。

  • Act(行动): 执行决策结果,调用对应工具、接口、代码,完成具体业务动作,产出阶段性结果。

在这里插入图片描述

场景模拟:智能体查询天气

  • Observe:接收到用户查询天气的指令,确认用户需求。

  • Think:判断该需求需要调用外部天气工具,无法仅凭模型固有知识回答。

  • Act:主动调用天气信息 API,获取实时天气数据并整理输出。

三、何时使用智能体?

1. 什么是智能体?

智能体(Agent)可以从多个角度进行定义。一些客户将智能体定义为完全自主的系统,这些系统能够在较长时间内独立运行,并使用各种工具来完成复杂任务。另一些客户则用这一术语来描述遵循预定义工作流程的规范性实现。Anthropic 将所有这些变体归类为智能体系统(agentic systems),但在架构上对工作流程(workflows)智能体(agents) 进行了重要区分:

  • 工作流程(Workflows):这类系统中,大语言模型(LLMs)和工具通过预定义的代码路径进行编排。
  • 智能体(Agents):这类系统中,大语言模型(LLMs)动态地指导自身的流程和工具使用,保持对任务完成方式的控制。

2. 何时使用/不使用智能体

总原则:优先选用最简方案,按需增加复杂度

  • 补充特性:智能体 / 复杂工作流会提升任务效果,但会增加延迟、拉高使用成本,需提前权衡取舍。
    在这里插入图片描述

分场景选型:

  1. 绝大多数常规场景:仅优化单轮 LLM 调用(检索 + 示例提示)即可,无需搭建工作流 / 智能体。
  2. 任务流程固定、规则明确:选择工作流,优势是结果可预测、稳定性强。
  3. 任务开放、需要灵活决策:选择智能体,适配动态变化的执行路径。
    • 复杂决策类:依赖人为细致判断、异常处理、上下文关联决策(例:客服退款审批)。
    • 规则难维护类:规则体系庞大冗余、更新成本高、极易出错(例:供应商安全审查)。
    • 非结构化数据类:需要解析自然语言、提取文档信息、持续对话交互(例:房屋保险理赔)

3. 何时以及如何使用框架

有许多框架可以简化智能体系统的实现,包括:

  • LangGraph(来自LangChain);
  • Amazon Bedrock 的AI Agent框架;
  • Rivet,一个拖放式图形用户界面(GUI)大语言模型(LLM)工作流程构建工具;以及
  • Vellum,另一个用于构建和测试复杂工作流程的GUI工具。

框架优劣势

  • 优点:封装 LLM 调用、工具解析、链式调用等底层操作,上手速度快
  • 缺点:新增多层抽象,遮挡提示词与返回结果,调试难度上升;容易诱导开发者过度设计,引入不必要的复杂度。

四、本篇总结 & 下期预告

本篇我们完成了 Agent 从零学习的核心基础认知:厘清了四类 AI 形态的边界、掌握了智能体核心运行循环、理解了 Agent 与传统工作流的本质区别。

但仅仅懂概念远远不够,开发 Agent 最大的难点从来不是「是什么」,而是「怎么选、怎么用、怎么落地不踩坑」。

下期 Stage0(下) 将聚焦工程落地实战,详解 Agent 选型原则、官方架构体系、五大经典工作流、安全护栏机制。

posted @ 2026-07-21 10:12  Alkaid2077  阅读(42)  评论(0)    收藏  举报