【手搓 Agent 第0关】认知扫盲篇(上):Agent 基本概念和循环
这个系列讲带领大家亲自搭建属于自己的 Agent,深入理解 Agent 是如何组合而成的。在系列的最开始,将对 Agent 相关基本概念进行介绍,分为上下两个章节带领大家完成以下学习目标:
本章将聚焦于前三个学习目标。
一、核心概念区分
想要从零搭建 Agent,第一步必须厘清各类 AI 形态的核心差异。很多开发踩坑、过度工程、方案选错,本质都是概念混淆。我们通过角色比喻、核心特征、适用场景,一次性彻底区分 Chatbot、Workflow、Agent、Multi-Agent 四种形态。

具体对比如下:
| 概念 | 角色比喻 | 核心特征 | 适用场景 |
|---|---|---|---|
| Chatbot | 前台客服 | 一问一答,依赖脑内知识,没有手脚去操作系统,无自主规划与工具调用能力。 | 回答常规问题、文本润色、日常陪聊、固定话术应答。 |
| Workflow | 流水线工人 | 严格按照预设的 SOP(标准作业程序)执行,固定 A -> B -> C 线性流程,无动态决策、无自主纠错能力。 | 每日定时爬取新闻、固定格式的发票识别、规则稳定的标准化自动化任务。 |
| Agent | 高级助理 | 仅接收最终目标,可自主规划执行步骤,支持调用工具、联网检索、自主执行、结果校验迭代,具备动态决策能力。 | 调研竞品并撰写报告、复杂问题排查、个性化场景适配等开放式、多步骤复杂任务。 |
| Multi-Agent | 项目团队 | 多个具备不同专业技能的智能体互相协作、任务移交、交叉审查,分工完成超复杂大型任务。 | 虚拟软件公司(分工编码、测试、运维)、全流程企业智能化办公、多模块复杂业务处理。 |
二、Agent 的基本循环:Observe → Think → Act
Observe → Think → Act 是 Agent 的核心运行心脏,也是经典的 ReAct (Reason+ Act) 模式,是 Agent 区别于 Chatbot、传统 Workflow 的核心壁垒。所有智能体的自主工作能力,都源于这个无限循环的执行逻辑。
-
Observe(观察): 接收用户的指令,或者读取上一步工具执行返回的结果、系统报错信息,感知当前完整任务状态。
-
Think(思考): LLM 根据当前上下文状态,自主推理、规划下一步动作、判断所需工具与执行逻辑。这是传统 Workflow 完全不具备的动态决策能力。
-
Act(行动): 执行决策结果,调用对应工具、接口、代码,完成具体业务动作,产出阶段性结果。

场景模拟:智能体查询天气
-
Observe:接收到用户查询天气的指令,确认用户需求。
-
Think:判断该需求需要调用外部天气工具,无法仅凭模型固有知识回答。
-
Act:主动调用天气信息 API,获取实时天气数据并整理输出。
三、何时使用智能体?
1. 什么是智能体?
智能体(Agent)可以从多个角度进行定义。一些客户将智能体定义为完全自主的系统,这些系统能够在较长时间内独立运行,并使用各种工具来完成复杂任务。另一些客户则用这一术语来描述遵循预定义工作流程的规范性实现。Anthropic 将所有这些变体归类为智能体系统(agentic systems),但在架构上对工作流程(workflows) 和智能体(agents) 进行了重要区分:
- 工作流程(Workflows):这类系统中,大语言模型(LLMs)和工具通过预定义的代码路径进行编排。
- 智能体(Agents):这类系统中,大语言模型(LLMs)动态地指导自身的流程和工具使用,保持对任务完成方式的控制。
2. 何时使用/不使用智能体
总原则:优先选用最简方案,按需增加复杂度。
- 补充特性:智能体 / 复杂工作流会提升任务效果,但会增加延迟、拉高使用成本,需提前权衡取舍。
![在这里插入图片描述]()
分场景选型:
- 绝大多数常规场景:仅优化单轮 LLM 调用(检索 + 示例提示)即可,无需搭建工作流 / 智能体。
- 任务流程固定、规则明确:选择工作流,优势是结果可预测、稳定性强。
- 任务开放、需要灵活决策:选择智能体,适配动态变化的执行路径。
- 复杂决策类:依赖人为细致判断、异常处理、上下文关联决策(例:客服退款审批)。
- 规则难维护类:规则体系庞大冗余、更新成本高、极易出错(例:供应商安全审查)。
- 非结构化数据类:需要解析自然语言、提取文档信息、持续对话交互(例:房屋保险理赔)
3. 何时以及如何使用框架
有许多框架可以简化智能体系统的实现,包括:
- LangGraph(来自LangChain);
- Amazon Bedrock 的AI Agent框架;
- Rivet,一个拖放式图形用户界面(GUI)大语言模型(LLM)工作流程构建工具;以及
- Vellum,另一个用于构建和测试复杂工作流程的GUI工具。
框架优劣势:
- 优点:封装 LLM 调用、工具解析、链式调用等底层操作,上手速度快。
- 缺点:新增多层抽象,遮挡提示词与返回结果,调试难度上升;容易诱导开发者过度设计,引入不必要的复杂度。
四、本篇总结 & 下期预告
本篇我们完成了 Agent 从零学习的核心基础认知:厘清了四类 AI 形态的边界、掌握了智能体核心运行循环、理解了 Agent 与传统工作流的本质区别。
但仅仅懂概念远远不够,开发 Agent 最大的难点从来不是「是什么」,而是「怎么选、怎么用、怎么落地不踩坑」。
下期 Stage0(下) 将聚焦工程落地实战,详解 Agent 选型原则、官方架构体系、五大经典工作流、安全护栏机制。


浙公网安备 33010602011771号