Agent 学习笔记 00:从聊天机器人到 Agent,先搭一张智能体应用地图
这本《从零开始学 Agent》给我的第一印象,是它没有把 Agent 写成一个孤立的热点概念。它从大语言模型、工具调用和记忆讲起,往后延伸到 RAG、上下文工程、Harness、Skill、多 Agent、通信协议、安全、部署,最后落到编程助手、数据分析 Agent 和多模态 Agent 三个项目。
这条路线很适合回答一个现实问题:为什么有些 Agent Demo 看起来很聪明,一上线就不稳定?因为“能让模型回答问题”只是起点,真正的系统还要解决状态、行动、权限、评估和运行成本。
先区分几个容易混淆的词
| 名称 | 主要职责 | 人在其中的位置 |
|---|---|---|
| 基座模型 | 根据上下文生成或判断 | 提供语言与推理能力 |
| 聊天产品 | 提供对话界面与服务 | 人主动提出问题 |
| Agent | 根据目标选择步骤并执行动作 | 人给目标,系统完成过程 |
| Tool | 让 Agent 访问外部世界 | 提供受限动作 |
| Harness | 约束、观察和保护 Agent | 给 Agent 加运行边界 |
| Trace | 记录一次运行经过的步骤 | 支持排错和评估 |
如果只看到模型的回答,就容易把所有能力都归功于“模型很聪明”。但真实 Agent 的结果通常来自一条更长的链:模型做判断,工具提供事实,状态保存进度,程序负责校验,Harness 负责限制风险。
Agent 的基本循环
可以先用一个简化流程理解 Agent:
目标 -> 感知当前信息 -> 规划下一步 -> 调用工具 -> 观察结果
-> 继续行动或结束
普通聊天通常只有“输入问题 -> 输出文字”两步。Agent 多了一个关键变化:输出不一定是给人的文字,也可能是一项动作。动作一旦会修改数据、发送消息或花费资源,系统的安全要求就完全不同了。
这本书的六段学习路线
第一段讲入门和模型基础,解决“Agent 是什么、模型能做什么”。第二段讲工具、记忆、规划、RAG、上下文和 Harness,解决“Agent 怎样完成复杂任务”。第三段讲 LangChain、LangGraph、OpenClaw、Claude Code 等框架和产品,解决“怎样把概念落到代码和系统”。
第四段进入多 Agent 和通信协议,第五段讨论评估、安全与生产部署,第六段用三个综合项目把前面的组件串起来。
我觉得这个顺序很重要:先理解能力边界,再学习框架写法;先能解释系统为什么工作,再讨论怎样把它部署上线。
我准备带着四个问题读
每篇笔记我都会反复追问四件事:
- 数据从哪里来,哪些内容可以信任?
- 当前状态保存在哪里,什么时候更新?
- 下一步由固定工作流决定,还是由模型选择?
- 出错、超时、越权或成本失控时,谁负责把它停下来?
这四个问题比记住某个框架的类名更重要。API 会变,模型会换,但系统边界不会因为换了 SDK 就自动消失。
读这本书的一个提醒
书中有些章节讨论快速变化的产品、框架和训练方法。阅读时我会把“书里的当前版本”与“我今天能运行的版本”分开:概念可以作为地图,代码必须再对照项目仓库和官方文档。
接下来先从 Agent 的定义和发展开始。只有弄清楚 Agent 和聊天机器人到底差在哪里,后面工具、记忆和规划这些能力才不会变成一堆孤立名词。
参考资料:《从零开始学 Agent》在线书籍,内容按 2026 年 8 月 19 日 GitHub 主分支版本整理。

浙公网安备 33010602011771号