01-现代Agent核心公式LLM加上下文加工具大脑眼睛手脚模型环境闭环
01-现代Agent核心公式:LLM+上下文+工具,大脑、眼睛、手脚与模型-环境闭环
本文是《深入理解AI Agent:设计原理与工程实践》(李博杰)读书系列第 1 篇。我是黒漂技术佬,主业在智慧农业和无人零售一线摸爬滚打,本系列我会用无人售货柜、农业物联网这些真实场景,把书里的硬核观点掰开揉碎讲给新手。
一、一个公式说清现代 Agent
如果要用一句话概括现代 AI Agent 的最小工程公式,那就是:
Agent = LLM + 上下文(Context)+ 工具(Tools)
看起来朴素得像初中代数,但这三个变量撑起了当下所有 Agent 产品——从 Claude Code 到 Manus,无一例外。作为工程师,理解这个公式的最好方式是分三层来看:
1. 直觉层:大脑、眼睛、手脚
- LLM 是大脑:负责推理、规划、决策,"想"这个动作全靠它;
- 上下文是眼睛:LLM 本身是被隔离在训练数据里的,它看不到今天的天气、不知道你的售货柜里还剩几瓶可乐,必须靠上下文把世界"喂"给它;
- 工具是手脚:LLM 只会输出文字,真正去查数据库、调摄像头识别、下发开门指令,靠的是工具调用(Tool Call)。
没有眼睛和手脚,大脑再聪明也只是个"缸中之脑";没有大脑,眼睛和手脚就是一堆无人调度的传感器和执行器。
2. 实现层:LLM / 上下文 / 工具
落到工程上,三者各有明确的载体:
| 组成 | 工程载体 | 无人售货柜场景例子 |
|---|---|---|
| LLM | GPT、Claude、Qwen、DeepSeek 等模型 API/私有化部署 | 客服与运维 Agent 的推理内核 |
| 上下文 | messages 列表、系统提示词、RAG 检索结果 | 设备实时状态、库存数据、用户身份 |
| 工具 | function calling 定义的接口 | 查库存、生成退款单、下发柜门开锁指令 |
3. 学术层:Policy / Observation Space / Action Space
书中还给了学术视角的对照:Agent 在学术语境下是一个 Policy(策略),它从 Observation Space(观察空间) 接收信号,向 Action Space(动作空间) 输出动作。对应关系是:
- Policy ≈ LLM(决定下一步做什么)
- Observation Space ≈ 上下文能看到什么
- Action Space ≈ 工具提供了哪些可执行动作
这个对照不是掉书袋。它揭示了一个重要的工程事实:提升 Agent 能力,往往不是换更大的模型,而是扩大观察空间(喂更对的信息)和动作空间(给更顺手的工具)。 这句话我先按下不表,后面系列文章会反复验证。
二、模型-环境闭环:Agent 是怎么"活"起来的
单次调用 LLM 是一问一答,不是 Agent。Agent 的本质是一个闭环:
┌─────────────────────────────┐
│ │
▼ │
┌─────────┐ 行动(Action) ┌─────────┐
│ Agent │ ───────────────▶ │ 环境 │
│ (模型) │ ◀─────────────── │ (Env) │
└─────────┘ 观察(Observation) ─────┘
- 观察:环境把最新状态(传感器数据、工具执行结果、用户消息)写进上下文;
- 决策:LLM 读取上下文,决定下一步——是继续调工具,还是给出最终答复;
- 行动:Harness(模型外层的工程脚手架)执行工具调用,改变环境;
- 新观察:环境变化后的结果再次进入上下文,循环往复,直到任务完成。
举个我们无人售货柜的真实例子。用户投诉"扫码开门拿了水但被扣了两次钱",后端客服 Agent 的闭环大概是这样跑的:
- 观察 1:用户消息 + 订单号进入上下文;
- 决策 1:LLM 判断需要先核对,调用
query_payment_records(order_id); - 行动 1:支付服务返回确实存在两笔扣款,一笔未回调冲正;
- 观察 2:工具结果回填上下文;
- 决策 2:证据确凿,调用
create_refund(pay_id, amount)并生成安抚话术; - 行动 2:退款单落库,回复用户,循环结束。
注意:LLM 全程没有"接触"过真实世界,它接触的始终是上下文里的世界表示。理解这一点,是理解后面上下文工程、KV Cache 的地基。
三、Model-Harness:模型之外还有个"驾驶员舱"
书中提出(或者说系统化了)一个关键结构——Model-Harness:
- Model:LLM 本体,封在 API 后面,你是动不了它内部权重的;
- Harness(原意是"马具/安全带"):包裹在模型外层的工程系统,负责构造上下文、注册工具、执行调用、维护循环状态、做权限校验和错误纠正。
一个直观的类比:LLM 是发动机,Harness 是整辆车——方向盘、仪表盘、刹车、变速箱。发动机再强,没有传动系统也跑不起来。Claude Code、Cursor 这类产品的差距,很大程度上不在模型,而在 Harness 的打磨程度。这也是为什么"模型之外的竞争力"这个说法在工程圈越来越流行。
四、业界印证:Manus 与 OpenClaw
两条业界动态可以佐证"观察空间+动作空间"的扩张逻辑:
- Manus 合并三条技术路线:Deep Research(深度检索)、Coding(写代码执行)、Computer Use(操作浏览器/电脑界面)被合并进一个 Agent。本质上就是把动作空间从"生成文本"扩展到"跑代码、开网页、点按钮",把观察空间从"搜索结果"扩展到"整个屏幕像素"。
- OpenClaw 把接口延伸到用户数字生活:通过 WhatsApp 等即时通讯入口和本地 Gateway,Agent 的触角直接伸进用户的聊天软件和本地设备。动作空间再一次突破——Agent 不再只是"替你查资料",而是"替你过日子"。
可以看到,Agent 的进化史就是观察空间与动作空间的扩张史,这正是学术层公式给的预言。
五、小结
- Agent 最小公式:LLM + 上下文 + 工具,三层理解分别是大脑/眼睛/手脚、Policy/Observation/Action、模型 API/上下文构造/工具接口;
- Agent 的灵魂是模型-环境闭环:观察 → 决策 → 行动 → 新观察;
- Harness 是模型之外的工程竞争力,Agent 好不好用,一半以上的功夫在 Harness;
- 扩大观察空间和动作空间,是比换更大的模型更划算的能力提升手段。
下一篇我们钻进这个闭环的心脏——ReAct 循环,聊聊为什么"提示工程"正在演变成"Loop 工程"。

浙公网安备 33010602011771号