AI Agent
大厂企业级 AI Agent 标准 5 层架构
LLM 大脑层(核心)
- 用豆包、DeepSeek、通义、GPT 这类大模型。理解人类自然语言需求,任务拆解:把一个大需求拆成好几步小任务,逻辑推理、判断下一步该干什么,生成调用接口的参数、生成代码。
- 关键部分:提示词工程和大模型的选择方向。
LLM大模型类型及选型
- 模型选型不是 “唯强论”,而是 “场景适配 + 成本平衡”,复杂推理 / 决策:用强推理大模型,通用对话 / 逻辑任务:用均衡型通用模型,简单分类 / 格式提取:用轻量小模型。除此之外还要考虑:任务复杂度(是否需要多步推理,上下文),性能约束(延迟),成本与合规(高敏感数据要可私有化,调用API成本)
- 强推理模型(核心定位:高能力、高成本、高延迟):OpenAI o3 系列、DeepSeek-R1 / DeepSeek V4-Pro、Claude 3 Opus,推理能力顶尖(代码 / 数学 / 复杂逻辑题),上下文窗口大,成本和延迟都偏高。所以适合作为「决策节点」,处理占比不高但复杂度极高的任务。
- 通用均衡模型(核心定位:能力 / 成本 / 延迟平衡,企业主力):Claude 3.5 Sonnet、GPT-4o、DeepSeek V4-Flash、文心一言 4.0 / 通义千问 3.5 工具调用(JSON 输出)稳定性强
多模态 / 多轮对话体验均衡,成本和延迟处于中等水平 - 轻量小模型(核心定位:低延迟、低成本、高并发):Claude Haiku、GPT-4o-mini、开源小模型(Llama 3 7B / Qwen 2 7B / 通义千问 1.8B)延迟极低、并发能力强,调用成本极低,部分开源模型可私有化部署、零调用成本,把业务中的简单任务交给小模型处理,能直接大幅降低整体成本
- 7B/13B,B = Billion = 十亿,参数越多 → 记忆力越强、逻辑推理越强、懂的知识越多、越长文本理解越稳
deepseek模型
- DeepSeek-LLM:初代基座,强中文,开源
- Coder:代码专精,80+ 语言,开源。
- V 系列(V2/V3/V4):MoE 通用主力,V4-Pro 强推理、V4-Flash 高性价比,百万上下文,开源可私有化。
- R1:推理专精,数学 / 逻辑 / 代码极强,闭源 API。
- VL:多模态图文文档理解,开源
claude 模型(全闭源)
- Claude Opus(旗舰・最强推理),最新:Opus 4.6(2026),定位:最强大脑,复杂推理天花板
- Claude Sonnet(主力・均衡全能),最新:Sonnet 4.6(2026),定位:企业主力,速度 / 成本 / 能力平衡
- Claude Haiku(轻量・极速低成本),最新:Haiku 4.5(2025),定位:轻量快响,高并发首选
GPT
- 强推理旗舰 GPT-4 Advanced / o3
- 企业通用主力 GPT-4o
- 轻量极速 GPT-4o-mini
openAI
- o3(旗舰推理・2025.4),定位:最强推理天花板,多模态 + 超长思考
- o3-mini(轻量推理・2025.1)定位:高性价比推理小模型,无视觉,纯文本
任务规划与调度层
- 这是普通小 Agent 没有、大厂必加的一层。负责:按顺序安排先干啥、后干啥,分支判断:成功走 A 流程、失败走 B 流程,定时、循环、并行执行任务,管控整个流程不乱跑
底层:LLM 推理能力的两大核心技术
- CoT(Chain of Thought,思维链),在 Prompt 里加一句 Let's think step by step(“我们一步步来思考”),模型就会把推理的中间步骤完整展开。
- ToT(Tree of Thoughts,思维树)不是走一条线性的推理链,而是在每个节点展开多个可能的分支,评估质量后选最优路径继续
- 有了 CoT/ToT 这些推理技术打底,AI 做任务规划时,主要有两种思路:「先规划后执行」—— Plan-and-Execute 模式,但是如果中间某一步的结果和预期不一样,原来的计划就会失效,需要重新调整,灵活性差。 「边执行边规划」—— ReAct 模式每走一步,就根据当前的结果重新思考下一步该做什么,不提前制定完整计划,灵活性极高,但是容易走偏,因为每一步都是局部最优解
工具 / API 注册层
- 把企业所有能力都封装成可被 AI 调用的工具:业务 API:查订单、查库存,第三方 API:天气、短信,系统能力:读写数据库、执行脚本、调用微服务,AI 不用管底层怎么写,只需要按名字调用工具就行。
- 工具要做的事情就是告诉 AI 工具叫什么名字,能做什么事情,需要什么参数,而且这个工具的描述很重要,一定要清楚避免 AI 读取误解
记忆层(企业级必备)
-
分两种:短时记忆:当前对话上下文、正在执行的任务进度,长时记忆:员工偏好、历史任务、业务知识库、文档资料,作用:不用每次重复提问,AI 记得你之前要干嘛、业务规则是什么
-
短期记忆就是模型的上下文窗口,把当前任务的所有对话、工具调用历史拼进去,让 Agent 知道自己在做什么,任务结束就清空,容量受限于模型的上下文长度
-
长期记忆(持久化记忆):把关键信息(用户信息、对话历史、业务知识)通过 Embedding 模型转换成向量,把向量 + 元数据(时间戳、用户 ID、标签)存入向量数据库(如 Pinecone、Milvus、Chroma)
- 语义记忆,存的是 “不变的事实和知识”,比如平台规则:「订单签收后 7 天内可申请无理由退款」
- 情景记忆:存的是 “具体发生过的事、Agent 和用户的交互历史”,比如「2026-05-05 09:00,用户 ID:456 下单了充电宝,订单号:ORD789,地址是 XX 市 XX 区」
- 程序性记忆:存的是 “做事的流程、解决问题的方法”,比如:当用户反馈商品质量问题时:1. 先安抚用户;2. 引导用户上传问题照片;3. 记录订单号和用户信息;4. 转接人工售后处理
-
AI 怎么自动区分三种记忆类型:
- 写一套分类 Prompt,丢给一个小 7B 模型 / 4o-mini / Haiku,用模型帮我归类,拿到结果打上标签
- 关键词 :出现:规则、政策->语义记忆 出现:刚才、上次、昨天 -> 情景记忆 出现:步骤、流程、先做 -> 程序性记忆
-
不是所有对话都存,入库前的重要性评估, 用户偏好、职业、城市、习惯,有价值事实、用户关键信息才存,系统会做相似度去重,重复度高的不存。其次是记忆衰减机制,给每条记忆加上时间权重,用「语义相似度 × 时间衰减因子」动态计算相关性分数,让旧记忆在检索时自动降权,模型优先关注最新、最相关的信息
-
记忆绝对不会无限存:过期淘汰(时间 TTL)给记忆设置过期时间,容量上限淘汰(LRU 最近最少使用)设置容量, 记忆压缩摘要(超级常用)10轮对话浓缩成一句,记忆合并 + 去重相似度高自动合并去重
反思纠错 & 安全管控层
- 调用 API 失败自动重试、换方案、,参数错了自己改参数重新调用,权限管控:哪些 API 能调用、哪些不能碰操作日志审计、防止乱删数据、乱发起流程
Multi-Agent
- 多个AI一起工作,第一一个Agent的上下文窗口大小是固定的,处理多个事情比如搜索分析,内容会很多
- 第二单点能力,一个Agent只做一件事能力更强
- 单个Agent适合任务清晰,复杂度适中的场景,多个 Agent适合需要专业分工的,有两种策略:中心化模式(有一个中心调度者分发任务)和去中心化(各个Agent之间直接交流协商)
- 多个AI Agent之间有三种工作模式:顺序流水线,并行扇出(由一个调度者分发子任务),辩论评审模式(多个Agent对同一个问题进行回答,由一个裁判进行判决,适合需要高质量决策)

AI 应用开发要干的事
- 对接各大 LLM 模型 API
- 写 Prompt、做输出格式约束
- 封装业务接口为 Agent 工具
- 做任务拆解、流程调度编排
- 做 RAG 知识库、向量检索、记忆管理
- 做异常重试、权限管控、工程化稳定性
MCP 协议
- MCP 是一套统一接口标准,它只干 3 件事:告诉 AI 我有什么工具(订单查询、用户查询…),接收 AI 发来的标准请求,执行本地业务(查库 / 调用 Service),返回标准格式结果
- MCP 核心两个接口,第一个 list 接口,告诉 AI 我有哪些能力,然后 AI 根据我的能力进行整合,使用第二个接口 call, 调用我的业务工具,最后再按照固定的格式响应返回。这些响应请求的参数,格式都已经固定好了,哪怕是名字,所以对于不同语言,也是格式固定的。
- Function calling 是低配版的 MCP 协议,也是能让只会聊天的大模型拥有能调用工具的能力,但是这个时候每个厂商所规定的大模型返回格式,参数都不一样,所以我们在解析的时候每个大模型都要有一套标准。但是 MCP 就在这之上进行了统一的封装。
- 对于很多企业只使用一个厂商就可以继续使用原生的 FC,很多旧的项目也避免大量修改底层规则适配,继续使用旧的 FC,所以现在 MCP并未都普及。
// ==============================
// MCP 协议固定请求格式
// ==============================
@Data
class McpRequest {
String toolName; // 工具名:AI 要调用哪个能力
Map<String, Object> params; // 参数:userId、orderId 等
}
// ==============================
// MCP 协议固定响应格式
// ==============================
@Data
class McpResponse {
boolean success;
Object data;
String message;
}
// ==============================
// MCP 协议固定:能力清单(告诉AI我能干嘛)
// ==============================
@Data
class McpToolInfo {
String toolName;
String desc;
List<String> paramNames;
}
A2A 协议
- 解决 AI Agent 之间的标准化通信,A2A 在代码里就干 3 件事:每个 Agent 注册自己是谁、会干啥,Agent 之间用统一格式发消息,Agent 自动发现、自动分工、自动调用对方能力
- A2A 需要一个中心来管理每一个 AI Agent 的注册,这个可以用一台单独的服务器,其他的 Agent 都默认通过中心转发信息,比如A 要调用 B,默认发送请求到中心,再通过中心转发到 B
- 这里各个智能体之间的调用有点像传统的 JAVA 微服务功能:注册中心,网关(所有请求先发到网关,再转发),服务调用,配置中心,消息队列,熔断降级限流(某个服务崩了不连累整个系统,进行限流操作),链路追踪(一条请求经历过哪些微服务记录),容器编排。




浙公网安备 33010602011771号