AI Agent 是如何一步步开发完成的

AI Agent 是如何一步步开发完成的

一.执行步骤:
1.先让模型可用:prompt,结构化输出,角色可控
2.再让模型接人流程:Langchain,工作流编排
3.再让模型真正能做事:tool calling,function callking
4.再升级让模型边想边做:ReAct(reason+action)
5.让模型知道它不能做什么:RAG
6.让外部能力标准化接人:MCP
7.把经验沉淀下来: Skills
8.从单体到协作:Handoffs,SubAgents,Router
9.从能跑到线上:Tracing,Evals与工程化

技术点/阶段 解决的问题
Prompt 模型可控性
LangChain 流程编排
Tool Calling 执行能力
ReAct 思考与行动闭环
RAG 知识缺失
MCP 接入标准化
Skills 经验复用
Handoffs 复杂任务分工
Tracing / Evals 工程化落地

二.具体执行步骤--详细功能点:
1.先让模型可用:prompt,结构化输出,角色可控
最先被重视的能力包括:
Prompt Engineering
角色设定
输出格式约束
结构化响应
上下文注入
这个阶段的目标,是把模型从“随机发挥的黑盒”,变成“能稳定完成单点任务的模块”

2.再让模型接人流程:Langchain,工作流编排
当模型能完成单点任务后,新的问题出现了:真实任务往往由多个步骤组成。
例如一个代码需求,可能要经历需求理解、上下文分析、模块拆分、代码生成、测试补齐、结果校验和问题修复。单次调用已经不够用,开发者需要把模型组织进一条可执行链路。
LangChain 这类框架的价值正在于此:它不只是封装模型调用,而是把模型、提示词、工具、记忆、检索和输出解析组织成可复用的调用链路,让开发者可以把一次调用扩展为多步流程,并在流程中插入判断、解析、路由和校验。
从这里开始,开发者不再只是“调用模型”,而是在“编排模型能力”

3.再让模型真正能做事:tool calling,function callking
它的本质,是给模型接上“手和脚”。

常见工具能力包括:
文件读写
数据库查询
Shell 命令执行
浏览器访问
API 调用
代码编辑
搜索与检索
从这个阶段开始,模型不再只是回答问题,而开始具备执行任务的能力

4.再升级让模型边想边做:ReAct(reason+action)
有了工具之后,新的问题变成:

什么时候调用工具?
调用哪个工具?
工具返回后下一步做什么?
结果不对时是否会调整策略?

如果没有机制约束,模型要么只会空想不行动,要么乱调工具。ReAct 的关键不是让模型一直思考,而是让它在推理、调用工具、观察结果之间形成闭环:
判断当前要做什么;
调用工具获取信息;
根据结果继续分析;
执行下一步动作;
直到完成目标。
从这个阶段开始,智能体才真正具备“围绕目标持续工作”的雏形。

5.让模型知道它不能做什么:RAG
当智能体开始执行任务后,知识缺口会越来越明显。模型并不知道你的项目、团队规范、私有 API、业务流程和代码约定。
这时,仅靠模型参数中的通用知识已经不够。RAG 的价值,是让模型在回答或行动前先检索外部知识,再基于资料完成任务。
对 AI Coding 来说,获取项目上下文几乎绕不开。RAG 是其中一种重要方式,尤其适合处理文档、知识库、历史需求和大规模代码语义检索。

6.让外部能力标准化接人:MCP
当工具和知识源越来越多,另一个工程问题会出现:每接一个系统都要重新适配,调用方式也不统一。

MCP(Model Context Protocol)的价值,是为智能体连接外部世界提供标准协议。它解决的是接入层标准化问题,而不是模型推理能力本身的问题。它可以把外部能力抽象为:

Tools:可调用的操作能力
Resources:可读取的上下文资源
Prompts:可复用的提示模板
简单说:

Tool Calling 解决“模型能不能调用工具”;
MCP 解决“不同工具和资源能不能以统一方式接入”。

7.把经验沉淀下来: Skills
如果说 MCP 解决的是外部能力接入,那么 Skills 更像是在解决内部经验复用。
团队真正有价值的,往往不是单个 Prompt,而是长期积累下来的工作流、排障步骤、代码规范、诊断脚本、模板方法、领域知识和最佳实践。
Skills 可以理解为一种能力封装方式:把团队反复使用的流程、规范、脚本和模板沉淀成可复用的能力包。它不一定是统一标准,但代表了智能体工程化中非常重要的一类实践。这样,智能体不再只是临场发挥,而是能够稳定调用组织沉淀下来的经验。

8.从单体到协作:Handoffs,SubAgents
当任务越来越复杂,单个 Agent 很容易出现上下文膨胀、职责混乱和推理链过长的问题。

这时,多智能体协作就成为自然选择:不同 Agent 承担不同职责,并通过 Handoffs 完成任务交接。Subagents 强调角色拆分,Handoffs 强调任务转交,多智能体协作则强调多个专职 Agent 围绕同一目标共同工作。

例如:
需求 Agent 负责拆解目标;
检索 Agent 负责查资料;
Coding Agent 负责生成代码;
Review Agent 负责校验质量;
Testing Agent 负责执行验证。
多智能体不是为了概念更炫,而是复杂任务下更合理的职责分工。

9.从能跑到线上:Tracing,Evals与工程化
当模型、流程、工具、RAG、MCP、Skills 和多智能体都接入后,一个 Agent 原型看似已经完成。但要真正上线,还必须回答更工程化的问题:

每一步是怎么决策的?
哪一步出错了?
为什么会失败?
哪个 Prompt 或工具导致了偏差?
效果是否持续变好?
成本和时延是否可控?
是否存在风险操作?
这时,Tracing 和 Evals 就非常关键。

Tracing 用来记录智能体运行过程,包括工具调用、任务流转、关键中间结果和失败位置。

Evals 用来系统评估智能体效果,包括输出质量、任务成功率、工具使用正确率、稳定性、安全性、成本与时延。

也就是说,只有到了这个阶段,智能体开发才真正从“会做 Demo”进入“会做系统”。

posted @ 2026-08-08 10:35  大树2  阅读(6)  评论(0)    收藏  举报