AI应用开发的五层架构:从基础设施到业务应用
AI应用开发五层架构图
一个成熟的AI应用系统,可以划分为以下五个层次:

第一层:基础设施层(地基)
这是所有AI应用运行的基础,往往被初学者忽视,但却是生产环境稳定性的关键。
| 组件 | 作用 | 技术选型建议 |
|---|---|---|
| 向量数据库 | 存储和检索Embedding向量,支撑RAG的核心检索 | 小规模用Chroma,大规模用Milvus或PGVector |
| 可观测性 | 追踪AI调用链路、记录输入输出、监控成本 | LangSmith、OpenTelemetry、自建日志系统 |
| 缓存与存储 | 缓存高频查询结果、存储上传文件/图片 | Redis、S3/OSS |
第二层:模型服务层(大脑)
不仅包含大语言模型,还包含支撑AI应用的其他关键模型。
-
大语言模型(LLM):根据场景选择合适规模和性价比的模型。对话用GPT-4o,简单任务用GPT-4o-mini或开源模型。
-
Embedding模型:将文本转化为向量,直接影响RAG的检索质量。推荐 text-embedding-3-small 或 bge-large。
-
Reranking模型(精排模型):对检索结果进行二次排序,能显著提升RAG准确率,但会增加延迟。推荐 Cohere Rerank 或 bge-reranker。
第三层:核心能力层(三大业务场景)
这是我们之前重点讨论的三大支柱,它们是AI应用向外输出的核心能力。
-
Agent(智能体):决策与调度中心。负责理解用户意图、拆解任务、规划执行步骤、调用合适的工具。
-
RAG(检索增强生成):知识问答能力。让AI基于外部知识库回答,解决幻觉和知识陈旧问题。
-
MCP(模型上下文协议):标准化工具调用能力。让AI安全、统一地接入外部数据和工具。
第四层:流程编排层(从蓝图到执行)
这一层是连接“能力”和“业务”的关键桥梁,包含两个核心组件:
Skill(技能/专家技能包)——流程的“静态蓝图”
-
以 SKILL.md 文件形式存在,用自然语言描述了特定任务的最佳实践流程
-
本质是知识资产,将领域专家的经验沉淀为可复用的文本
-
特点:无需编码、业务专家可直接维护、按需加载节省Token
流程编排引擎(Orchestration Engine)——流程的“动态执行”
-
AI运行时实际执行的步骤序列,包含循环、条件分支、错误处理等逻辑
-
Agent根据Skill提供的蓝图,驱动流程编排引擎去顺序(或并行)调用各种能力
-
一个典型的编排序列:
RAG检索 → LLM生成 → MCP发送结果 → 记录日志
Skill与流程编排的关系:Skill是“计划书”,流程编排是“施工队”。没有Skill,流程编排依然能工作(由硬编码或用户指令驱动),但会失去灵活性和专业性;没有流程编排,Skill只是一份无法自动执行的文档。
第五层:业务应用层(价值兑现)
这一层是最终面向用户的产品形态。基于下层的各项能力,你可以构建:
-
智能客服系统(RAG + Agent)
-
代码审查助手(Agent + MCP + Skill)
-
自动周报生成器(MCP + RAG + Skill)
-
企业知识库问答(RAG + 可观测性)
-
多智能体协作平台(多Agent + MCP + 流程编排)
架构总结
| 架构层次 | 核心组件 | 解决的核心问题 |
|---|---|---|
| 业务应用层 | 具体业务应用(智能客服/代码助手等) | 价值兑现 |
| 流程编排层 | Skill(蓝图)+ 流程编排引擎(执行) | 如何将能力组合为专业工作流 |
| 核心能力层 | Agent(决策)+ RAG(知识)+ MCP(工具) | 提供三大核心AI能力 |
| 模型服务层 | LLM + Embedding + Reranking | 提供AI推理能力 |
| 基础设施层 | 向量数据库 + 可观测性 + 缓存存储 | 提供运行支撑 |
| 横向贯穿 | 评测体系 + 安全合规 + 成本优化 + 人机协同 + 多智能体协作 | 保障生产可用性 |
其它方面
评测与评估体系(Evaluation)
AI输出的非确定性让评测变得至关重要。核心包括:
-
离线评测:建立标准问答对(Golden Dataset),每次迭代后自动跑分
-
在线评测:A/B测试、用户反馈收集、满意度评分
-
RAG专项评测:检索命中率(Hit Rate)、生成准确率(Faithfulness)、回答完整性(Completeness)
安全与合规(Safety & Compliance)
AI应用面临独特的安全挑战:
-
Prompt注入防护:防止用户通过恶意提示词绕过限制
-
越权调用防护:确保用户只能访问自己有权限的数据
-
PII(个人隐私信息)脱敏:自动识别并脱敏输出中的敏感信息
-
内容安全过滤:防止生成违规内容
成本优化(Cost Optimization)
LLM调用成本是生产环境必须考虑的因素:
Token缓存:对高频问题缓存答案,减少重复调用
模型路由:简单问题用小模型,复杂问题用大模型
Prompt压缩:在保持效果的前提下压缩上下文长度
语义缓存:相似问题返回缓存答案,而非重新调用LLM
人机协同(Human-in-the-Loop)
不是所有场景都适合全自动,有些场景需要人工介入:
-
关键决策确认:高风险操作(如删除数据、发送邮件)需要人工二次确认
-
专家审核:医疗、法律等专业领域的AI输出需要专家审核
-
主动澄清:当AI对用户意图不确定时,主动提问而非猜测
-
反馈闭环:用户对AI输出的纠错自动录入,用于后续优化
多智能体协作(Multi-Agent Collaboration)
复杂任务可能需要多个Agent协作完成:
-
分工模式:规划Agent + 执行Agent + 审查Agent
-
通信机制:Agent之间通过消息队列或共享记忆进行通信
-
共识机制:多个Agent对同一问题的答案进行投票或辩论后达成共识
学习建议
-
从下到上:先理解基础设施和模型层,再学习核心能力层(RAG/Agent/MCP),最后掌握流程编排和Skill的设计。
-
重视评测:从第一个项目开始就建立评测意识,不要等到上线后再补。
-
成本意识:学习阶段就要考虑Token消耗,养成良好的优化习惯。
-
Skill先行:在实现复杂功能前,先用Skill文档把流程写清楚,再让Agent去执行。
这个五层架构可以成为你设计、评估和优化AI项目的核心框架。无论你是在学习阶段还是已经进入生产环境开发,它都能帮你清晰地定位问题所在——是模型选型不对、检索质量不高、流程编排不合理,还是缺少评测和监控。

浙公网安备 33010602011771号