AI应用开发的五层架构:从基础设施到业务应用

AI应用开发五层架构图

一个成熟的AI应用系统,可以划分为以下五个层次:
image

第一层:基础设施层(地基)

这是所有AI应用运行的基础,往往被初学者忽视,但却是生产环境稳定性的关键。

组件 作用 技术选型建议
向量数据库 存储和检索Embedding向量,支撑RAG的核心检索 小规模用Chroma,大规模用Milvus或PGVector
可观测性 追踪AI调用链路、记录输入输出、监控成本 LangSmith、OpenTelemetry、自建日志系统
缓存与存储 缓存高频查询结果、存储上传文件/图片 Redis、S3/OSS

第二层:模型服务层(大脑)

不仅包含大语言模型,还包含支撑AI应用的其他关键模型。

  • 大语言模型(LLM):根据场景选择合适规模和性价比的模型。对话用GPT-4o,简单任务用GPT-4o-mini或开源模型。

  • Embedding模型:将文本转化为向量,直接影响RAG的检索质量。推荐 text-embedding-3-small 或 bge-large。

  • Reranking模型(精排模型):对检索结果进行二次排序,能显著提升RAG准确率,但会增加延迟。推荐 Cohere Rerank 或 bge-reranker。

第三层:核心能力层(三大业务场景)

这是我们之前重点讨论的三大支柱,它们是AI应用向外输出的核心能力。

  • Agent(智能体):决策与调度中心。负责理解用户意图、拆解任务、规划执行步骤、调用合适的工具。

  • RAG(检索增强生成):知识问答能力。让AI基于外部知识库回答,解决幻觉和知识陈旧问题。

  • MCP(模型上下文协议):标准化工具调用能力。让AI安全、统一地接入外部数据和工具。

第四层:流程编排层(从蓝图到执行)

这一层是连接“能力”和“业务”的关键桥梁,包含两个核心组件:

Skill(技能/专家技能包)——流程的“静态蓝图”

  • 以 SKILL.md 文件形式存在,用自然语言描述了特定任务的最佳实践流程

  • 本质是知识资产,将领域专家的经验沉淀为可复用的文本

  • 特点:无需编码、业务专家可直接维护、按需加载节省Token

流程编排引擎(Orchestration Engine)——流程的“动态执行”

  • AI运行时实际执行的步骤序列,包含循环、条件分支、错误处理等逻辑

  • Agent根据Skill提供的蓝图,驱动流程编排引擎去顺序(或并行)调用各种能力

  • 一个典型的编排序列:RAG检索 → LLM生成 → MCP发送结果 → 记录日志

Skill与流程编排的关系:Skill是“计划书”,流程编排是“施工队”。没有Skill,流程编排依然能工作(由硬编码或用户指令驱动),但会失去灵活性和专业性;没有流程编排,Skill只是一份无法自动执行的文档。

第五层:业务应用层(价值兑现)

这一层是最终面向用户的产品形态。基于下层的各项能力,你可以构建:

  • 智能客服系统(RAG + Agent)

  • 代码审查助手(Agent + MCP + Skill)

  • 自动周报生成器(MCP + RAG + Skill)

  • 企业知识库问答(RAG + 可观测性)

  • 多智能体协作平台(多Agent + MCP + 流程编排)

架构总结

架构层次 核心组件 解决的核心问题
业务应用层 具体业务应用(智能客服/代码助手等) 价值兑现
流程编排层 Skill(蓝图)+ 流程编排引擎(执行) 如何将能力组合为专业工作流
核心能力层 Agent(决策)+ RAG(知识)+ MCP(工具) 提供三大核心AI能力
模型服务层 LLM + Embedding + Reranking 提供AI推理能力
基础设施层 向量数据库 + 可观测性 + 缓存存储 提供运行支撑
横向贯穿 评测体系 + 安全合规 + 成本优化 + 人机协同 + 多智能体协作 保障生产可用性

其它方面

评测与评估体系(Evaluation)

AI输出的非确定性让评测变得至关重要。核心包括:

  • 离线评测:建立标准问答对(Golden Dataset),每次迭代后自动跑分

  • 在线评测:A/B测试、用户反馈收集、满意度评分

  • RAG专项评测:检索命中率(Hit Rate)、生成准确率(Faithfulness)、回答完整性(Completeness)

安全与合规(Safety & Compliance)

AI应用面临独特的安全挑战:

  • Prompt注入防护:防止用户通过恶意提示词绕过限制

  • 越权调用防护:确保用户只能访问自己有权限的数据

  • PII(个人隐私信息)脱敏:自动识别并脱敏输出中的敏感信息

  • 内容安全过滤:防止生成违规内容

成本优化(Cost Optimization)

LLM调用成本是生产环境必须考虑的因素:

Token缓存:对高频问题缓存答案,减少重复调用

模型路由:简单问题用小模型,复杂问题用大模型

Prompt压缩:在保持效果的前提下压缩上下文长度

语义缓存:相似问题返回缓存答案,而非重新调用LLM

人机协同(Human-in-the-Loop)

不是所有场景都适合全自动,有些场景需要人工介入:

  • 关键决策确认:高风险操作(如删除数据、发送邮件)需要人工二次确认

  • 专家审核:医疗、法律等专业领域的AI输出需要专家审核

  • 主动澄清:当AI对用户意图不确定时,主动提问而非猜测

  • 反馈闭环:用户对AI输出的纠错自动录入,用于后续优化

多智能体协作(Multi-Agent Collaboration)

复杂任务可能需要多个Agent协作完成:

  • 分工模式:规划Agent + 执行Agent + 审查Agent

  • 通信机制:Agent之间通过消息队列或共享记忆进行通信

  • 共识机制:多个Agent对同一问题的答案进行投票或辩论后达成共识

学习建议

  • 从下到上:先理解基础设施和模型层,再学习核心能力层(RAG/Agent/MCP),最后掌握流程编排和Skill的设计。

  • 重视评测:从第一个项目开始就建立评测意识,不要等到上线后再补。

  • 成本意识:学习阶段就要考虑Token消耗,养成良好的优化习惯。

  • Skill先行:在实现复杂功能前,先用Skill文档把流程写清楚,再让Agent去执行。

这个五层架构可以成为你设计、评估和优化AI项目的核心框架。无论你是在学习阶段还是已经进入生产环境开发,它都能帮你清晰地定位问题所在——是模型选型不对、检索质量不高、流程编排不合理,还是缺少评测和监控。

posted @ 2026-08-06 11:10  半生俗人  阅读(17)  评论(0)    收藏  举报