[AI/Agent/架构] 企业级AI应用的架构设计(参考蓝图)
0 序
- 梳理、总结此篇,以作为企业级AI Agent系统设计的理想蓝图、参考图纸。
理解了此篇,也就任意理解市面上的各类AI Agent项目的所处位置了。
AI Agent 的一般运行流程
- 交互接入层:接收用户 / 事件请求,鉴权、预处理
- Agent 编排模块: Router 识别意图,加载【记忆层】会话上下文、召回相关长期记忆 & 业务知识库
- Agent 规划模块:生成任务计划,ReAct 循环思考,选择 Skill 工具
- 下发到【工具执行层】做参数校验,调用【企业能力集成层】访问业务系统
- 获取执行结果,返回【编排层做反思校验,判断是否完成;失败触发重试 / 人工介入
- 状态 Checkpoint 保存记忆;【审计层】记录全链路日志
- 格式化输出,返回【交互层】给到用户
1 企业级AI应用的架构设计
架构设计
AI Interface Layer/AI交互层 : 负责与终端用户或外部系统交互,处理协议转换、会话管理、流式响应(SSE/WebSocket)及多模态输入输出。
- 职责
- 多通道接入:Web、IM、API、Webhook、业务系统事件流、语音、文件上传
- 请求预处理、鉴权、参数标准化、输入过滤、会话会话 ID 管理;把外部输入转为 Agent 内部统一事件格式
- 输出结果格式化、多模态返回;支持人工介入节点(Human‑in‑the‑loop)
- Chat
- Copilot
- Web / Mobile App / Embeding AI
- Business Applications
- API / SDK
- Agent-to-Agent
- xxx
- 开源组件
- 前端控制台/对话 UI:NextChat、Open WebUI、Lobe Chat、...
- API 网关:FastAPI、Golang 网关、LangGraph‑API Gateway;Dify 网关、Spring Cloud Gateway、APISIX(支持插件化扩展 AI Gateway 功能)、...
- 消息通道(商业+开源):Slack / 企业微信 / 钉钉适配器、Kafka 消费事件驱动 Agent 触发、...
AI Agent Platform/AI智能体平台
-
Agent Ochestration/Agent 编排与工作流: 整个Agent执行流程的核心调度器,接受 AI Interface Layer 的调用;管理复杂业务逻辑、多Agent协作模式(如Supervisor/Swarm模式)及确定性的DAG流程控制,确保Agent在可控轨道内运行
- Agent Ochestration/Agent编排
- 开源组件:
- 图逻辑与状态机驱动型(企业级确定性编排首选)
- LangGraph (LangChain 开源: 状态图、checkpoint、循环、分支)
- 当前企业级 Agent Runtime 的绝对事实标准、企业级首选。
- 通过 DAG/有向图显式定义状态转移(State)、断点(Checkpoint)和人工干预,极度适合复杂商业逻辑。
- AgentScope (阿里巴巴 开源)
- 高并发、分布式、基于 Actor 模型的 Agent Runtime,专为大规模多 Agent 协作和高吞吐场景设计
- LangGraph (LangChain 开源: 状态图、checkpoint、循环、分支)
- 自动化/代码执行与多 Agent 协作型
- AutoGen (微软开源):多 Agent 对话协同框架的先驱,擅长解决复杂的代码编写与多角色会话决策。(AG2)
- CrewAI:以“角色(Role)- 任务(Task)- 团队(Crew)”为抽象的 Agent 编排框架,极易上手。
- 低代码、快速POC、可视化工作流与应用引擎型(快速业务落地)
- Dify:全球最火爆的 Agent 编排与应用开发平台之一,可视化 DAG 工作流与 RAG 引擎的集大成者,企业 MVP 选型首选
- Flowise:基于 Node.js/LangChain 的可视化 Agent 流程编排工具
- 图逻辑与状态机驱动型(企业级确定性编排首选)
- 开源组件:
- Multi-Agent Orchestrator:管理多 Agent 间的通信、任务分发与状态同步;角色分发、消息通信、结果聚合(复杂场景)
- Workflow/工作流
- 工作流与可视化:Dify(可视化编排与快速 MVP)、Flowise
- Agent Ochestration/Agent编排
-
Agent Management/Agent管理
- Agent Registry: Agent 注册、发现、生命周期
- Agent Definition: Agent 身份、角色、目标/职责、配置
- Agent Version&Release: Agent 的版本管理与发布
-
Agent Runtime/Agent运行时: Agent 核心决策层,Agent 的“大脑”与“手脚”,实现基于 ReAct、Plan-and-Solve 等范式的思考、记忆与工具调用
-
Reasoning/推理: 推理、判断、决策(包括但不限于:识别业务目标,选择 Agent/Skill,避免大模型无边界自由发挥)
-
Planning/规划: 任务拆解、执行计划;此外还可:ReAct 循环推理;Plan‑Execute 生成执行计划
- 规划器的实现:LLM 原生 Prompt 规划;HTN 分层任务规划;少量硬编码规则兜底
-
Reflection/反思机制: 校验工具返回结果、判断是否达成目标、错误重试、自我修正
-
CoT/思维树、图推理
-
State&Checkpoint/任务状态: Checkpoint 断点,任务中断后可恢复,不用从头跑
-
Memory Engine: 短期记忆 + 情景记忆 + 长期记忆
-
Context Engine/上下文引擎: 构造当前 LLM Context
-
Tool Use/工具调用 (Function Calling)?如何定义边界
-
Skills/技能: Agent 可复用的能力抽象(对完成某个任务所需的流程、工具、经验/认知的能力抽象)
- Skill Registry
- Skill Execution
-
开源选型
- 核心框架:
- LangChain / LlamaIndex(Java 生态推荐 Spring AI 或 LangChain4j)
- Pi-Agent : 一种非常优秀的、聚焦于轻量级与编码领域(Coding Agent)的轻量级 Agent Runtime 框架。
- 备注: 相比 LangGraph / Dify, Pi-Agent (pi-agent-core) 侧重于极简、轻量级、面向终端/编码/高响应要求的本地 Agent 运行时。
- pi-ai:统一 LLM 接入层(屏蔽 20+ 模型供应商接口差异)
- pi-agent-core:纯粹的 Agent Runtime(引擎),只负责管理“思考 -> 调工具 -> 看结果 -> 再思考”的事件循环(Agent Loop),不绑定任何特定场景
- pi-coding-agent:应用与产品层,基于 pi-agent-core 实现的具体编程 Agent(命令行 TUI/Web UI)
- 工具协议扩展:Model Context Protocol (MCP)(标准化的上下文与工具对接协议)
- 观测调试:LangSmith(追踪每一步思考、工具调用、token 消耗,排错审计必备)
- 核心框架:
-
- 为什么会叫 Agent Runtime?
如果把 LLM 比作 CPU,那么 Agent Runtime 就是操作系统(OS)的进程调度器与内核。它负责管理一个 Agent 从“接收输入”到“完成任务”的整个生命周期状态。
下述这些要素,确实恰好构成了 Agent Runtime 的标准架构拓扑:
- Memory & Context:运行时的内存管理(短存、长存、滑动窗口截断)。
- Planning & Reasoning:运行时的CPU 执行逻辑/调度器(ReAct 循环、Plan-and-Solve 循环)。
- Checkpoint & State:运行时的持久化与快照(如 LangGraph 的状态持久化,允许 Agent 在任意步骤挂起、人工介入 Human-in-the-loop 后恢复)。
- Skills & Tool Use:运行时的 I/O 设备驱动与指令集扩展。
架构层面的语义对齐:在写架构设计文档时,使用 Agent Runtime 往往比叫“核心决策层”显得更专业、更具工程感。
Context Engine/上下文引擎
- 推荐文献
- 本质对比:
提示词工程:定义任务目标、角色、规则、输出范式;解决模型意图对齐、行为约束、输出范式。
上下文工程:筛选、裁剪、排序、压缩、组装送入窗口的全部信息;解决有限窗口内信息质量与利用率问题——即:解决稀缺 token 预算、丢失‑in‑middle、上下文溢出问题
记忆组件: 突破LLM上下文窗口限制,跨轮次、跨会话保存Agent状态、历史事实、用户偏好;实现长期知识沉淀;解决跨窗口状态留存、历史信息复用问题。
Memory/记忆模块
- 推荐文献
Model Platform/模型平台
- 模块职责
- 统一接入云端 API 与自托管开源模型
- 按任务复杂度/成本/延迟做模型路由(Model Router)
- 支持热切换,防止厂商锁定
-
Model Gateway/模型网关
-
Model Registry/模型注册与接入
- LLM(大语言模型) Model / VL Model(视频语言模型) / TTS Model(文本语言模型)
- Embeding Model(嵌入模型) / Reranker(重排序模型)
-
Model Routing/模型路由
-
Model Access / API
-
Inference Serving/推理服务
-
Model Evaluation/模型评估
-
Fine-tuning / Adaptation: 微调、适配
-
Model Cost / Performance: 模型成本、模型性能
-
...
-
组件选型:
- 模型网关:
- 推理加速引擎:
- vLLM(高吞吐量 PagedAttention 引擎)、SGLang
- Ollama(轻量级、侧重于【本地】测试) 180k star
- TGI
- 模型策略:云端 API(GPT-5.5 / Claude Sonnet 4.6)起步 → 业务量增长后引入 Llama 3 / Qwen / DeepSeek 等开源模型处理特定任务,形成混合模型策略
-
推荐文献
Tool Platform (Capability Platform)/工具与能力集成层: 面向AI Agent提供【能力实体】
Tool发现 → 鉴权 → 路由 → 执行
- 执行:本地执行(文件/浏览器/...)、调用知识平台/数据平台/业务系统
-
Tool Gateway
-
Tool Registry/工具注册 (例如:)
├── search_customer
├── create_order
├── query_sales
├── python_execute
└── browser
└── ... -
Tool Policy/工具权限
-
Tool Execution/工具执行
- Direct Execution/直接执行
- Sandbox Runtime/沙箱运行时: 把工具执行放进一个资源、网络、文件和身份都受控的隔离环境(让Agent能干活儿,但不能串门)
- 4层一起工作:
- Control面(目标 --> TaskSpec --> 调度与生命周期)
- Execution面(Agent + 代码 + 私有工作区)
- Policy面(每次行动前:允许/拒绝/需要审批; 风险越高,边界越硬;隔离粒度,按风险划分:普通查询-进程级隔离、代码执行-容器、高风险与多租户-微虚拟机或虚拟机)
- Evidence面(Artifact/产物、重验、审批与真实世界发布)
- 4大关键问题: 任意Linux二进制?代码与租户的可信度?冷启动与密度?状态与恢复方式?
- 网络出口:默认拒绝所有,再按Task Spec开放
- 方案1: Container (共享内核): 适合侧重【兼容性】、【工具生态】的场景
- Agent Process -> Host Linux Kernel (优点:快、兼容性好、共享内核; 缺点: 攻击面仍在宿主机的内核)
- 具体组件: Docker / Kubernetes Pod
- 方案2: gVisor (用户内核)
- Agent Process --> Sentry + Gofer --> Host Kernel (兼容性稍差、syscall中介)
- 具体组件: gVisor (Google 开源,在用户空间实现 Linux 系统调用的拦截和处理,不需要 KVM;适合场景:不支持 KVM,需要在现有 Docker 设施上快速叠加安全层)
- 方案3: MicroVM (硬件级VM)
- Agent Process --> Guest Kernel --> KVM / Host (强租户边界、成本更高)
- 具体组件: Firecracker VM(由 AWS 开发,专为 Serverless 场景设计,是 Lambda 和 Fargate 的底层技术。)
- 方案4: Wasm (Capability ABI)
- Wasm Module(无模棱两可的访问) <--> Explicit Imports/显式导入 (轻量、细粒度、兼容受限)
- ... (上述方案,自上而下:兼容性/工具生态:好-->差;隔离边界:差-->好)
- 补充方案: 沙箱云服务
- 把 sandbox 能力产品化、云服务化,专门服务 AI Agent 代码执行场景。
- 具体组件:E2B
- 其他组件: Daytona / Modal
- 4层一起工作:
-
开源组件
- 开发 SDK (Python): 用于将内部 Python 代码、本地函数包装为标准的 MCP 工具服务。
- MCP Python SDK
- FastMCP(Python生态中实现 Anthropic 主导的 MCP 协议的高级 SDK。它大大降低了将企业现有 Python 函数、数据库查询或微服务包装为 MCP Server 的门槛)
- 开发 SDK (Java/TS): 如果企业主栈是 Java(Spring 生态)或 Node.js,用对应的语言 SDK 开发 Tool Server。
- MCP Java SDK / MCP TypeScript SDK
- 工具路由与网关: 当内部有几十上百个 MCP Server 时,提供统一的 API 路由、限流、Token 转发和熔断。
- MCP Gateway / APISIX MCP Plugin
- 代码执行沙箱
- 开发 SDK (Python): 用于将内部 Python 代码、本地函数包装为标准的 MCP 工具服务。
- 为什么必须将 Tool Execution 单独拆分出来作为独立的 工具与集成层(工具能力层)?
这正是企业级架构向大规模演进时的“必经之路”
在单体或简单 Agent 架构中,Tool 通常作为 API 直接硬编码在 Agent 代码中。但在企业级复杂场景中,如果不拆分:
- 安全隐患:代码执行(如 Python Sandbox)或高危操作(数据库删改)在 Agent 宿主进程中运行,极易引发越权或崩溃。
- 连接膨胀与维护灾难:100 个 Agent 都需要接入企业 CRM 或内部 API 时,每个 Agent 都要实现一遍鉴权、RPC 调用与错误重试。
- 能力无法复用:Agent A 开发的数据库查询工具,Agent B 无法无缝调用。
- 工具与集成层(工具能力层),在被拆分后的职责划分与演进形态?
单独拆分出的 Tool / Capability 层(工具能力层) 承担三大职责:
- 工具注册与发现(Registry & Discovery):以标准规范(如 OpenAPI / MCP)暴露出工具的元数据(Schema、参数说明)。
- 执行与安全隔离(Execution & Isolation):提供轻量级容器/沙箱环境(Docker、Wasm、E2B)隔离高危代码执行。
- 访问控制与鉴权(Auth & RBAC):统一对接企业 IAM,确保 Agent 代表用户(On-behalf-of-user)执行 API 时具备正确权限。
Knowledge Platform/知识库平台: 为 AI Agent 提供高质量的上下文知识补充,解决幻觉、并支持海量长文本与结构化/非结构化数据的检索
- 模块划分:
- 文档解析、切片与向量化 (ETL/Embedding):文档解析、Chunk 策略、向量化 Pipeline。
- 构建【知识图谱】
- 混合检索与重排 (RAG & Rerank):密集向量检索 + 稀疏文本检索(BM25)+ GraphRAG + Re-ranking。
- 知识库存储:向量数据库、关系型数据库、图数据库。
- 数据来源:
- QA/问答
- Rules/规则
- Documents/文档手册
- ...
- 开源选型:
- RAG 引擎/框架: RAGFlow(内容检索增强引擎: 精准文档解析与模块化 RAG)、GraphRAG(知识图谱结合)等
- 向量数据库: Milvus(千万级或以上的中大型VDB) / Qdrant(百万条级内的小型VDB) / PGVector(若已有 PostgreSQL 基础设施) / ElasticSearch 等。
- 重排模型/框架:BGE-Reranker、FlashRank、Qwen-Rerancker系列模型。
Data Platform/数据平台
- Data Application Products/数据应用产品
- BI
开源组件: Superset / ... - Data Assets System
- ...
- BI
- Data Warehouse/数据仓库
- 开源组件: Hadoop+Hive / Doris / Clickhouse / ...
- Lakehouse/数据湖
- 开源组件: Iceberge / Hudi / Paimon / ...
Business Platform/业务平台
- ERP
- CRM
- MES
- HR
- OA
- Core Business System
- ...
AI Governance Platform (AI治理平台): 横切 AI Interface Layer、AI Agent Platform、Model Platform、Tool Platform、Knowledge Platform、Data Platform、Business Platform
- Observablity/可观测性: 捕获 Agent 内部思考链(Chain of Thought)、Prompt 消耗、工具调用耗时及 Token 成本
- 开源组件:Langfuse(极佳的开源 Tracing 方案)、Arize Phoenix、OpenTelemetry 集成。
- Evaluation/评测与迭代: 自动化的 RAG 评估与 Agent 任务成功率评估(LLM-as-a-Judge)
- 组件选型:Ragas、DeepEval
- Guardrails/安全与护栏: Input/Output 审核、防止 Prompt 注入攻击、敏感数据脱敏(PII Masking)
- 开源组件:NeMo Guardrails、Llama Guard
- Audit/审计
- Identity/身份鉴权
- Security/安全策略
- ...
Infrastructure/基础设施层: 上层可以同时使用它、让 Agent 跑得稳
- 模块职责
- 计算与部署:Agent 服务标准化打包、扩缩容、GPU 调度
- 任务队列:长任务(多工具调用、长文档处理)走异步队列,避免 HTTP 长连接阻塞
- 隔离运行时:Agent 执行代码或操作文件系统时提供内核级隔离
短任务用同步 API(FastAPI),长任务务必上异步队列,否则生产环境连接会被拖垮
- 组件选型
- 容器/编排(Container): K8s(Pod) / Docker / ... (生产级微服务集群事实标准)
- 异步任务: Celery / NATS / SQS (超过数秒的 Agent 任务走异步队列)
- 模型推理服务: vLLM / SGLang (高吞吐自托管推理;Ollama 适合本地轻量部署)
- 沙箱隔离: Docker / gVisor / E2B(云服务) / Firecracker Micro-VM / ... / NVIDIA OpenShell (代码执行类 Agent 必备,毫秒级启动 + syscall 拦截)
- 计算资源: GPU / CPU / ...
- 存储:
- 关系型数据库: PostgreSQL
- 缓存数据库/KV-DB: Redis
- Object Storage: MinIO
- 消息队列: Kafka
- 搜索引擎: Elasticsearch
- VectorDB
- Milvus
- Qdrant
- Weaviate
- pgvector
- (ElasticSearch)
- Graph DB: NebulaGraph(原生分布式,推荐) / Neo4J(单机免费,但分布式集群需付费) / ...
- ...
浙公网安备 33010602011771号