AI Agent基础设施成本拆解:LLM推理、向量检索与存储的完整成本模型
适合人群:AI Agent 开发者、架构师、技术负责人、SaaS 创始人
阅读时间:约 18 分钟
前言
做 AI Agent 和做普通的 LLM 应用有一个本质区别:普通应用是“一问一答”,成本容易估算;AI Agent 是“多步自主决策”,一个用户请求可能触发5次、10次甚至20次 LLM 调用,中间还穿插着向量检索、工具调用、记忆存储。成本像滚雪球一样增长,直到月底账单让你措手不及。
我见过一个团队做 AI 客服 Agent,上线时按“每次对话2次 LLM 调用”估算成本,结果实际运行后发现平均每个对话触发8次 LLM 调用——Agent 需要先理解意图,再检索知识库,然后生成回复,最后还要做质量检查。成本是预期的4倍,毛利率直接转负。
这篇文章的目的是把 AI Agent 的完整成本结构拆透。不只是 LLM 推理成本,还包括向量检索、记忆存储、工具调用等所有隐性成本,帮你建立一个准确的成本模型。
想按 DAU 和模型层级直接计算你的 Agent 月度成本?使用 LLM Economics 的 AI Agent 基础设施成本计算器,输入 DAU、每次会话的 LLM 调用次数和模型选择,获取完整月度成本预估。
一、AI Agent 的完整成本结构
一个生产级 AI Agent 的每次用户会话,通常涉及以下组件:
用户请求
│
├─ 1. 意图理解(LLM调用 #1)
│
├─ 2. 知识检索(向量数据库查询)
│ └─ Embedding API调用(生成查询向量)
│ └─ 向量数据库检索查询
│
├─ 3. 工具调用决策(LLM调用 #2)
│ └─ 外部API调用(如搜索、数据库查询)
│
├─ 4. 结果整合与推理(LLM调用 #3, #4...)
│
├─ 5. 回复生成(LLM调用 #N)
│
├─ 6. 对话记忆写入(向量数据库写入 + 元数据存储)
│
└─ 7. 质量检查/安全过滤(LLM调用 #N+1,可选)
每一层都有成本。下面逐一拆解。
二、LLM 推理成本:最大的支出项
成本计算
LLM 推理是 Agent 中最大的成本项,通常占总成本的60%-80%。
计算公式:
$$\text{月LLM成本} = \text{DAU} \times \text{日均会话数} \times \text{每会话LLM调用次数} \times \text{平均每次调用的token成本}$$
其中:
$$\text{每次调用token成本} = \frac{\text{输入tokens} \times \text{输入单价} + \text{输出tokens} \times \text{输出单价}}{1,000,000}$$
典型 Agent 的 LLM 调用模式
一个典型的 RAG 增强 AI Agent,每次用户会话的 LLM 调用链路:
| 步骤 | 调用类型 | 输入 tokens | 输出 tokens | 说明 |
|---|---|---|---|---|
| 意图理解 | LLM | 500 | 50 | 判断用户意图和路由 |
| 查询改写 | LLM | 800 | 100 | 将用户问题改写为检索 query |
| 知识整合 | LLM | 3000 | 500 | 将检索结果+用户问题整合 |
| 回复生成 | LLM | 1000 | 800 | 生成最终回复 |
| 质量检查 | LLM | 1500 | 100 | 检查回复质量和安全性 |
| 合计 | 5次 | 6800 | 1550 |
不同模型的月成本对比
假设 DAU=1000,每用户日均3次会话:
| 模型 | 单次会话成本 | 日成本 | 月成本 |
|---|---|---|---|
| DeepSeek V4 Flash ($0.14/$0.28) | $0.0014 | $4.20 | $126 |
| DeepSeek V4 Pro ($0.435/$0.87) | $0.0042 | $12.60 | $378 |
| GPT-4.1 Mini ($0.80/$3.20) | $0.0103 | $30.90 | $927 |
| GPT-4.1 ($2.00/$8.00) | $0.0260 | $78.00 | $2,340 |
| Claude Sonnet 4.6 ($3/$15) | $0.0227 | $68.10 | $2,043 |
| Claude Opus 5 ($5/$25) | $0.0713 | $213.90 | $6,417 |
从 DeepSeek V4 Flash 到 Claude Opus 5,月成本相差51倍。这再次说明了模型分级路由的重要性——如果 Agent 中5次 LLM 调用中有3次是简单任务(意图理解、查询改写、质量检查),完全可以路由到轻量模型,只有知识整合和回复生成才需要更强的模型。
模型分级路由在 Agent 中的应用
# Agent中的模型分级路由
MODEL_SIMPLE = "deepseek-v4-flash" # 简单任务
MODEL_MEDIUM = "deepseek-v4-pro" # 中等任务
MODEL_COMPLEX = "claude-sonnet-4-6" # 复杂任务
# 路由策略
def get_model_for_step(step: str) -> str:
if step in ["intent_understanding", "query_rewrite", "quality_check"]:
return MODEL_SIMPLE # 简单任务用Flash
elif step in ["knowledge_synthesis"]:
return MODEL_MEDIUM # 中等任务用Pro
elif step in ["response_generation"]:
return MODEL_COMPLEX # 复杂任务用Sonnet
return MODEL_MEDIUM
使用分级路由后,成本估算:
| 步骤 | 模型 | 输入 | 输出 | 单次成本 |
|---|---|---|---|---|
| 意图理解 | V4 Flash | 500 | 50 | $0.00007 |
| 查询改写 | V4 Flash | 800 | 100 | $0.00014 |
| 知识整合 | V4 Pro | 3000 | 500 | $0.0017 |
| 回复生成 | Sonnet 4.6 | 1000 | 800 | $0.0150 |
| 质量检查 | V4 Flash | 1500 | 100 | $0.00024 |
| 合计 | — | 6800 | 1550 | $0.0172 |
月成本 = 1000 × 3 × 30 × $0.0172 = $1,548
相比全用 Sonnet 4.6的$2,043,节省24%。相比全用 Opus 5的$6,417,节省76%。
在 AI Agent 基础设施成本计算器 中可以设置每个步骤的模型选择,自动计算分级路由下的总成本。
三、向量检索成本:RAG 的隐性支出
Embedding API 成本
RAG 流程的第一步是将用户查询转化为向量,这需要调用 Embedding API。
主流 Embedding 模型定价:
| 模型 | 单价 ($/1M tokens) | 维度 | 说明 |
|---|---|---|---|
| OpenAI text-embedding-3-large | $0.13 | 3072 | 高精度 |
| OpenAI text-embedding-3-small | $0.02 | 1536 | 性价比 |
| Google text-embedding-004 | 免费(AI Studio) | 768 | 免费 tier |
| DeepSeek Embedding | $0.014 | 1024 | 低价 |
| 开源模型(bge-m3等) | 免费(自托管) | 1024 | 需 GPU |
Embedding 成本虽然单价低,但在高频检索场景下也不可忽略。1000 DAU × 日均3次会话 × 每次检索 query 50 tokens:
月Embedding成本(text-embedding-3-small)
= 1000 × 3 × 30 × 50 × $0.02 / 1,000,000
= $0.09
Embedding API 成本在这个量级几乎可以忽略。但如果你的 Agent 每次会话检索多条文档、每条文档都需要重新 embed(如动态文档入库),成本会上升。
向量数据库成本
这是 RAG 基础设施中最容易被低估的成本项。
主流向量数据库的价格对比:
| 方案 | 免费 tier | 付费起步 | 计费方式 | 适用规模 |
|---|---|---|---|---|
| Pinecone | 100K vectors | $70/月起 | 按节点+存储 | 中大型 |
| Supabase (pgvector) | 500MB | $25/月起 | 按数据库实例 | 小中型 |
| Weaviate Cloud | 14天试用 | $25/月起 | 按实例+存储 | 中型 |
| Qdrant | 1GB | $25/月起 | 按实例+存储 | 小中型 |
| Milvus (自托管) | — | 服务器成本 | 自托管 GPU/CPU | 大型 |
对于1000 DAU 的 Agent 应用,向量数据库的月成本通常在$25-$100之间,取决于存储量和检索频率。
使用 RAG 成本计算器 可以对比 Pinecone、Supabase 和 Weaviate 的完整成本,找到最便宜的方案。
向量检索的实际成本
向量检索本身不按调用次数计费(除了 Pinecone Serverless 按读取单元计费),但检索延迟和检索质量直接影响用户体验和 LLM 成本:
-
检索精度低 → 返回的文档不相关 → LLM 需要更多轮次才能给出好答案 → LLM 成本增加
-
检索延迟高 → 用户等待时间长 → 体验下降
所以向量检索的“成本”不只是数据库费用,还包括因检索质量不足而导致的额外 LLM 调用成本。
四、记忆与存储成本
短期记忆(会话上下文)
Agent 在多轮对话中需要维护对话历史。这部分通常作为 prompt 的一部分传给 LLM,成本已经包含在 LLM 推理成本中。
但随着对话轮数增加,上下文长度增长,LLM 的输入 token 成本也会增长。一个10轮对话的上下文可能有5000-10000 tokens,每轮对话都要重新传入这些上下文。
优化策略:使用对话摘要(conversation summary)替代完整历史。每隔 N 轮,用一个轻量模型将之前的对话总结为500 tokens 的摘要,后续对话只传摘要+最近2轮对话。
长期记忆(用户画像/历史知识)
Agent 需要跨会话记住用户偏好和历史交互。这部分通常存储在向量数据库或关系数据库中。
存储成本估算:
每个用户的记忆向量数:50-200条
每条记忆的向量维度:1536(text-embedding-3-small)
每条向量存储大小:1536 × 4 bytes = 6KB
每用户存储:200 × 6KB = 1.2MB
1000用户总存储:1.2GB
1.2GB 的向量存储,在 Pinecone 中大约$70/月,在 Supabase 中包含在$25/月的实例中。
对话日志存储
每次对话的完整记录(用户输入、Agent 回复、工具调用、中间状态)需要持久化存储,用于审计、调试和模型优化。
1000 DAU × 日均3次会话 × 每次会话平均10KB 日志 = 30GB/月。
使用对象存储(如 S3、Cloudflare R2)存储,月成本约$0.5-$2。
五、工具调用成本
Agent 通常会集成外部工具(搜索、数据库查询、API 调用),这些工具也可能产生费用。
常见工具的成本
| 工具 | 计费方式 | 单次成本 | 说明 |
|---|---|---|---|
| Web 搜索(SerpAPI) | 按次 | $0.01-$0.05 | 搜索引擎结果 |
| Web 搜索(Tavily) | 按次 | $0.01-$0.03 | AI 优化搜索 |
| 代码执行(E2B) | 按秒 | $0.001/秒 | 沙箱执行 |
| 图片生成(DALL-E) | 按张 | $0.04-$0.12 | 标准图片 |
| 浏览器自动化 | 按分钟 | $0.05-$0.15 | 无头浏览器 |
如果你的 Agent 每次会话调用1-2个工具,工具成本大约$0.01-$0.10/会话。在高频场景下这也是一笔不可忽略的支出。
优化策略
-
缓存工具调用结果(相同 query 的搜索结果可以缓存)
-
限制工具调用次数(Agent 最多调用 N 个工具后必须给出回复)
-
优先使用免费替代方案(如 Google Custom Search API 每天有100次免费配额)
六、完整成本模型:一个真实案例
把所有成本项汇总,来看一个1000 DAU 的 AI 客服 Agent 的完整月度成本:
基础假设
-
DAU:1000
-
日均会话数/用户:3
-
每会话 LLM 调用次数:5次(使用分级路由)
-
每会话向量检索次数:2次
-
每会话工具调用次数:1次
-
使用模型:V4 Flash(简单任务)+ V4 Pro(中等任务)+ Sonnet 4.6(复杂任务)
月成本汇总
| 成本项 | 计算方式 | 月成本 |
|---|---|---|
| LLM 推理(分级路由) | 1000 × 3 × 30 × $0.0172 | $1,548 |
| Embedding API | 1000 × 3 × 30 × 50 tokens × $0.02/1M | $0.09 |
| 向量数据库(Supabase) | 固定 | $25 |
| 工具调用(Tavily 搜索) | 1000 × 3 × 30 × $0.02 | $1,800 |
| 对话日志存储 | 30GB × $0.023/GB | $0.69 |
| 应用服务器 | 固定 | $100 |
| CDN/带宽 | 估算 | $20 |
| 合计 | — | $3,494 |
等等——工具调用成本$1,800居然和 LLM 推理成本$1,548差不多?这在这个案例中确实如此,因为每次会话都触发了一次 web 搜索。
这揭示了一个重要洞察:Agent 的成本优化不能只盯着 LLM。工具调用、向量检索、基础设施都可能成为成本大头,具体取决于你的 Agent 架构。
优化后的成本
通过以下优化措施:
-
缓存搜索结果(50%命中率):工具调用降到$900
-
Prompt Cache(80%命中率):LLM 成本降到$1,084
-
向量数据库迁移到 Qdrant 自托管:降到$15
-
日志存储使用 R2:降到$0.5
| 成本项 | 优化前 | 优化后 | 节省 |
|---|---|---|---|
| LLM 推理 | $1,548 | $1,084 | 30% |
| 工具调用 | $1,800 | $900 | 50% |
| 向量数据库 | $25 | $15 | 40% |
| 日志存储 | $0.69 | $0.50 | 28% |
| 应用服务器 | $100 | $100 | — |
| CDN/带宽 | $20 | $20 | — |
| 合计 | $3,494 | $2,120 | 39% |
通过合理的优化,总成本降低了39%。
用 AI Agent 基础设施成本计算器 输入你的 DAU、会话频率和模型选择,自动生成完整的月度成本预估,包含 LLM 推理、工具调用和基础设施分项。
七、成本与 DAU 的 scaling 关系
理解成本如何随 DAU 增长,对规划至关重要。
固定成本 vs 变动成本
| 成本类型 | 成本项 | 随 DAU 增长? |
|---|---|---|
| 固定成本 | 应用服务器、向量数据库实例 | 不变(阶梯式增长) |
| 变动成本 | LLM 推理、Embedding API、工具调用 | 线性增长 |
| 半变动成本 | 日志存储、带宽 | 低于线性增长 |
不同 DAU 级别的月成本
假设使用分级路由模型(V4 Flash + V4 Pro + Sonnet 4.6)+ 工具调用 + 基础设施:
| DAU | LLM 成本 | 工具成本 | 基础设施 | 月总成本 | 单 DAU 成本 |
|---|---|---|---|---|---|
| 100 | $155 | $180 | $145 | $480 | $4.80 |
| 500 | $774 | $900 | $160 | $1,834 | $3.67 |
| 1,000 | $1,548 | $1,800 | $145 | $3,493 | $3.49 |
| 5,000 | $7,740 | $9,000 | $200 | $16,940 | $3.39 |
| 10,000 | $15,480 | $18,000 | $300 | $33,780 | $3.38 |
随着 DAU 增长,单 DAU 成本逐渐下降(固定成本被摊薄),但总成本线性增长。这意味着:
-
盈亏平衡点:如果你的产品定价$9.99/月,单 DAU 成本$3.49,毛利率65%。在 DAU=1000时月收入$9,990,月成本$3,493,毛利$6,497。看起来不错。
-
但高活跃用户:如果20%的用户日均会话是平均值的3倍(9次而非3次),这200人贡献的成本是$2,096,但收入只有$1,998(200 × $9.99),这200人整体亏损。
这再次验证了前面的结论:AI Agent 产品需要按使用量分级定价。
八、Agent 成本优化清单
LLM 层
检索层
工具层
基础设施层
九、使用 LLM Economics 工具链进行成本管理
在整个 Agent 生命周期中,LLM Economics 提供了完整的成本管理工具链:
| 工具 | 用途 | 链接 |
|---|---|---|
| AI Agent 基础设施成本计算器 | 按 DAU 计算完整月成本 | llmeconomics.app/ai-agent-infra-calculator |
| RAG 成本计算器 | 对比向量数据库方案成本 | llmeconomics.app/rag-cost-calculator |
| AI 成本优化器 | 按年化节省排列所有降本机会 | llmeconomics.app/ai-cost-optimizer-calculator |
| Token 预算计算器 | 从月度预算反推 token 配额 | llmeconomics.app/token-budget-calculator |
| AI 客服 Bot ROI 计算器 | 计算 AI 客服替代人工的 ROI | llmeconomics.app/ai-support-bot-calculator |
| AI 编码 Agent 成本计算器 | 对比 AI 编码工具成本 | llmeconomics.app/ai-coding-agent-calculator |
总结
AI Agent 的成本管理比普通 LLM 应用复杂得多,因为它的成本是多维度的——LLM 推理、向量检索、工具调用、记忆存储,每一层都有自己的计费逻辑和优化空间。
核心要点:
-
LLM 推理是最大支出,但通过分级路由可以砍掉24%-76%。不要全用一个模型。
-
工具调用可能是隐性大头。在你的 Agent 架构中,每次会话触发的工具调用成本可能和 LLM 成本相当。缓存工具结果是性价比最高的优化。
-
向量检索成本不只是数据库费用。检索质量低导致的额外 LLM 调用才是更大的隐性成本。
-
建立完整的成本模型,不要只估算 LLM 成本。把 Embedding、向量数据库、工具调用、存储、服务器全算进去。
-
监控单 DAU 成本,按用户活跃度分群看成本分布。高活跃用户的亏损要用分级定价来覆盖。
AI Agent 的成本管理是一个持续的过程,不是一次性的优化。随着 DAU 增长、模型更新、功能迭代,成本结构会不断变化。定期用工具重新计算,保持成本可控。
开始计算你的 Agent 成本?访问 LLM Economics AI Agent 基础设施成本计算器,输入你的 DAU、模型选择和调用模式,获取完整的月度成本预估。
相关阅读:
-
《2026年大模型 API 价格排行榜:GPT、Claude、Gemini、DeepSeek 最新对比》
-
《如何选择大语言模型:AI 模型选型决策框架与实践指南》
-
《LLM 降本三大策略:Prompt Cache、Batch API 与模型切换如何节省90%成本》
-
《AI SaaS 定价指南:如何为你的 AI 产品定价不亏钱》
本文工具地址:https://llmeconomics.app/
出处:http://bluescorpio.cnblogs.com
本文版权归作者和博客园共有,欢迎转载,但未经作者同意必须保留此段声明,且在文章页面明显位置给出原文连接,否则保留追究法律责任的权利。
浙公网安备 33010602011771号