AI Agent基础设施成本拆解:LLM推理、向量检索与存储的完整成本模型

适合人群:AI Agent 开发者、架构师、技术负责人、SaaS 创始人

阅读时间:约 18 分钟


前言

做 AI Agent 和做普通的 LLM 应用有一个本质区别:普通应用是“一问一答”,成本容易估算;AI Agent 是“多步自主决策”,一个用户请求可能触发5次、10次甚至20次 LLM 调用,中间还穿插着向量检索、工具调用、记忆存储。成本像滚雪球一样增长,直到月底账单让你措手不及。

我见过一个团队做 AI 客服 Agent,上线时按“每次对话2次 LLM 调用”估算成本,结果实际运行后发现平均每个对话触发8次 LLM 调用——Agent 需要先理解意图,再检索知识库,然后生成回复,最后还要做质量检查。成本是预期的4倍,毛利率直接转负。

这篇文章的目的是把 AI Agent 的完整成本结构拆透。不只是 LLM 推理成本,还包括向量检索、记忆存储、工具调用等所有隐性成本,帮你建立一个准确的成本模型。

想按 DAU 和模型层级直接计算你的 Agent 月度成本?使用 LLM Economics 的 AI Agent 基础设施成本计算器,输入 DAU、每次会话的 LLM 调用次数和模型选择,获取完整月度成本预估。


一、AI Agent 的完整成本结构

一个生产级 AI Agent 的每次用户会话,通常涉及以下组件:

用户请求
  │
  ├─ 1. 意图理解(LLM调用 #1)
  │
  ├─ 2. 知识检索(向量数据库查询)
  │     └─ Embedding API调用(生成查询向量)
  │     └─ 向量数据库检索查询
  │
  ├─ 3. 工具调用决策(LLM调用 #2)
  │     └─ 外部API调用(如搜索、数据库查询)
  │
  ├─ 4. 结果整合与推理(LLM调用 #3, #4...)
  │
  ├─ 5. 回复生成(LLM调用 #N)
  │
  ├─ 6. 对话记忆写入(向量数据库写入 + 元数据存储)
  │
  └─ 7. 质量检查/安全过滤(LLM调用 #N+1,可选)

每一层都有成本。下面逐一拆解。


二、LLM 推理成本:最大的支出项

成本计算

LLM 推理是 Agent 中最大的成本项,通常占总成本的60%-80%。

计算公式:

$$\text{月LLM成本} = \text{DAU} \times \text{日均会话数} \times \text{每会话LLM调用次数} \times \text{平均每次调用的token成本}$$

其中:

$$\text{每次调用token成本} = \frac{\text{输入tokens} \times \text{输入单价} + \text{输出tokens} \times \text{输出单价}}{1,000,000}$$

典型 Agent 的 LLM 调用模式

一个典型的 RAG 增强 AI Agent,每次用户会话的 LLM 调用链路:

步骤 调用类型 输入 tokens 输出 tokens 说明
意图理解 LLM 500 50 判断用户意图和路由
查询改写 LLM 800 100 将用户问题改写为检索 query
知识整合 LLM 3000 500 将检索结果+用户问题整合
回复生成 LLM 1000 800 生成最终回复
质量检查 LLM 1500 100 检查回复质量和安全性
合计 5次 6800 1550

不同模型的月成本对比

假设 DAU=1000,每用户日均3次会话:

模型 单次会话成本 日成本 月成本
DeepSeek V4 Flash ($0.14/$0.28) $0.0014 $4.20 $126
DeepSeek V4 Pro ($0.435/$0.87) $0.0042 $12.60 $378
GPT-4.1 Mini ($0.80/$3.20) $0.0103 $30.90 $927
GPT-4.1 ($2.00/$8.00) $0.0260 $78.00 $2,340
Claude Sonnet 4.6 ($3/$15) $0.0227 $68.10 $2,043
Claude Opus 5 ($5/$25) $0.0713 $213.90 $6,417

从 DeepSeek V4 Flash 到 Claude Opus 5,月成本相差51倍。这再次说明了模型分级路由的重要性——如果 Agent 中5次 LLM 调用中有3次是简单任务(意图理解、查询改写、质量检查),完全可以路由到轻量模型,只有知识整合和回复生成才需要更强的模型。

模型分级路由在 Agent 中的应用

# Agent中的模型分级路由
MODEL_SIMPLE = "deepseek-v4-flash"      # 简单任务
MODEL_MEDIUM = "deepseek-v4-pro"        # 中等任务
MODEL_COMPLEX = "claude-sonnet-4-6"     # 复杂任务

# 路由策略
def get_model_for_step(step: str) -> str:
    if step in ["intent_understanding", "query_rewrite", "quality_check"]:
        return MODEL_SIMPLE        # 简单任务用Flash
    elif step in ["knowledge_synthesis"]:
        return MODEL_MEDIUM        # 中等任务用Pro
    elif step in ["response_generation"]:
        return MODEL_COMPLEX       # 复杂任务用Sonnet
    return MODEL_MEDIUM

使用分级路由后,成本估算:

步骤 模型 输入 输出 单次成本
意图理解 V4 Flash 500 50 $0.00007
查询改写 V4 Flash 800 100 $0.00014
知识整合 V4 Pro 3000 500 $0.0017
回复生成 Sonnet 4.6 1000 800 $0.0150
质量检查 V4 Flash 1500 100 $0.00024
合计 — 6800 1550 $0.0172

月成本 = 1000 × 3 × 30 × $0.0172 = $1,548

相比全用 Sonnet 4.6的$2,043,节省24%。相比全用 Opus 5的$6,417,节省76%。

在 AI Agent 基础设施成本计算器 中可以设置每个步骤的模型选择,自动计算分级路由下的总成本。


三、向量检索成本:RAG 的隐性支出

Embedding API 成本

RAG 流程的第一步是将用户查询转化为向量,这需要调用 Embedding API。

主流 Embedding 模型定价:

模型 单价 ($/1M tokens) 维度 说明
OpenAI text-embedding-3-large $0.13 3072 高精度
OpenAI text-embedding-3-small $0.02 1536 性价比
Google text-embedding-004 免费(AI Studio) 768 免费 tier
DeepSeek Embedding $0.014 1024 低价
开源模型(bge-m3等) 免费(自托管) 1024 需 GPU

Embedding 成本虽然单价低,但在高频检索场景下也不可忽略。1000 DAU × 日均3次会话 × 每次检索 query 50 tokens:

月Embedding成本(text-embedding-3-small) 
  = 1000 × 3 × 30 × 50 × $0.02 / 1,000,000 
  = $0.09

Embedding API 成本在这个量级几乎可以忽略。但如果你的 Agent 每次会话检索多条文档、每条文档都需要重新 embed(如动态文档入库),成本会上升。

向量数据库成本

这是 RAG 基础设施中最容易被低估的成本项。

主流向量数据库的价格对比:

方案 免费 tier 付费起步 计费方式 适用规模
Pinecone 100K vectors $70/月起 按节点+存储 中大型
Supabase (pgvector) 500MB $25/月起 按数据库实例 小中型
Weaviate Cloud 14天试用 $25/月起 按实例+存储 中型
Qdrant 1GB $25/月起 按实例+存储 小中型
Milvus (自托管) — 服务器成本 自托管 GPU/CPU 大型

对于1000 DAU 的 Agent 应用,向量数据库的月成本通常在$25-$100之间,取决于存储量和检索频率。

使用 RAG 成本计算器 可以对比 Pinecone、Supabase 和 Weaviate 的完整成本,找到最便宜的方案。

向量检索的实际成本

向量检索本身不按调用次数计费(除了 Pinecone Serverless 按读取单元计费),但检索延迟和检索质量直接影响用户体验和 LLM 成本:

  • 检索精度低 → 返回的文档不相关 → LLM 需要更多轮次才能给出好答案 → LLM 成本增加

  • 检索延迟高 → 用户等待时间长 → 体验下降

所以向量检索的“成本”不只是数据库费用,还包括因检索质量不足而导致的额外 LLM 调用成本。


四、记忆与存储成本

短期记忆(会话上下文)

Agent 在多轮对话中需要维护对话历史。这部分通常作为 prompt 的一部分传给 LLM,成本已经包含在 LLM 推理成本中。

但随着对话轮数增加,上下文长度增长,LLM 的输入 token 成本也会增长。一个10轮对话的上下文可能有5000-10000 tokens,每轮对话都要重新传入这些上下文。

优化策略:使用对话摘要(conversation summary)替代完整历史。每隔 N 轮,用一个轻量模型将之前的对话总结为500 tokens 的摘要,后续对话只传摘要+最近2轮对话。

长期记忆(用户画像/历史知识)

Agent 需要跨会话记住用户偏好和历史交互。这部分通常存储在向量数据库或关系数据库中。

存储成本估算:

每个用户的记忆向量数:50-200条
每条记忆的向量维度:1536(text-embedding-3-small)
每条向量存储大小:1536 × 4 bytes = 6KB
每用户存储:200 × 6KB = 1.2MB
1000用户总存储:1.2GB

1.2GB 的向量存储,在 Pinecone 中大约$70/月,在 Supabase 中包含在$25/月的实例中。

对话日志存储

每次对话的完整记录(用户输入、Agent 回复、工具调用、中间状态)需要持久化存储,用于审计、调试和模型优化。

1000 DAU × 日均3次会话 × 每次会话平均10KB 日志 = 30GB/月。

使用对象存储(如 S3、Cloudflare R2)存储,月成本约$0.5-$2。


五、工具调用成本

Agent 通常会集成外部工具(搜索、数据库查询、API 调用),这些工具也可能产生费用。

常见工具的成本

工具 计费方式 单次成本 说明
Web 搜索(SerpAPI) 按次 $0.01-$0.05 搜索引擎结果
Web 搜索(Tavily) 按次 $0.01-$0.03 AI 优化搜索
代码执行(E2B) 按秒 $0.001/秒 沙箱执行
图片生成(DALL-E) 按张 $0.04-$0.12 标准图片
浏览器自动化 按分钟 $0.05-$0.15 无头浏览器

如果你的 Agent 每次会话调用1-2个工具,工具成本大约$0.01-$0.10/会话。在高频场景下这也是一笔不可忽略的支出。

优化策略

  • 缓存工具调用结果(相同 query 的搜索结果可以缓存)

  • 限制工具调用次数(Agent 最多调用 N 个工具后必须给出回复)

  • 优先使用免费替代方案(如 Google Custom Search API 每天有100次免费配额)


六、完整成本模型:一个真实案例

把所有成本项汇总,来看一个1000 DAU 的 AI 客服 Agent 的完整月度成本:

基础假设

  • DAU:1000

  • 日均会话数/用户:3

  • 每会话 LLM 调用次数:5次(使用分级路由)

  • 每会话向量检索次数:2次

  • 每会话工具调用次数:1次

  • 使用模型:V4 Flash(简单任务)+ V4 Pro(中等任务)+ Sonnet 4.6(复杂任务)

月成本汇总

成本项 计算方式 月成本
LLM 推理(分级路由) 1000 × 3 × 30 × $0.0172 $1,548
Embedding API 1000 × 3 × 30 × 50 tokens × $0.02/1M $0.09
向量数据库(Supabase) 固定 $25
工具调用(Tavily 搜索) 1000 × 3 × 30 × $0.02 $1,800
对话日志存储 30GB × $0.023/GB $0.69
应用服务器 固定 $100
CDN/带宽 估算 $20
合计 — $3,494

等等——工具调用成本$1,800居然和 LLM 推理成本$1,548差不多?这在这个案例中确实如此,因为每次会话都触发了一次 web 搜索。

这揭示了一个重要洞察:Agent 的成本优化不能只盯着 LLM。工具调用、向量检索、基础设施都可能成为成本大头,具体取决于你的 Agent 架构。

优化后的成本

通过以下优化措施:

  1. 缓存搜索结果(50%命中率):工具调用降到$900

  2. Prompt Cache(80%命中率):LLM 成本降到$1,084

  3. 向量数据库迁移到 Qdrant 自托管:降到$15

  4. 日志存储使用 R2:降到$0.5

成本项 优化前 优化后 节省
LLM 推理 $1,548 $1,084 30%
工具调用 $1,800 $900 50%
向量数据库 $25 $15 40%
日志存储 $0.69 $0.50 28%
应用服务器 $100 $100 —
CDN/带宽 $20 $20 —
合计 $3,494 $2,120 39%

通过合理的优化,总成本降低了39%。

用 AI Agent 基础设施成本计算器 输入你的 DAU、会话频率和模型选择,自动生成完整的月度成本预估,包含 LLM 推理、工具调用和基础设施分项。


七、成本与 DAU 的 scaling 关系

理解成本如何随 DAU 增长,对规划至关重要。

固定成本 vs 变动成本

成本类型 成本项 随 DAU 增长?
固定成本 应用服务器、向量数据库实例 不变(阶梯式增长)
变动成本 LLM 推理、Embedding API、工具调用 线性增长
半变动成本 日志存储、带宽 低于线性增长

不同 DAU 级别的月成本

假设使用分级路由模型(V4 Flash + V4 Pro + Sonnet 4.6)+ 工具调用 + 基础设施:

DAU LLM 成本 工具成本 基础设施 月总成本 单 DAU 成本
100 $155 $180 $145 $480 $4.80
500 $774 $900 $160 $1,834 $3.67
1,000 $1,548 $1,800 $145 $3,493 $3.49
5,000 $7,740 $9,000 $200 $16,940 $3.39
10,000 $15,480 $18,000 $300 $33,780 $3.38

随着 DAU 增长,单 DAU 成本逐渐下降(固定成本被摊薄),但总成本线性增长。这意味着:

  • 盈亏平衡点:如果你的产品定价$9.99/月,单 DAU 成本$3.49,毛利率65%。在 DAU=1000时月收入$9,990,月成本$3,493,毛利$6,497。看起来不错。

  • 但高活跃用户:如果20%的用户日均会话是平均值的3倍(9次而非3次),这200人贡献的成本是$2,096,但收入只有$1,998(200 × $9.99),这200人整体亏损。

这再次验证了前面的结论:AI Agent 产品需要按使用量分级定价。


八、Agent 成本优化清单

LLM 层

检索层

工具层

基础设施层


九、使用 LLM Economics 工具链进行成本管理

在整个 Agent 生命周期中,LLM Economics 提供了完整的成本管理工具链:

工具 用途 链接
AI Agent 基础设施成本计算器 按 DAU 计算完整月成本 llmeconomics.app/ai-agent-infra-calculator
RAG 成本计算器 对比向量数据库方案成本 llmeconomics.app/rag-cost-calculator
AI 成本优化器 按年化节省排列所有降本机会 llmeconomics.app/ai-cost-optimizer-calculator
Token 预算计算器 从月度预算反推 token 配额 llmeconomics.app/token-budget-calculator
AI 客服 Bot ROI 计算器 计算 AI 客服替代人工的 ROI llmeconomics.app/ai-support-bot-calculator
AI 编码 Agent 成本计算器 对比 AI 编码工具成本 llmeconomics.app/ai-coding-agent-calculator

总结

AI Agent 的成本管理比普通 LLM 应用复杂得多,因为它的成本是多维度的——LLM 推理、向量检索、工具调用、记忆存储,每一层都有自己的计费逻辑和优化空间。

核心要点:

  1. LLM 推理是最大支出,但通过分级路由可以砍掉24%-76%。不要全用一个模型。

  2. 工具调用可能是隐性大头。在你的 Agent 架构中,每次会话触发的工具调用成本可能和 LLM 成本相当。缓存工具结果是性价比最高的优化。

  3. 向量检索成本不只是数据库费用。检索质量低导致的额外 LLM 调用才是更大的隐性成本。

  4. 建立完整的成本模型,不要只估算 LLM 成本。把 Embedding、向量数据库、工具调用、存储、服务器全算进去。

  5. 监控单 DAU 成本,按用户活跃度分群看成本分布。高活跃用户的亏损要用分级定价来覆盖。

AI Agent 的成本管理是一个持续的过程,不是一次性的优化。随着 DAU 增长、模型更新、功能迭代,成本结构会不断变化。定期用工具重新计算,保持成本可控。

开始计算你的 Agent 成本?访问 LLM Economics AI Agent 基础设施成本计算器,输入你的 DAU、模型选择和调用模式,获取完整的月度成本预估。


相关阅读:

  • 《2026年大模型 API 价格排行榜:GPT、Claude、Gemini、DeepSeek 最新对比》

  • 《如何选择大语言模型:AI 模型选型决策框架与实践指南》

  • 《LLM 降本三大策略:Prompt Cache、Batch API 与模型切换如何节省90%成本》

  • 《AI SaaS 定价指南:如何为你的 AI 产品定价不亏钱》


本文工具地址:https://llmeconomics.app/

posted @ 2026-08-30 21:26  小楼  阅读(28)  评论(0)    收藏  举报