Langfuse 和 LangSmith:LLM 可观测性两大平台怎么选
你的 Agent 在生产环境跑了一周,用户投诉回答质量差。你打开日志,看到的是几万行 JSON——哪次调用检索错了文档、哪次工具返回了垃圾数据、哪次模型幻觉了,全靠 grep 碰运气。这不是工程问题,是缺基础设施:LLM 应用的调用链是树状的、非确定性的,传统 APM(监控)那套按接口聚合的思路根本对不上。
Langfuse 和 LangSmith 就是补这一层的。一个开源、可自托管,2026 年初被 ClickHouse 收购;一个闭源 SaaS,背后是 LangChain。这篇文章把它们放到同一张桌上对比,帮你判断自己的团队该用哪个。
本文 outline
- 先说清楚它们解决什么问题
- Langfuse:开源派的全面反击
- LangSmith:绑定 LangChain 生态的官方答案
- 六个维度正面对比
- 怎么选:三种典型场景
- 附:两家共用的核心概念速查
1. 它们解决的是同一类问题
LLM 可观测性平台的核心工作是把"一次用户请求"背后的完整过程记录成一棵追踪树(trace):根节点是用户输入,子节点依次是检索调用、工具执行、LLM 调用,每个节点带完整的输入输出、token 数、延迟和成本。有了这棵树,调试就从"翻日志"变成"看图"。
在这之上,两家都长出了同一套功能版图:
- 评测(Evaluation):把生产 trace 沉淀成数据集,用 LLM-as-a-judge、代码规则、人工标注三种方式打分
- Prompt 管理:版本化、标签化(如 production 标签),改 Prompt 不用改代码、不用重新发版
- 监控看板:成本、延迟、错误率、用户反馈的聚合视图
- 人工标注队列:把可疑 trace 派给团队成员审核,形成数据飞轮
差别在于实现路径和商业模式:Langfuse 押注开源和自托管,LangSmith 押注 SaaS 和深度绑定 LangChain 生态。
2. Langfuse:开源派的全面反击
Langfuse 2023 年创建于柏林,Y Combinator W23 批次,GitHub 上 34k+ star。2026 年 1 月被 ClickHouse 收购,整个团队并入,产品继续开源。当前主版本 v4,仓库更新频繁到一周多个 release。
许可证是最容易以讹传讹的一点:网上流传"Langfuse 2025 年改成了 AGPL",实际查 LICENSE 文件是 MIT——而且 2025 年 6 月的变更方向恰恰相反,官方宣布"Doubling Down on Open Source",把原本商业版的 LLM-as-a-judge 托管评测器、Playground、Prompt 实验、标注队列全部并进 MIT 核心。现在只剩 SCIM、审计日志、数据保留策略这类企业安全功能留在商业许可(ee/ 目录)里。
技术架构上它做了几次大决定。2024 年底 v3 把分析层从 Postgres 换成 ClickHouse,支撑规模化查询;v4 改成"observations-first"数据模型,事件先写 S3 再异步摄入 ClickHouse,面向十亿级事件量。自托管生产部署的推荐路径是 Kubernetes + Helm,需要 Web + Worker 两个容器加 Postgres、ClickHouse、Redis、S3 四件套,三大云厂商都有官方 Terraform 模块。SDK 层 v3 起全部构建在 OpenTelemetry 之上,天然 vendor-neutral——不满意随时把 trace 导到别家,不锁死。
功能面到 2025 年底已经很齐:Agent Graphs(从观测时序自动推断 Agent 执行流图)、会话回放、成本追踪带模型分级定价(比如 Gemini 2.5 Pro 按上下文长度分档)、Slack/webhook 阈值告警、100+ 集成(LangChain、LlamaIndex、CrewAI、Vercel AI SDK、LiteLLM 等)。2026 年还加了 Claude Code、Cursor 这类编码 Agent 的集成——你的 AI 写代码的过程本身也可以被追踪。
3. LangSmith:绑定 LangChain 生态的官方答案
LangSmith 是 LangChain 公司的商业产品,闭源 SaaS,客户端 SDK 开源(MIT)。官方口径 7000+ 团队在用,每月处理 1 亿+ trace,财富 10 强里有 5 家。Klarna、Cisco、Salesforce、Toyota 北美都在客户名单上。
它的独特优势是与 LangChain/LangGraph 的原生集成:LangGraph 的每一步状态流转自动出现在 trace 里,LangSmith Studio 能交互式单步调试 Agent 图,LangSmith Engine 每 6 小时自动聚类分析 trace、找重复失败模式并给根因诊断。如果你的技术栈就是 LangChain 全家桶,这个集成深度没有第三方能复制。
产品这两年的走向是从可观测性膨胀成平台:Agent Server(LangGraph Platform 并入后的部署服务,容器化 API + 队列 worker)、LLM Gateway(模型访问 + 花费管控)、Sandboxes(代码执行隔离)、Fleet(托管的 Agent 运行时计算)。也就是说 LangChain 想让你从开发、调试、评估到部署都在一个屋檐下。
框架支持面其实不窄:OpenAI、Anthropic、CrewAI、Vercel AI SDK、Pydantic AI、LlamaIndex 都有原生埋点,Python/TS/Go/Java 四种 SDK,wrap_openai() 一行包装零侵入,也支持标准 OpenTelemetry OTLP 端点接入。但最好的体验始终留给自家框架。
4. 六个维度正面对比
| 维度 | Langfuse | LangSmith |
|---|---|---|
| 开源 | MIT 核心 + 企业目录商业许可 | 闭源(SDK 开源) |
| 部署 | 自托管(Docker/K8s/Terraform)或云(EU/US/JP/HIPAA 区) | SaaS 为主;企业版可自托管/Hybrid/BYOC |
| 数据层 | 自带 ClickHouse,事件先落 S3 | 云端 GCP us-central1,SmithDB 号称快 12 倍的 trace 查询 |
| 生态集成 | 100+ 框架集成,OTel 原生 | LangChain/LangGraph 独占档,OTel 支持 |
| 计价 | 自托管免费无限量;云按 unit($8/10 万) | 按 trace + LCU 计算单元($1.50/单元)+ 席位费 |
| 企业能力 | SCIM、审计日志在商业版;HIPAA 区需 Pro+ | SSO/SCIM/RBAC+ABAC、SOC 2、SLA 齐备 |
几个值得展开的差异点。
数据保留策略差异很大。LangSmith 云端基础 trace 只保留 14 天(延长到 400 天要加钱),Langfuse 云端 Pro 档保留 3 年、自托管则完全由你决定。如果你的合规场景要求长期留存证据链,这可能是决定性因素。
计价模型决定了成本曲线。Langfuse 的"unit"是 trace、观测、评分任意一种,量大了单价从 $8/10 万递减到 $6/10 万,可预测;LangSmith 是 trace + LCU(计算)+ LSU(存储)的组合计价,Engine 跑一轮 5-30 LCU、Tuned Evaluators 每次评估 0.01 LCU——功能越用越多,账单越难提前算清。
人工评估能力 LangSmith 更成熟。标注队列支持 rubric 评分标准、审核者预约、Pairwise Annotation Queue(两个版本并排 A/B 对比),自动规则能把报错或点踩的 run 自动进队列。Langfuse 也有标注队列和 Score Analytics,但体验上 LangSmith 做得更深。
LLM-as-a-judge 两家都内置了。Langfuse 有分步 judge、分类 judge(如用户意图识别),Score Analytics 能把自动 judge 和人工标注对齐比较;LangSmith 的 Perceived Error 评估器按次计费,加上 Engine 的自动根因分析,自动化程度更高。
5. 怎么选:三种典型场景
场景一:数据不能出内网(金融、医疗、政务、大厂内部平台)。答案没有悬念:Langfuse 自托管。Docker Compose 半小时起一套,数据全在自己 VPC 里,用量不受限。LangSmith 虽然企业版也有 self-hosted 和 BYOC(数据面在你 AWS 账号里),但要走年度合同谈 license,门槛不在一个量级。
场景二:技术栈就是 LangChain/LangGraph。用 LangSmith,至少先用起来。trace 与 graph 状态的原生映射、Studio 单步调试、Engine 自动根因分析,这些是框架作者才能做出来的深度。生态绑定是双刃剑,但调试效率是实打实的。Developer 档免费 5000 trace/月,试错成本为零。
场景三:预算敏感或多框架混用。Langfuse 云的 Hobby 档免费 5 万 unit/月(2 个用户),Core 档 $29/月不限用户数——小团队基本花不到什么钱。多框架方面两家支持面都够广,但 Langfuse 的 OTel-first 架构意味着即使某天换平台,埋点数据格式也是标准的。
一个常见的实用路线:开发期用 LangSmith 白嫖免费额度做调试(Studio 确实好用),生产环境用 Langfuse 自托管做长期观测。两家的埋点都是环境变量级别的配置,切换成本不高。
6. 附:两家共用的核心概念速查
不管选哪家,这几个概念是一样的,学一次到处用:
- Trace:一次完整请求的追踪树根节点
- Observation / Run:树上的每个节点(Langfuse 叫 observation,LangSmith 叫 run)
- Session / Thread:把多轮对话的多个 trace 串成会话(LangSmith 用 thread_id)
- Dataset + Experiment:数据集 + 在数据集上跑的实验,回归测试的基本单元
- Score / Feedback:挂在 trace 上的评估结果,来源可以是 LLM judge、代码规则、用户点赞点踩
上手代码都是几行的事。LangSmith:
import os
os.environ["LANGSMITH_TRACING"] = "true"
os.environ["LANGSMITH_API_KEY"] = "ls__..."
# LangChain 调用自动被追踪;裸 OpenAI 则包一层
from langsmith import wrap_openai
import openai
client = wrap_openai(openai.Client())
Langfuse:
from langfuse.openai import openai # drop-in 替换 import
resp = openai.chat.completions.create(
model="gpt-4o",
messages=[{"role": "user", "content": "你好"}],
)
两家都支持用 OpenTelemetry 标准端点接入,意味着 instrumentation 代码可以写成厂商无关的。
参考
- Langfuse GitHub — 34k+ star,MIT 核心,v4 架构文档
- Langfuse 官网与定价 — 自托管免费、云端四档计价
- LangSmith 文档 — Tracing、评测、Prompt Hub 全文档
- LangChain 定价页 — Developer/Plus/Enterprise 与 LCU/LSU 计价
- Langfuse joins ClickHouse — 2026 年 1 月收购公告
- langsmith-sdk — 开源客户端 SDK
作者: itech001
来源: 公众号:AI人工智能时代(the-ai-era)
网站: https://www.theaiera.top/
关注每日最新AI新闻和技术博客,主页有更多的文章的AI 技术参考:https://www.theaiera.top
关注公众号,获取更多 AI 技术干货!

浙公网安备 33010602011771号