LLM 可观测性栈选型


文档摘要

LLM 可观测性栈选型 本节摘要:2026 年的可观测市场裂成两类。开发平台(LangSmith、Langfuse、Comet Opik)把监控与评测、提示管理、会话回放打包在一起;网关/插桩工具(Helicone、SigNoz、OpenLLMetry、Phoenix)只专注遥测。Langfuse 是 MIT 核心加良好的开源平衡(云免费 5 万事件/月);Phoenix 在 Elastic License 2.

LLM 可观测性栈选型

本节摘要:2026 年的可观测市场裂成两类。开发平台(LangSmith、Langfuse、Comet Opik)把监控与评测、提示管理、会话回放打包在一起;网关/插桩工具(Helicone、SigNoz、OpenLLMetry、Phoenix)只专注遥测。Langfuse 是 MIT 核心加良好的开源平衡(云免费 5 万事件/月);Phoenix 在 Elastic License 2.0 下原生 OpenTelemetry,擅长漂移/RAG 可视化,但不是持久生产后端;Arize AX 用零拷贝 Iceberg/Parquet 集成,宣称比单体可观测便宜 100 倍;LangSmith 在 LangChain/LangGraph 上领先,39 美元/用户/月,仅企业版可自托管;Helicone 是代理式,15~30 分钟搭建,10 万请求/月免费,但 Agent 多步追踪深度较弱。常见生产模式:网关(Helicone/Portkey)+ 评测平台(Phoenix/TruLens),用 OpenTelemetry 粘起来

对应原课程:Phase 17 · Lesson 13 · 13-llm-observability(原英文 phases/17-infrastructure-and-production/13-llm-observability/docs/en.md)。

学习目标

阅读完本节,你应当能够:

  1. 区分开发平台(打包:评测 + 提示 + 会话)与网关/遥测工具(仅 trace + 指标)。
  2. 把六大工具(Langfuse、LangSmith、Phoenix、Arize AX、Helicone、Opik)映射到各自许可、定价、最佳命中用例。
  3. 解释让你把网关工具与独立评测平台组合的 OpenTelemetry 粘合模式。
  4. 说出 2026 年的成本差异化因素(Arize AX 的零拷贝 vs 单体摄入)及大致 100 倍乘数。

一、问题与直觉

你上线了一个 LLM 特性。能用。但你对提示失败、工具循环、延迟回归、成本尖峰、提示缓存命中率毫无可见度。你搜「LLM observability」,得到八个工具,都声称在三个不同价位上解决同一个问题。

它们解决的不是同一个问题。 LangSmith 答「这次 LangGraph 运行为何失败?」;Phoenix 答「我的 RAG 管道漂移了吗?」;Helicone 答「哪个应用在烧 token?」;Langfuse 答「我能自托管整套吗?」——不同工具、不同受众。

选型涉及四条轴:技术栈(LangChain?裸 SDK?多厂商?)、许可容忍(只 MIT?Elastic 行?商业也行?)、预算(免费层?100 美元/月?1000 美元/月?)、自托管(必须?可有可无?绝不?)。

二、核心概念

两大类

开发平台 把可观测与评测、提示管理、数据集版本化、会话回放打包。你能跑实验、看哪个提示奏效、对新提示做数据集回归。LangSmith、Langfuse、Comet Opik。

网关/遥测工具 给推理调用插桩——提示、响应、token、延迟、模型、成本。Helicone、SigNoz、OpenLLMetry、Phoenix。极简,可经 OpenTelemetry 与独立评测工具组合。

Langfuse —— 开源平衡

  • 核心 Apache/MIT 许可;经 Docker 自托管。
  • 云免费层:5 万事件/月。付费:团队 29 美元/月。
  • 评测、提示管理、trace、数据集,四项开发平台特性覆盖合理。
  • 命中:你要 LangSmith 级特性,但必须自托管或守开源许可。

Phoenix(Arize)—— 遥测优先、原生 OpenTelemetry

  • Elastic License 2.0;自托管极简。
  • RAG 与漂移可视化一流,embedding 空间散点图是一等构件。
  • 不为持久生产后端设计——主要是开发期可观测。
  • 命中:RAG 管道开发、漂移调试,配合独立网关做生产。

Arize AX —— 规模牌

  • 商业。经 Iceberg/Parquet 零拷贝数据湖集成。
  • 宣称大规模下比单体可观测(Datadog 级)便宜约 100 倍。算法:trace 存在你自己的 S3 Parquet 上,Arize 直读。
  • 命中:>1000 万 trace/天、已有数据湖、想要 LLM 专属仪表盘但不要 Datadog 价。

LangSmith —— LangChain/LangGraph 优先

  • 商业,39 美元/用户/月。仅企业版可自托管。
  • LangChain 与 LangGraph 栈上最佳。不在两者上就没那么有说服力。
  • 命中:团队已押注 LangChain、愿付费。

Helicone —— 代理式最小可行

  • OPENAI_API_BASE 换成 Helicone 代理,15~30 分钟搭建。
  • MIT 许可;10 万请求/月免费,付费 20 美元/月起。
  • 含故障转移、缓存、限流——同时充当网关。
  • Agent/多步 trace 深度较弱。
  • 命中:快速起步、单栈应用、要网关 + 可观测一体。

Opik(Comet)—— 开源开发平台

  • Apache 2.0,完全开源。
  • 特性集类似 Langfuse,带 Comet 血统。
  • 命中:已在 Comet 上的 ML 团队,想同一面板看 LLM 可观测。

SigNoz —— OpenTelemetry 优先的全 APM

  • Apache 2.0。经 OpenTelemetry 处理通用 APM 加 LLM。
  • 命中:跨服务与 LLM 调用的统一可观测。

粘合剂:OpenTelemetry + GenAI 语义约定

OpenTelemetry 在 2025 年末发布了 GenAI 语义约定(gen_ai.systemgen_ai.request.modelgen_ai.usage.input_tokens)。消费 OTel 的工具可互操作。正在涌现的生产模式:

  1. 从每个 LLM 调用发出带 GenAI 约定的 OTel。
  2. 路由到网关(Helicone / Portkey)做日常。
  3. 双发到评测平台(Phoenix / Langfuse)做回归。
  4. 归档进数据湖(Iceberg)做长期分析,经 Arize AX 或 DuckDB。

陷阱:在错误的层插桩

在 Agent 框架内部插桩(比如加 LangSmith trace)会把你和那个框架耦合。在 HTTP/OpenAI-SDK 层插桩(经 OpenLLMetry 或你的网关)才是可移植的。

采样 —— 你留不下全部

100 万请求/天以上,全 trace 留存比 LLM 调用本身还贵。按规则采样:100% 错误、100% 高成本、5% 成功。聚合永远留,原始只留长尾。

你该记住的数字

  • Langfuse 云免费:5 万事件/月。
  • LangSmith:39 美元/用户/月。
  • Helicone 免费:10 万请求/月。
  • Arize AX 宣称:大规模下比单体便宜约 100 倍。
  • OpenTelemetry GenAI 约定:2025 航运,2026 广泛采用。

三、从零实现:trace 采样模拟

原课程 code/main.py 跨留存策略(100% 摄入、采样、采样 + 错误)模拟一个 100 万 trace 的日子,报告各策略下存储成本与丢失了什么。下面给最小可读的采样骨架。

def sample_traces(traces, error_keep=1.0, high_cost_keep=1.0, success_keep=0.05, high_cost_threshold=0.01): """按规则采样的最简策略。 traces: [{'is_error':bool, 'cost_usd':float, 'trace_id':...}, ...] 返回: (保留的 trace 数, 保留率, 丢失的错误数) """ import random kept, lost_errors = 0, 0 for t in traces: if t["is_error"]: keep = random.random() < error_keep elif t["cost_usd"] >= high_cost_threshold: keep = random.random() < high_cost_keep else: keep = random.random() < success_keep if keep: kept += 1 elif t["is_error"]: lost_errors += 1 rate = round(kept / len(traces), 3) return kept, rate, lost_errors # 模拟 100 万 trace:1% 错误, 0.1% 高成本(>0.01 美元) import random random.seed(0) traces = [{"is_error": random.random() < 0.01, "cost_usd": 0.002 if random.random() > 0.001 else 0.02} for _ in range(1_000_000)] kept, rate, lost = sample_traces(traces) print(f"保留 {kept} 条 ({rate*100:.1f}%), 丢失错误 {lost} 条") # 100% 错误 + 100% 高成本 + 5% 成功 → 大致省 95% 存储,却不丢任何错误

💡 采样的关键不是「省多少」,而是「丢什么」。100% 留错误与高成本、5% 留成功,是成本与诊断能力的最佳平衡——你永远不希望在故障复盘时发现关键 trace 被采样掉了。

四、框架对比:六大工具横向对照

工具 类别 许可 定价 命中
Langfuse 开发平台 MIT 核心 云免费 5 万事件/月 自托管、守开源
LangSmith 开发平台 商业 39 美元/用户/月 LangChain/LangGraph 深度
Opik 开发平台 Apache 2.0 开源 已在 Comet 上的团队
Phoenix 遥测/评测 Elastic 2.0 开源 RAG 漂移、开发期
Helicone 网关/遥测 MIT 10 万请求/月免费 代理式、网关一体
Arize AX 规模可观测 商业 零拷贝数据湖 >1000 万 trace/天

生产模式:网关(Helicone/Portkey)日常 + 评测平台(Phoenix/Langfuse)回归 + 数据湖(Arize AX/DuckDB)长期,全用 OpenTelemetry + GenAI 约定粘合。

五、可复用产物

本节产出 outputs/skill-observability-stack.md(原课程目录)。给定技术栈、规模、预算、许可姿态,它选出工具组合:

  1. 类别判定:要打包开发平台还是仅遥测。
  2. 工具映射:六大工具按许可/定价/命中点的决策表。
  3. 粘合架构:OTel + GenAI 约定的双发 + 归档拓扑。
  4. 采样策略:按错误/成本/成功的留存比例。

六、练习

  1. LangChain 团队选型:你的团队在 LangChain 上,要开源自托管可观测。选 Langfuse 还是 Opik,论证。

  2. Arize 回本:500 万 trace/天,Datadog 报价 15 万美元/月。算 Arize AX 的回本。

  3. OTel 约定:设计一套你组织应在每个 LLM 调用上强制要求的 OpenTelemetry GenAI 属性集。

  4. Phoenix 够吗:论证 Phoenix 单独是否足以生产。何时不够?

  5. 代理开销:Helicone 代理开销 20 ms。在 P99 TTFT 300 ms 时可接受吗?SLA 100 ms 时呢?

本节要点回顾

  1. 两类可观测:开发平台(打包评测+提示+会话)vs 网关/遥测(仅 trace+指标)。
  2. Langfuse 是开源平衡:MIT 核心,云免费 5 万事件/月,自托管友好。
  3. Phoenix 是遥测优先:Elastic 2.0,原生 OTel,RAG/漂移可视化强,非持久生产后端。
  4. Arize AX 是规模牌:零拷贝 Iceberg/Parquet,宣称大规模下便宜 100 倍。
  5. LangSmith 是 LangChain 优先:39 美元/用户/月,仅企业版自托管。
  6. Helicone 是代理式网关:15~30 分钟搭建,网关 + 可观测一体,Agent trace 深度弱。
  7. OpenTelemetry + GenAI 约定是粘合剂:让网关与评测平台互操作。
  8. 在 HTTP/SDK 层插桩才可移植:在 Agent 框架内插桩会耦合。
  9. 采样是必需:100% 错误 + 100% 高成本 + 5% 成功,聚合永远留。

下一节,我们看可观测性的「省钱版」——提示缓存与语义缓存:何时值得、何时是陷阱、命中率与合规如何权衡。


发布者: 作者: Rohit Gupta 转发
评论区 (0)
U