本节摘要:6.1 与 6.2 分别展开了离线端(Promptfoo)与在线端(Langfuse),但工具市场还有一整排专项选手:DeepEval 把断言做成 pytest 风格,评测混进单测流水线;RAGAS 专攻 RAG 指标(忠实度、回答相关性、上下文精确率——第 4.3 节手工审计的自动化版);LangSmith 是 LangChain 系的全家桶(trace + 数据集 + 评估 + 标注);Braintrust 面向企业,主打实验管理与 OTel 集成;Inspect-ai 出自英国 AI 安全研究所(UK AISI),为安全基准与大规模评测任务编排而生。本节给出六家横评表(Promptfoo 已详述,作为参照系列在表头)与一棵选型决策树,然后是三个常见组合拳:个人/小团队的"Promptfoo + Langfuse"、pytest 存量团队的"DeepEval + Langfuse"、RAG 产品的"+RAGAS"。最后点破三个选型反模式:同时上三家重复跑分、拿观测平台当回归工具、为"将来可能"提前采购企业版。工具信息截至 2026-09,能力边界以各家官方文档为准。
阅读完本节,你应当能够:
| 工具 | 定位 | 形态 | 甜点 | 弱点 / 注意 |
|---|---|---|---|---|
| DeepEval | 评测断言库 | pytest 风格 Python 库 | 已有 pytest 流水线的团队零迁移成本;指标即测试函数 | 不是平台:无 Web UI、无线上观测 |
| RAGAS | RAG 指标库 | Python 库 | 忠实度 / 回答相关性 / 上下文精确率等开箱指标(多数基于 LLM 裁判计算) | 只管 RAG 打分,跑分编排与报告要自己搭或配他家的 |
| LangSmith | LangChain 系观测+评测平台 | SaaS(为主) | 与 LangChain/LangGraph 深度集成;trace、数据集、标注、评估一体 | 绑定 LangChain 栈最深;开源程度与自托管选项有限(以官方为准) |
| Braintrust | 企业评测与实验平台 | SaaS + API | 实验管理与对比、OTel 集成打通自有遥测、企业权限审计 | 企业向定价;开源程度有限(以官方为准) |
| Inspect-ai | 安全基准与评测编排框架 | 开源 Python 框架(UK AISI) | 大规模评测任务编排、安全类基准(AJD/越狱等)内置,适合严肃基准与红队研究 | 学习曲线偏研究向;线上观测非其主业 |
| Langfuse | 开源观测 + evals 平台 | 自托管 / 托管云 | trace 采集、在线 evals 三路评分、数据闭环(6.2 节) | 离线批量跑分与断言编排弱于 Promptfoo 这类专用框架 |
参照系:Promptfoo——离线回归 + 红队 + 本地优先 + yaml 配置即评测(6.1 节)。
⚠️ 表中"开源程度 / 定价"随时间变化快,采购与自托管决策前以官方文档与许可协议为准;本表截至 2026-09,仅作选型坐标系。
你要解决的首要问题是什么? │ ├─ 离线:每次改 prompt/模型,想要一张可对比的成绩单 │ ├─ 数据敏感 / 想本地优先 ────────────▶ Promptfoo │ ├─ 团队已有 pytest 流水线 ───────────▶ DeepEval(+ Promptfoo 做对比 UI) │ └─ 要做严肃安全基准/红队研究 ─────────▶ Inspect-ai │ ├─ 线上:想知道真实用户拿到了什么、质量随时间怎么变 │ ├─ LangChain 深度用户 ──────────────▶ LangSmith │ └─ 其余(尤其要开源自托管)─────────▶ Langfuse │ ├─ 特定形态:RAG 应用要打忠实度等指标 ────▶ RAGAS(嵌进上述任一框架) │ └─ 组织级:多团队实验管理、OTel 遥测打通 ──▶ Braintrust
决策树的用法(观点):先定两端(离线跑分 + 线上观测),再补专项——两端是地基,专项(RAGAS、红队)挂在任一端上都能用;反过来先买平台再想考卷,就是第 0.2 节警告的"拿着锤子找钉子"。
| 团队画像 | 组合 | 接法 |
|---|---|---|
| 个人 / 小团队 | Promptfoo + Langfuse | yaml 回归集进仓库(9.1);线上 trace 抽样回补回归集(6.2 闭环) |
| pytest 存量团队 | DeepEval + Langfuse | 断言写成测试函数混进 CI 单测(9.2 门禁少一层胶水);观测仍走 Langfuse |
| RAG 产品团队 | 上任一组合 + RAGAS | RAGAS 指标作为 DeepEval/Promptfoo 的一个断言/评分器调用;忠实度抽查口径与第 4.3 节对齐 |
💡 组合的粘合剂是数据格式:回归集用统一 JSONL(第 9.1 节目录约定),trace 抽样导出也落同一格式——工具可以换,考卷不动。
选型结论不能一步到位——团队对工具的消化能力和考卷的成熟度都在变(观点节奏):
| 阶段 | 考卷状态 | 动作 | 进入下一阶段的标志 |
|---|---|---|---|
| 第 1 步:脚本期 | 回归集 < 50 条,还在攒 | 用第 3~5 章的纯脚本跑分;任何工具都不采购 | 回归集 ≥ 100 条且每周固定重跑 |
| 第 2 步:单工具期 | 回归集成形,跑分要进流程 | 上 Promptfoo(或 DeepEval),yaml 进仓库,--threshold 进 CI |
出现"线上怎么样"的问题(第 8 章信号) |
| 第 3 步:组合期 | 离线在线两端都有需求 | 加观测平台(Langfuse 等),必要时补 RAGAS 专项 | 双向闭环跑起来(6.2 节周向/月向节奏) |
💡 每一步只加一个工具。工具的隐性成本(配置维护、升级跟进、团队学习)通常在第二个季度才显现——一次上三个工具的团队,通常在同一个季度退回两个(社区经验,示意)。
工具装好了,但别忘了被测对象的本体:一个输出概率与置信度的系统。下一章进入概率系统评测的三个实操——可靠性曲线与 ECE、代价化阈值、PSI 漂移检测——把第 4 章的指标口径变成可运行、可报警的生产参数。