- 文集信息
- 目录大纲
- 最新文档
- 知识宇宙
文集详情
文集导读
教程总纲 · 《LLM 可观测与成本治理》
总纲一句话:一本把"这一次调用发生了什么、花了多少钱、好不好"三件事一次讲透的中文教程——先用纯 Python 标准库自建一遍最小可观测,再谈工具选型与治理机制。
一、这本书讲什么
LLM 应用与传统服务最大的区别,不是"更聪明",而是每一次调用都在花钱、每一次输出都不完全可预测、每一次升级都在改变行为。本书围绕可观测性的三根支柱展开:
- 支柱一 · Trace(发生了什么):用 span 分层模型还原一次调用里的检索、模型调用、工具执行与子调用,用 trace_id 把用户、请求、日志与 token 串成一条线,并解决采样、脱敏与留存三个工程难题。
- 支柱二 · 成本(花了多少):token 三本账(输入、输出、缓存)把账算准,计费分摊把账摊清(团队/功能/用户三维),预算与告警线把账管住。
- 支柱三 · 质量(好不好):在线评测探针(抽样裁判)、用户反馈(显式信号与静默失败)、漂移信号(延迟分布、拒绝率、输出长度突变、主题漂移),让质量劣化在用户大规模投诉之前被看见。
三支柱之上,本书再给三层:诊断(LLM 故障四分类与排障树,把信号变成行动)、落地(把前半的零件总装成一个纯标准库完整脚本,再谈工具选型:OTel 生态与开源/商业平台判定)与治理(优化闭环——缓存、路由与模型分级三大杠杆;容量与限速规划)。全书的核心交付物之一是第 1.2 节《一张能力要求清单》——三层共 21 问,可直接拿去做团队自评与季度复评。
二、学习路径
第 0 章 导览 ── 三支柱一页图,先立心智模型 │ ▼ ┌─ 第一篇 · 三支柱(把账本立起来)────────────────────┐ │ 第 1 章 从传统监控到 LLM 可观测(变量全变了) │ │ 第 2 章 Trace 追踪 ←── 发生了什么 │ │ 第 3 章 成本观测 ←── 花了多少 │ │ 第 4 章 质量在线观测 ←── 好不好 │ └──────────────────────────────────────────────────┘ │ ▼ ┌─ 第二篇 · 诊断 ────────────────────────────────────┐ │ 第 5 章 告警与故障诊断(信号 → 行动) │ └──────────────────────────────────────────────────┘ │ ▼ ┌─ 第三篇 · 落地 ────────────────────────────────────┐ │ 第 6 章 落地实操(总装脚本 / 开源 / 商业选型) │ └──────────────────────────────────────────────────┘ │ ▼ ┌─ 第四篇 · 治理 ────────────────────────────────────┐ │ 第 7 章 成本治理实战(优化闭环 + 容量限速) │ └──────────────────────────────────────────────────┘
三支柱内部有先后依赖:第 2 章 Trace 是骨架,第 3 章成本与第 4 章质量都挂在 span 上记账与评分;因此建议 2 → 3 → 4 的顺序不要颠倒。
三、按需跳读
| 你的处境 | 建议入口 |
|---|---|
| 完全新手,想系统学 | 全书顺序读,跟写第 2、3 章代码 |
| 成本失控正在救火 | 第 3.1 节《token 三本账》→ 第 3.3 节《预算与告警线》 |
| 被用户投诉输出质量 | 第 4 章质量在线观测 → 第 5.1 节《LLM 应用的故障分类》 |
| 要写可观测性建设方案 | 第 1.2 节《一张能力要求清单》→ 第 7 章 + 附录 C 练习题 |
| 要选型/采购观测工具 | 第 6 章(先读第 2、3 章更有判断力) |
| 做智能体(agent)平台 | 第 2 章 + 《Harness 工程:从零打造智能体运行环境》第 9 章 |
| 深挖线上评测方法论 | 本书第 4 章之后转《Evals 实战:LLM 评测工程》 |
四、章节目录
第 0 章 导览
0.1 可观测到底要观测什么:三支柱一页图;0.2 学习路线与工具环境。
第 1 章 从传统监控到 LLM 可观测
1.1 变量全变了:非确定性、token 成本与版本飞轮;1.2 一张能力要求清单。
第 2 章 Trace 追踪
2.1 span 分层模型:调用、检索、工具与子调用;2.2 关联与传播:从用户到 token;2.3 采样、脱敏与留存。
第 3 章 成本观测
3.1 token 三本账:输入、输出与缓存;3.2 计费分摊与用量核算;3.3 预算与告警线。
第 4 章 质量在线观测
4.1 在线评测探针:抽样裁判与用户反馈;4.2 漂移信号面板。
第 5 章 告警与故障诊断
5.1 LLM 应用的故障分类;5.2 排障树:从告警到根因。
第 6 章 落地实操
6.1 自建最小可观测:纯标准库完整脚本;6.2 工具格局与选型。
第 7 章 成本治理实战
7.1 优化闭环:缓存、路由与模型分级;7.2 容量与限速规划。
附录
附录 A 术语表;附录 B 工具与指标速查;附录 C 练习题。
五、参考来源
- OpenTelemetry GenAI 语义约定草案(
gen_ai.*属性族;截至 2026-09 为实验态)与 W3C Trace Context 规范 - Langfuse、OpenLLMetry(Traceloop)、Arize Phoenix、LangSmith 官方文档
- Anthropic 官方 prompt 缓存定价口径(缓存读约为输入单价 1/10)
- Google SRE Book(告警设计、无责复盘)
- 公开搜索实测(2026-09):中文 LLM 可观测教程供需情况与工具格局
目录大纲
最新文档
知识宇宙
正在加载知识图谱...