LLM 可观测与成本治理


  • 文集信息
  • 目录大纲
  • 最新文档
  • 知识宇宙

文集详情

文集导读

教程总纲 · 《LLM 可观测与成本治理》

总纲一句话:一本把"这一次调用发生了什么、花了多少钱、好不好"三件事一次讲透的中文教程——先用纯 Python 标准库自建一遍最小可观测,再谈工具选型与治理机制。

一、这本书讲什么

LLM 应用与传统服务最大的区别,不是"更聪明",而是每一次调用都在花钱、每一次输出都不完全可预测、每一次升级都在改变行为。本书围绕可观测性的三根支柱展开:

  • 支柱一 · Trace(发生了什么):用 span 分层模型还原一次调用里的检索、模型调用、工具执行与子调用,用 trace_id 把用户、请求、日志与 token 串成一条线,并解决采样、脱敏与留存三个工程难题。
  • 支柱二 · 成本(花了多少):token 三本账(输入、输出、缓存)把账算准,计费分摊把账摊清(团队/功能/用户三维),预算与告警线把账管住。
  • 支柱三 · 质量(好不好):在线评测探针(抽样裁判)、用户反馈(显式信号与静默失败)、漂移信号(延迟分布、拒绝率、输出长度突变、主题漂移),让质量劣化在用户大规模投诉之前被看见。

三支柱之上,本书再给三层:诊断(LLM 故障四分类与排障树,把信号变成行动)、落地(把前半的零件总装成一个纯标准库完整脚本,再谈工具选型:OTel 生态与开源/商业平台判定)与治理(优化闭环——缓存、路由与模型分级三大杠杆;容量与限速规划)。全书的核心交付物之一是第 1.2 节《一张能力要求清单》——三层共 21 问,可直接拿去做团队自评与季度复评。

二、学习路径

第 0 章 导览 ── 三支柱一页图,先立心智模型 │ ▼ ┌─ 第一篇 · 三支柱(把账本立起来)────────────────────┐ │ 第 1 章 从传统监控到 LLM 可观测(变量全变了) │ │ 第 2 章 Trace 追踪 ←── 发生了什么 │ │ 第 3 章 成本观测 ←── 花了多少 │ │ 第 4 章 质量在线观测 ←── 好不好 │ └──────────────────────────────────────────────────┘ │ ▼ ┌─ 第二篇 · 诊断 ────────────────────────────────────┐ │ 第 5 章 告警与故障诊断(信号 → 行动) │ └──────────────────────────────────────────────────┘ │ ▼ ┌─ 第三篇 · 落地 ────────────────────────────────────┐ │ 第 6 章 落地实操(总装脚本 / 开源 / 商业选型) │ └──────────────────────────────────────────────────┘ │ ▼ ┌─ 第四篇 · 治理 ────────────────────────────────────┐ │ 第 7 章 成本治理实战(优化闭环 + 容量限速) │ └──────────────────────────────────────────────────┘ ​

三支柱内部有先后依赖:第 2 章 Trace 是骨架,第 3 章成本与第 4 章质量都挂在 span 上记账与评分;因此建议 2 → 3 → 4 的顺序不要颠倒。

三、按需跳读

你的处境 建议入口
完全新手,想系统学 全书顺序读,跟写第 2、3 章代码
成本失控正在救火 第 3.1 节《token 三本账》→ 第 3.3 节《预算与告警线》
被用户投诉输出质量 第 4 章质量在线观测 → 第 5.1 节《LLM 应用的故障分类》
要写可观测性建设方案 第 1.2 节《一张能力要求清单》→ 第 7 章 + 附录 C 练习题
要选型/采购观测工具 第 6 章(先读第 2、3 章更有判断力)
做智能体(agent)平台 第 2 章 + 《Harness 工程:从零打造智能体运行环境》第 9 章
深挖线上评测方法论 本书第 4 章之后转《Evals 实战:LLM 评测工程》

四、章节目录

第 0 章 导览
0.1 可观测到底要观测什么:三支柱一页图;0.2 学习路线与工具环境。

第 1 章 从传统监控到 LLM 可观测
1.1 变量全变了:非确定性、token 成本与版本飞轮;1.2 一张能力要求清单。

第 2 章 Trace 追踪
2.1 span 分层模型:调用、检索、工具与子调用;2.2 关联与传播:从用户到 token;2.3 采样、脱敏与留存。

第 3 章 成本观测
3.1 token 三本账:输入、输出与缓存;3.2 计费分摊与用量核算;3.3 预算与告警线。

第 4 章 质量在线观测
4.1 在线评测探针:抽样裁判与用户反馈;4.2 漂移信号面板。

第 5 章 告警与故障诊断
5.1 LLM 应用的故障分类;5.2 排障树:从告警到根因。

第 6 章 落地实操
6.1 自建最小可观测:纯标准库完整脚本;6.2 工具格局与选型。

第 7 章 成本治理实战
7.1 优化闭环:缓存、路由与模型分级;7.2 容量与限速规划。

附录
附录 A 术语表;附录 B 工具与指标速查;附录 C 练习题。

五、参考来源

  • OpenTelemetry GenAI 语义约定草案(gen_ai.* 属性族;截至 2026-09 为实验态)与 W3C Trace Context 规范
  • Langfuse、OpenLLMetry(Traceloop)、Arize Phoenix、LangSmith 官方文档
  • Anthropic 官方 prompt 缓存定价口径(缓存读约为输入单价 1/10)
  • Google SRE Book(告警设计、无责复盘)
  • 公开搜索实测(2026-09):中文 LLM 可观测教程供需情况与工具格局

目录大纲

    最新文档

    知识宇宙

    正在加载知识图谱...


    转发
    作者与出处
    发布者 / 整理账号: 灏天
    本站整理收录,版权归原作者/开源协议所有;欢迎通过原文链接访问源仓库。
    《LLM 可观测与成本治理》是什么?
    一本把"这一次调用发生了什么、花了多少钱、好不好"三件事一次讲透的中文教程——先用纯 Python 标准库自建一遍最小可观测,再谈工具选型与治理机制。 本站提供目录导航、全文检索与在线阅读,便于系统化学习。
    《LLM 可观测与成本治理》适合谁阅读?
    适合希望系统学习《LLM 可观测与成本治理》的初学者,以及需要查漏补缺、按需查阅的进阶学习者。
    《LLM 可观测与成本治理》包含哪些内容?
    文集围绕主题系统展开,共收录 30 篇文档。本站将全部内容按目录结构化呈现,支持全文检索与在线阅读,方便按主题跳转与反复查阅。
    《LLM 可观测与成本治理》的内容从何而来?
    本文集由灏天文库平台收录,内容或由平台用户上传分享,仅供学习交流,版权归原作者所有。
    《LLM 可观测与成本治理》的版权如何归属?
    本文集版权归原作者所有,灏天文库平台仅提供在线收录与学习展示;如需转载或商用请遵循原版权方要求。