LLM 可观测与成本治理 · 第 3 章 成本观测


LLM 可观测与成本治理 · 第 3 章 成本观测

章节摘要:成本支柱把"每次调用都花钱"变成"每分钱都说得清"。第 3.1 节立 token 三本账——输入、输出、缓存三账分记:输出单价通常为输入的数倍、缓存命中价约为输入价的 1/10(官方,Anthropic 口径),只记总 token 的账等于没记;本节附记账与日结算代码,并盘点三个典型口径错误。第 3.2 节做计费分摊:按团队/功能/用户三维把账摊清,公共成本按量二次分摊,未打标的行单列不许摊薄,再与供应商账单对账、输出用量核算报表。第 3.3 节管钱:预算层级(公司→团队→功能→会话)配三线告警(提醒/暂停/升级),附消耗速率检查器与会话级熔断代码。读完本章,能力清单第 2、3、15、16 问应能转"能"。

学习目标

  • 说清三本账口径:输入、输出、缓存读/写,以及各自的量级差
  • 运行记账代码:从 usage 到美元,输出日结算与缓存节省估算
  • 按团队/功能/用户三维分摊,处理公共成本与未打标行
  • 设计预算层级与三线告警,并实现会话级 token 熔断
  • 产出一份含量化指标的用量核算周报(含单位经济两个指标)
  • 会用"三本账哪本涨"的口诀完成一次成本突增的初步归因

核心概念速览

一次 LLM 调用的 token ├── 账一:输入 token(prompt) 单价 ★ ├── 账二:输出 token(completion) 单价 ★★★(通常为输入 3~5 倍,示意) └── 账三:缓存账 ├── 缓存命中(读) 单价 ☆(约为输入价 1/10,官方口径) └── 缓存写入 单价 ★+(略高于输入价,官方口径) (文字流程图) usage ──▶ 三本账记账 ──▶ 三维分摊 ──▶ 预算检查 ──▶ 告警/熔断 (3.1) (3.2) (3.3) 本章三条铁律,先背下来再读细节: ① token 数只认供应商 usage 字段(官方口径),自数必错; ② 只记总 token 的账等于没记——三本账一旦合并,归因证据即被销毁; ③ 最坏情况下的单会话损失必须是设计值,而不是意外。 ​

一句话金句:只记总 token 的成本账等于没记——你既不知道钱被输出还是输入吃掉,也不知道缓存帮你省了多少。

子章节导航

3.1 token 三本账:输入、输出与缓存

三本账口径与单价结构、记账与日结算代码、三个典型口径错误(自数 token、忽略缓存写加价、只存总额),以及成本突增的三个典型来源。

3.2 计费分摊与用量核算

团队/功能/用户三维分摊脚本、公共成本的二次分摊、未打标行处理、与供应商账单对账的容忍度、用量核算报表模板。

3.3 预算与告警线

预算四层层级、三线告警设置法(提醒/暂停/升级)与消耗速率检查器代码、会话级熔断,以及"预算不是越低越好"的成本质量联动观。

子章节之间的逻辑关系

┌──────────────┐ 记准(口径) ┌──────────────┐ 摊清(归因) ┌──────────────┐ │ 3.1 三本账 │ ────────────▶ │ 3.2 分摊核算 │ ───────────▶ │ 3.3 预算告警 │ │ 每次调用花多少│ │ 每个维度花多少│ │ 花超了怎么办 │ └──────────────┘ └──────────────┘ └──────┬───────┘ ▲ │ └────────────── 数据全部来自第 2.2 节挂在 span 上的 usage ────────┘ (熔断信号回流,关闭治理回路) ​

前置知识与后续延伸

  • 前置:第 2.2 节的"usage 挂 span"(本章账本行的数据来源);第 1.2 节清单的第 2、3 问(本章要解的两问)。
  • 后续:第 5 章的故障分类与排障树以本章三线告警为入口;第 7.1 节把"从账本到动作"的优化闭环制度化(本章是它的数据底座)。
  • 延伸阅读:缓存命中率怎么提上去(本章管算账,他们管省账)见本站《请求缓存与智能路由降低 token 成本》文集;自部署推理场景的成本口径(GPU 折旧替代 API 计价)见本站《大模型 LLM 推理和部署理论与实践》文集;harness 视角的 token 账本见《Harness 工程:从零打造智能体运行环境》第 9 章。

作者与出处
原作者: 灏天文库
整理: 灏天文库整理
本站整理收录,版权归原作者/开源协议所有;欢迎通过原文链接访问源仓库。
发布者: 作者: 灏天文库 转发
评论区 (0)
U