附录 A · 术语表
用途:全书术语按主题分组速查;"详见"列为纯文字章节引用。术语保留英文原词的,释义首次出现以中英对照给出。
一、基础与三支柱
| 术语 |
释义 |
详见 |
| 可观测性(observability) |
只凭系统外部输出,能把内部状态推断到什么程度;回答"为什么发生" |
第 0.1 节 |
| 监控(monitoring) |
预定义检查 + 阈值告警;回答"是否正常",面向已知故障模式 |
第 0.1 节 |
| 三支柱 |
Trace(发生了什么)、成本(花了多少)、质量(好不好)——同一份数据的三种切法 |
第 0.1 节 |
| L1/L2/L3 能力清单 |
看得见(数据)、说得清(归因)、管得住(机制)三层共 21 问的自评清单 |
第 1.2 节 |
| 版本飞轮 |
模型、prompt、检索库三方持续变更,使离线结论快速过时的机制 |
第 1.1 节 |
| 四金指标 |
传统监控的延迟、流量、错误、饱和度;在 LLM 应用上不覆盖"坏"与"贵" |
第 1.1 节 |
二、Trace 与传播
| 术语 |
释义 |
详见 |
| span |
一段有起止时间、属性与父引用的工作单元;span 树还原调用结构 |
第 2.1 节 |
| 四层 span 模型 |
request → pipeline → 组件(检索/模型/工具)→ 子调用 |
第 2.1 节 |
| trace_id / span_id / parent_id |
一次请求全过程 / 一段工作 / 树的边;三 ID 让日志、账本、评分说同一件事 |
第 2.2 节 |
| W3C Trace Context |
跨服务传播 trace 的标准;HTTP 头 traceparent(写法示意) |
第 2.2 节 |
| contextvars |
Python 标准库的上下文变量;异步安全的 trace_id 传播方式 |
第 2.2 节 |
| 头部采样 / 尾部采样 |
请求进来时决定记不记(省资源)/ 结束时决定(保住错误与慢样本) |
第 2.3 节 |
| 元数据全量、正文抽样、错误全采 |
记什么不记什么的三原则;抽样率必须随数据记录 |
第 2.3 节 |
| PII 脱敏 |
在入库前处理个人信息;正则是下限,保留可排查性 |
第 2.3 节 |
| 热/温/冷留存 |
全量下钻 714 天 / 抽样正文 3090 天 / 聚合指标一年以上 |
第 2.3 节 |
| TTFT(首 token 时间) |
从请求到第一个输出 token 的时延;流式体验的关键口径 |
第 2.1 节 |
三、成本与账本
| 术语 |
释义 |
详见 |
| token 三本账 |
输入、输出、缓存(读/写)四项分记;只记总数等于销毁归因证据 |
第 3.1 节 |
| usage 字段 |
供应商响应中的计量字段;token 数只认它,自数必错(官方口径) |
第 2.2 节 |
| prompt 缓存 |
前缀命中的输入按缓存价计费,约为输入价 1/10(官方,Anthropic 口径) |
第 3.1 节 |
| 缓存命中率 |
写入后实际读到的比例;只看开启率会自欺 |
第 3.1 节 |
| 三维分摊 |
按团队(责任)、功能(产品决策)、用户(单位经济)摊账 |
第 3.2 节 |
| showback / chargeback |
只展示不结算 / 真金白银内部结算;先 showback 一季度 |
第 3.2 节 |
| 未打标率 |
缺分摊键的账本行占比;目标趋近 0,未知单列绝不摊薄 |
第 3.2 节 |
| 单位经济 |
每活跃用户成本、每成功会话成本;成本与质量的交汇指标 |
第 3.2 节 |
| 预算四层 |
公司 → 团队 → 功能(计划工具)→ 会话/用户(事故工具) |
第 3.3 节 |
| 三线模型 |
提醒线(人看)、暂停线(自动降级)、升级线(决策) |
第 3.3 节 |
| 消耗速率法 |
用"今日已耗占日预算倍数"替代静态总额线 |
第 3.3 节 |
| 动态基线 |
过去 7~14 天同时段做基线带,抓缓慢漂移 |
第 3.3 节 |
| 会话熔断(SessionCap) |
单会话 token 上限,预扣 planned_tokens,超限熔断人工复位 |
第 3.3 节 |
四、质量观测
| 术语 |
释义 |
详见 |
| 离线评测 / 在线探针 |
上线前把门(评测集)/ 上线后放哨(抽样裁判流水线) |
第 4.1 节 |
| 分层抽样 |
随机打底 + 按功能分层 + 错误全采 + 点踩强制入库 |
第 4.1 节 |
| rubric |
评分细则;精简版为相关性、事实性、完整性、格式安全四维三档 |
第 4.1 节 |
| 规则裁判 / LLM 裁判 |
零成本可解释的规则打分 / 用模型评模型,需校准与抽检 |
第 4.1 节 |
| 裁判校准 |
每周 30~50 条人工复核,人机一致率低于八成先修 rubric |
第 4.1 节 |
| 显式反馈 / 隐式反馈 |
点赞点踩转人工(硬信号,全量入库)/ 复述、放弃、复制(看趋势) |
第 4.1 节 |
| 静默失败 |
无异常、状态码 200 的坏答案;LLM 特有的故障形态 |
第 4.1 节 |
| 漂移信号 |
延迟分布、拒绝率、输出长度突变、主题漂移四个代理信号 |
第 4.2 节 |
| 三层阈值法 |
静态阈值守底线、基线带抓缓变、日环比抓突变 |
第 4.2 节 |
| 影子运行 |
新信号先只记不报两周,调好带宽再接告警 |
第 4.2 节 |
五、告警与故障诊断
| 术语 |
释义 |
详见 |
| 四类故障 |
超时与慢、降级与不可用、坏答案、成本爆炸 |
第 5.1 节 |
| 责任层判定 |
上游供应商、检索侧、编排侧、工具侧的归因口径 |
第 5.1 节 |
| 排障树 |
节点只问是非题、每步先看视图的决策树 |
第 5.2 节 |
| runbook |
每条告警线配三行处置:先看什么、常见原因、止损动作 |
第 3.3 节 |
| 告警疲劳 |
没人理的告警线比没有更糟;同源合并、两周未触发即调参或删 |
第 3.3 节 |
| 无责复盘 |
只对事不对人;时间线、根因、五问、带验收的行动项 |
第 5.2 节 |
六、落地与治理
| 术语 |
释义 |
详见 |
| MOCK 模式 |
用假实现顶替模型调用,零依赖跑通观测全链路 |
第 6.1 节 |
| OTel GenAI 语义约定 |
OpenTelemetry 的 gen_ai.* 属性族;截至 2026-10 仍为实验态(官方) |
第 6.2 节 |
| 属性隔离层 |
键名集中在代码一处的封装层;标准变动时只改一处 |
第 6.2 节 |
| OpenInference |
Phoenix 采用的开源追踪数据标准 |
第 6.2 节 |
| 自托管(self-hosted) |
数据与部署都在自己基础设施内;SaaS 的反面 |
第 6.2 节 |
| 六问判定 |
数据主权、插桩侵入度、评测深度、生态绑定、拥有成本、团队技能 |
第 6.2 节 |
| 优化闭环 |
账本 → 归因 → 动作 → 验证 → 固化,周节奏 |
第 7.1 节 |
| 三大杠杆 |
缓存(前缀稳定化)、路由与模型分级、输出治理 |
第 7.1 节 |
| 质量护栏 |
成本动作必须同时盯点踩率与探针合格率,越带宽即回滚 |
第 7.1 节 |
| 峰值系数 |
峰值 QPS 与平均 QPS 之比;从自己的账本曲线取值 |
第 7.2 节 |
| 利特尔法则 |
稳态并发 = 到达率 × 平均时延(经典排队论结论) |
第 7.2 节 |
| TPM / RPM |
供应商侧 token/分钟与请求/分钟限额(以官方文档为准) |
第 7.2 节 |
| 令牌桶 |
容量即突发额度、匀速补充的限速器;三层为全局/功能/用户 |
第 7.2 节 |
| 降级链 |
退避重试 → 切备用 → 排队 → 可读拒绝的四级处置 |
第 7.2 节 |