附录 A · 术语表


附录 A · 术语表

用途:全书术语按主题分组速查;"详见"列为纯文字章节引用。术语保留英文原词的,释义首次出现以中英对照给出。

一、基础与三支柱

术语 释义 详见
可观测性(observability) 只凭系统外部输出,能把内部状态推断到什么程度;回答"为什么发生" 第 0.1 节
监控(monitoring) 预定义检查 + 阈值告警;回答"是否正常",面向已知故障模式 第 0.1 节
三支柱 Trace(发生了什么)、成本(花了多少)、质量(好不好)——同一份数据的三种切法 第 0.1 节
L1/L2/L3 能力清单 看得见(数据)、说得清(归因)、管得住(机制)三层共 21 问的自评清单 第 1.2 节
版本飞轮 模型、prompt、检索库三方持续变更,使离线结论快速过时的机制 第 1.1 节
四金指标 传统监控的延迟、流量、错误、饱和度;在 LLM 应用上不覆盖"坏"与"贵" 第 1.1 节

二、Trace 与传播

术语 释义 详见
span 一段有起止时间、属性与父引用的工作单元;span 树还原调用结构 第 2.1 节
四层 span 模型 request → pipeline → 组件(检索/模型/工具)→ 子调用 第 2.1 节
trace_id / span_id / parent_id 一次请求全过程 / 一段工作 / 树的边;三 ID 让日志、账本、评分说同一件事 第 2.2 节
W3C Trace Context 跨服务传播 trace 的标准;HTTP 头 traceparent(写法示意) 第 2.2 节
contextvars Python 标准库的上下文变量;异步安全的 trace_id 传播方式 第 2.2 节
头部采样 / 尾部采样 请求进来时决定记不记(省资源)/ 结束时决定(保住错误与慢样本) 第 2.3 节
元数据全量、正文抽样、错误全采 记什么不记什么的三原则;抽样率必须随数据记录 第 2.3 节
PII 脱敏 在入库前处理个人信息;正则是下限,保留可排查性 第 2.3 节
热/温/冷留存 全量下钻 714 天 / 抽样正文 3090 天 / 聚合指标一年以上 第 2.3 节
TTFT(首 token 时间) 从请求到第一个输出 token 的时延;流式体验的关键口径 第 2.1 节

三、成本与账本

术语 释义 详见
token 三本账 输入、输出、缓存(读/写)四项分记;只记总数等于销毁归因证据 第 3.1 节
usage 字段 供应商响应中的计量字段;token 数只认它,自数必错(官方口径) 第 2.2 节
prompt 缓存 前缀命中的输入按缓存价计费,约为输入价 1/10(官方,Anthropic 口径) 第 3.1 节
缓存命中率 写入后实际读到的比例;只看开启率会自欺 第 3.1 节
三维分摊 按团队(责任)、功能(产品决策)、用户(单位经济)摊账 第 3.2 节
showback / chargeback 只展示不结算 / 真金白银内部结算;先 showback 一季度 第 3.2 节
未打标率 缺分摊键的账本行占比;目标趋近 0,未知单列绝不摊薄 第 3.2 节
单位经济 每活跃用户成本、每成功会话成本;成本与质量的交汇指标 第 3.2 节
预算四层 公司 → 团队 → 功能(计划工具)→ 会话/用户(事故工具) 第 3.3 节
三线模型 提醒线(人看)、暂停线(自动降级)、升级线(决策) 第 3.3 节
消耗速率法 用"今日已耗占日预算倍数"替代静态总额线 第 3.3 节
动态基线 过去 7~14 天同时段做基线带,抓缓慢漂移 第 3.3 节
会话熔断(SessionCap) 单会话 token 上限,预扣 planned_tokens,超限熔断人工复位 第 3.3 节

四、质量观测

术语 释义 详见
离线评测 / 在线探针 上线前把门(评测集)/ 上线后放哨(抽样裁判流水线) 第 4.1 节
分层抽样 随机打底 + 按功能分层 + 错误全采 + 点踩强制入库 第 4.1 节
rubric 评分细则;精简版为相关性、事实性、完整性、格式安全四维三档 第 4.1 节
规则裁判 / LLM 裁判 零成本可解释的规则打分 / 用模型评模型,需校准与抽检 第 4.1 节
裁判校准 每周 30~50 条人工复核,人机一致率低于八成先修 rubric 第 4.1 节
显式反馈 / 隐式反馈 点赞点踩转人工(硬信号,全量入库)/ 复述、放弃、复制(看趋势) 第 4.1 节
静默失败 无异常、状态码 200 的坏答案;LLM 特有的故障形态 第 4.1 节
漂移信号 延迟分布、拒绝率、输出长度突变、主题漂移四个代理信号 第 4.2 节
三层阈值法 静态阈值守底线、基线带抓缓变、日环比抓突变 第 4.2 节
影子运行 新信号先只记不报两周,调好带宽再接告警 第 4.2 节

五、告警与故障诊断

术语 释义 详见
四类故障 超时与慢、降级与不可用、坏答案、成本爆炸 第 5.1 节
责任层判定 上游供应商、检索侧、编排侧、工具侧的归因口径 第 5.1 节
排障树 节点只问是非题、每步先看视图的决策树 第 5.2 节
runbook 每条告警线配三行处置:先看什么、常见原因、止损动作 第 3.3 节
告警疲劳 没人理的告警线比没有更糟;同源合并、两周未触发即调参或删 第 3.3 节
无责复盘 只对事不对人;时间线、根因、五问、带验收的行动项 第 5.2 节

六、落地与治理

术语 释义 详见
MOCK 模式 用假实现顶替模型调用,零依赖跑通观测全链路 第 6.1 节
OTel GenAI 语义约定 OpenTelemetry 的 gen_ai.* 属性族;截至 2026-10 仍为实验态(官方) 第 6.2 节
属性隔离层 键名集中在代码一处的封装层;标准变动时只改一处 第 6.2 节
OpenInference Phoenix 采用的开源追踪数据标准 第 6.2 节
自托管(self-hosted) 数据与部署都在自己基础设施内;SaaS 的反面 第 6.2 节
六问判定 数据主权、插桩侵入度、评测深度、生态绑定、拥有成本、团队技能 第 6.2 节
优化闭环 账本 → 归因 → 动作 → 验证 → 固化,周节奏 第 7.1 节
三大杠杆 缓存(前缀稳定化)、路由与模型分级、输出治理 第 7.1 节
质量护栏 成本动作必须同时盯点踩率与探针合格率,越带宽即回滚 第 7.1 节
峰值系数 峰值 QPS 与平均 QPS 之比;从自己的账本曲线取值 第 7.2 节
利特尔法则 稳态并发 = 到达率 × 平均时延(经典排队论结论) 第 7.2 节
TPM / RPM 供应商侧 token/分钟与请求/分钟限额(以官方文档为准) 第 7.2 节
令牌桶 容量即突发额度、匀速补充的限速器;三层为全局/功能/用户 第 7.2 节
降级链 退避重试 → 切备用 → 排队 → 可读拒绝的四级处置 第 7.2 节

作者与出处
原作者: 灏天文库
整理: 灏天文库整理
本站整理收录,版权归原作者/开源协议所有;欢迎通过原文链接访问源仓库。
发布者: 作者: 灏天文库 转发
评论区 (0)
U