附录 A 术语表
按主题分组的术语速查:中文条目 + 英文原名 + 一句话定义 + 首次展开的小节。技术名词在正文中保留英文,本表给出中英对照便于检索。
一、评测总论
| 术语 |
英文 |
一句话定义 |
首次展开 |
| 评测工程 |
Evals |
给不确定系统发成绩单的工程:回归集、指标、裁判、监控的总和 |
0.1 |
| 回归 |
Regression |
本次改动让原来能对的东西变坏了 |
1.1 |
| 输入/模型/需求漂移 |
drift |
用户分布、上游模型、业务定义随时间变化的三种方式 |
1.2 |
| 评测金字塔 |
— |
冒烟 → 单元 → 回归 → 线上的分层测试结构 |
1.3 |
| 离线/在线评测 |
offline / online evals |
在考卷上跑 vs 在真实流量上评 |
2.1 |
| 单元级 / 端到端 |
unit / e2e |
测组件(检索、路由)vs 测整条链路 |
2.2 |
| 判定分流 |
— |
规则先行 → 裁判批量 → 低置信人工仲裁的流水线 |
2.3 |
二、数据集工程
| 术语 |
英文 |
一句话定义 |
首次展开 |
| 回归集 |
regression set |
每次变更都重考的同一张考卷,100~500 条 |
3.1 |
| 影子日志 |
shadow logging |
旁路录制真实输入(必要时连输出)的留档机制 |
3.1 |
| 分歧样本 |
— |
裁判间分歧、双模型不一致、低置信等高信息密度考题 |
3.1 |
| hard case |
— |
已知失败模式的防守题,隔离成单独子集 |
3.3 |
| 对抗样本 |
adversarial sample |
带恶意构造的输入:注入、越狱、格式破坏、对抗变形 |
3.3 |
| 数据卡 |
data card |
记录数据来源、配比、版本、重标历史的随行文档 |
3.4 |
| 标注指南 |
annotation guideline |
任务定义、量表、正反例、边界规则、流程、仲裁六件套 |
3.2 |
| 分层采样 |
stratified sampling |
按场景×难度等配额抽样,固定种子保证可复现 |
3.1 |
三、指标与度量
| 术语 |
英文 |
一句话定义 |
首次展开 |
| pass@k |
— |
重复 k 次至少一次通过的比例(temp>0 时的稳健口径) |
4.1 |
| 部分分量表 |
partial credit |
按完成度给分而非非黑即白 |
4.1 |
| 校准 |
calibration |
说的概率与长期命中率一致("概率是工程契约") |
4.2 |
| 可靠性曲线 |
reliability curve |
按置信度分桶对比预测均值与实际命中率 |
4.2 / 7.1 |
| ECE |
Expected Calibration Error |
Σ(桶样本占比 × |预测均值 − 实际命中率|);<0.05 优 / >0.15 慎用 |
4.2 / 7.1 |
| 自报置信 |
verbalized confidence |
问模型"你有多确定";普遍过度自信 |
4.2 |
| 忠实度 |
faithfulness |
输出中被来源支持的原子主张占比 |
4.3 |
| 原子主张 |
claim |
输出中可独立判真假的最小陈述单元 |
4.3 |
| Wilson 区间 |
Wilson interval |
小样本比例的置信区间(比正态近似稳) |
4.3 |
| 帕累托前沿 |
Pareto frontier |
延迟-成本-质量三角中不被全面支配的解集 |
4.4 |
四、模型裁判(LLM-as-judge)
| 术语 |
英文 |
一句话定义 |
首次展开 |
| 模型裁判 |
LLM-as-judge |
用 LLM 按 rubric 批量给输出打分的判定方式 |
2.3 / 5.1 |
| rubric / 评分量表 |
rubric |
每档写触发情形与正反例的打分标准(不写形容词) |
3.2 / 5.1 |
| 成对比较 |
pairwise comparison |
判 (A,B) 谁更好;必须换序判两次 |
5.1 |
| 判断分解 |
— |
把质量拆成 yes/no 核对清单逐项判 |
5.1 |
| 位置偏见 |
position bias |
偏爱先呈现的答案;换序翻转率识别 |
5.2 |
| 长度偏见 |
length bias |
偏爱更长的回答;长度-分数相关识别 |
5.2 |
| 自我偏好 |
self-preference |
偏爱同族模型输出;盲测机构名识别 |
5.2 |
| 裁判委员会 |
judge committee / ensemble |
多个异源裁判投票或均值,让偏见相互抵消 |
5.3 |
| Cohen's kappa |
— |
双人校正常识一致率 κ=(p_o−p_e)/(1−p_e) |
3.2 / 5.3 |
| Fleiss kappa |
— |
多评定者(可不等员)总体一致率 |
5.3 |
| Landis & Koch 分级 |
— |
κ 的通行解读分级(<0.2 极差 … >0.8 优) |
3.2 |
五、概率系统与漂移
| 术语 |
英文 |
一句话定义 |
首次展开 |
| 线性缩放修复 |
— |
conf' = clip(a·conf+b, 0,1) 的校准修复;训练分片调参、留出分片验收 |
7.1 |
| 期望代价 |
expected cost |
Cost(t) = c_miss×错放 + c_human×拦截 |
7.2 |
| MDE |
minimum detectable effect |
实验想检出的最小效应;越小样本越贵 |
8.1 |
| PSI |
Population Stability Index |
Σ(实际占比−预期占比)×ln(占比比);>0.25 显著漂移 |
7.3 |
| 等频分桶 |
equal-frequency binning |
按基线分位数定边界,桶内样本量近似相等 |
7.3 |
| 基线 |
baseline |
PSI 与告警阈值的参照分布,须可辩护且随版本重立 |
7.3 |
六、线上与工程化
| 术语 |
英文 |
一句话定义 |
首次展开 |
| 影子模式 |
shadow mode |
新版本旁路跑真实流量但不生效,裁判对照打分 |
8.1 |
| A/B 测试 |
A/B test |
真实流量分流的对照实验;单一变量、样本量先算、跑满周期 |
8.1 |
| 灰度发布 |
canary release |
5%→10%→50%→100% 的逐级放量,每级可回退 |
8.1 |
| 一页式仪表盘 |
— |
红绿灯总览 + 趋势 + 下钻的监控面板 |
4.4 / 8.2 |
| runbook |
— |
预先写好的应急操作手册:触发、权限、动作、验证、复盘 |
8.3 |
| 软回退 / 硬回退 / 熔断 |
— |
调参数 / 回版本 / 停服务的三级止血手段 |
8.3 |
| MTTD / MTTR |
— |
平均发现时间 / 平均恢复时间;演练的度量 |
8.3 |
| 评测即代码 |
evals as code |
回归集、rubric、脚本、阈值进 git 走 PR |
9.1 |
| CI 门禁 |
CI gate |
PR 自动跑评测,阻塞线红了挡合并 |
9.2 |
| 评测 owner |
— |
考卷守门人:审变更、维护阈值、月看拦截率 |
9.2 |
| 留出集 |
holdout set |
只在发版评审时跑的隐藏考卷,检测过拟合 |
9.3 |
| 对抗性审计 |
adversarial audit |
专门讨论"怎么不变好把分刷上去"的季度会议 |
9.3 |
七、工具与平台
| 术语 |
英文 |
一句话定义 |
首次展开 |
| Promptfoo |
— |
开源评测框架:yaml 配置即评测,本地优先,内建红队 |
6.1 |
| 红队 |
red-teaming |
自动/主动生成攻击样本测试系统的安全性 |
6.1 |
| trace |
— |
一次请求的行为记录,span/generation 嵌套成树 |
6.2 |
| span / generation |
— |
trace 内的操作步骤 / 模型调用(带 usage 与版本) |
6.2 |
| 在线 evals |
online evals |
用户反馈、模型裁判、规则统计三路分数挂到 trace |
6.2 |
| DeepEval / RAGAS / LangSmith / Braintrust / Inspect-ai |
— |
pytest 断言库 / RAG 指标库 / LangChain 系平台 / 企业实验平台 / 安全基准框架 |
6.3 |
与其他教程共用的术语(概率契约、决策门控、Jev Choice 等)详见《Jev 决策编程》对应章节;Agent 侧术语(对战、Elo)详见 《深入理解 AI Agent:设计原理与工程实践》第 6 章。