附录 A 术语表


附录 A 术语表

按主题分组的术语速查:中文条目 + 英文原名 + 一句话定义 + 首次展开的小节。技术名词在正文中保留英文,本表给出中英对照便于检索。

一、评测总论

术语 英文 一句话定义 首次展开
评测工程 Evals 给不确定系统发成绩单的工程:回归集、指标、裁判、监控的总和 0.1
回归 Regression 本次改动让原来能对的东西变坏了 1.1
输入/模型/需求漂移 drift 用户分布、上游模型、业务定义随时间变化的三种方式 1.2
评测金字塔 冒烟 → 单元 → 回归 → 线上的分层测试结构 1.3
离线/在线评测 offline / online evals 在考卷上跑 vs 在真实流量上评 2.1
单元级 / 端到端 unit / e2e 测组件(检索、路由)vs 测整条链路 2.2
判定分流 规则先行 → 裁判批量 → 低置信人工仲裁的流水线 2.3

二、数据集工程

术语 英文 一句话定义 首次展开
回归集 regression set 每次变更都重考的同一张考卷,100~500 条 3.1
影子日志 shadow logging 旁路录制真实输入(必要时连输出)的留档机制 3.1
分歧样本 裁判间分歧、双模型不一致、低置信等高信息密度考题 3.1
hard case 已知失败模式的防守题,隔离成单独子集 3.3
对抗样本 adversarial sample 带恶意构造的输入:注入、越狱、格式破坏、对抗变形 3.3
数据卡 data card 记录数据来源、配比、版本、重标历史的随行文档 3.4
标注指南 annotation guideline 任务定义、量表、正反例、边界规则、流程、仲裁六件套 3.2
分层采样 stratified sampling 按场景×难度等配额抽样,固定种子保证可复现 3.1

三、指标与度量

术语 英文 一句话定义 首次展开
pass@k 重复 k 次至少一次通过的比例(temp>0 时的稳健口径) 4.1
部分分量表 partial credit 按完成度给分而非非黑即白 4.1
校准 calibration 说的概率与长期命中率一致("概率是工程契约") 4.2
可靠性曲线 reliability curve 按置信度分桶对比预测均值与实际命中率 4.2 / 7.1
ECE Expected Calibration Error Σ(桶样本占比 × |预测均值 − 实际命中率|);<0.05 优 / >0.15 慎用 4.2 / 7.1
自报置信 verbalized confidence 问模型"你有多确定";普遍过度自信 4.2
忠实度 faithfulness 输出中被来源支持的原子主张占比 4.3
原子主张 claim 输出中可独立判真假的最小陈述单元 4.3
Wilson 区间 Wilson interval 小样本比例的置信区间(比正态近似稳) 4.3
帕累托前沿 Pareto frontier 延迟-成本-质量三角中不被全面支配的解集 4.4

四、模型裁判(LLM-as-judge)

术语 英文 一句话定义 首次展开
模型裁判 LLM-as-judge 用 LLM 按 rubric 批量给输出打分的判定方式 2.3 / 5.1
rubric / 评分量表 rubric 每档写触发情形与正反例的打分标准(不写形容词) 3.2 / 5.1
成对比较 pairwise comparison 判 (A,B) 谁更好;必须换序判两次 5.1
判断分解 把质量拆成 yes/no 核对清单逐项判 5.1
位置偏见 position bias 偏爱先呈现的答案;换序翻转率识别 5.2
长度偏见 length bias 偏爱更长的回答;长度-分数相关识别 5.2
自我偏好 self-preference 偏爱同族模型输出;盲测机构名识别 5.2
裁判委员会 judge committee / ensemble 多个异源裁判投票或均值,让偏见相互抵消 5.3
Cohen's kappa 双人校正常识一致率 κ=(p_o−p_e)/(1−p_e) 3.2 / 5.3
Fleiss kappa 多评定者(可不等员)总体一致率 5.3
Landis & Koch 分级 κ 的通行解读分级(<0.2 极差 … >0.8 优) 3.2

五、概率系统与漂移

术语 英文 一句话定义 首次展开
线性缩放修复 conf' = clip(a·conf+b, 0,1) 的校准修复;训练分片调参、留出分片验收 7.1
期望代价 expected cost Cost(t) = c_miss×错放 + c_human×拦截 7.2
MDE minimum detectable effect 实验想检出的最小效应;越小样本越贵 8.1
PSI Population Stability Index Σ(实际占比−预期占比)×ln(占比比);>0.25 显著漂移 7.3
等频分桶 equal-frequency binning 按基线分位数定边界,桶内样本量近似相等 7.3
基线 baseline PSI 与告警阈值的参照分布,须可辩护且随版本重立 7.3

六、线上与工程化

术语 英文 一句话定义 首次展开
影子模式 shadow mode 新版本旁路跑真实流量但不生效,裁判对照打分 8.1
A/B 测试 A/B test 真实流量分流的对照实验;单一变量、样本量先算、跑满周期 8.1
灰度发布 canary release 5%→10%→50%→100% 的逐级放量,每级可回退 8.1
一页式仪表盘 红绿灯总览 + 趋势 + 下钻的监控面板 4.4 / 8.2
runbook 预先写好的应急操作手册:触发、权限、动作、验证、复盘 8.3
软回退 / 硬回退 / 熔断 调参数 / 回版本 / 停服务的三级止血手段 8.3
MTTD / MTTR 平均发现时间 / 平均恢复时间;演练的度量 8.3
评测即代码 evals as code 回归集、rubric、脚本、阈值进 git 走 PR 9.1
CI 门禁 CI gate PR 自动跑评测,阻塞线红了挡合并 9.2
评测 owner 考卷守门人:审变更、维护阈值、月看拦截率 9.2
留出集 holdout set 只在发版评审时跑的隐藏考卷,检测过拟合 9.3
对抗性审计 adversarial audit 专门讨论"怎么不变好把分刷上去"的季度会议 9.3

七、工具与平台

术语 英文 一句话定义 首次展开
Promptfoo 开源评测框架:yaml 配置即评测,本地优先,内建红队 6.1
红队 red-teaming 自动/主动生成攻击样本测试系统的安全性 6.1
trace 一次请求的行为记录,span/generation 嵌套成树 6.2
span / generation trace 内的操作步骤 / 模型调用(带 usage 与版本) 6.2
在线 evals online evals 用户反馈、模型裁判、规则统计三路分数挂到 trace 6.2
DeepEval / RAGAS / LangSmith / Braintrust / Inspect-ai pytest 断言库 / RAG 指标库 / LangChain 系平台 / 企业实验平台 / 安全基准框架 6.3

与其他教程共用的术语(概率契约、决策门控、Jev Choice 等)详见《Jev 决策编程》对应章节;Agent 侧术语(对战、Elo)详见 《深入理解 AI Agent:设计原理与工程实践》第 6 章。


作者与出处
原作者: 灏天文库
整理: 灏天文库整理
本站整理收录,版权归原作者/开源协议所有;欢迎通过原文链接访问源仓库。
发布者: 作者: 灏天文库 转发
评论区 (0)
U