附录 A 术语表
按主题分组的全书术语速查。定义只保留"选择者够用"的那一句,深入解释见"详见"指向的章节;技术名词保留英文原文。与《Evals 实战》共用的术语(如回归集、模型裁判)只列本书视角的定义。
一、榜单与排名机制(第 1~2 章)
| 术语 |
原文 |
一句话定义 |
详见 |
| 竞技场 |
Arena |
用户对两个匿名模型的回答投票、战果算分排名的评测形态 |
1.1 |
| Elo |
Elo rating |
由成对战果在线更新的评分制,分差经 logistic 函数换算预期胜率 |
2.1 |
| Bradley-Terry(BT) |
Bradley-Terry model |
对全部战果做整体拟合的评分模型,LMArena 自 2023-12 起采用(官方口径) |
2.1 |
| 置信区间 |
Confidence Interval, CI |
分数作为估计量的波动范围;LMArena 用 bootstrap 重采样出 95% CI(官方) |
2.2 |
| bootstrap |
bootstrap |
对观测数据反复重采样、看统计量分布的非参数方法 |
2.2 |
| 统计并列 |
statistical tie |
置信区间相互重叠的模型,名次先后无统计含义 |
2.2 |
| 风格控制 |
style control |
剔除回答长度、格式等风格偏好后再排名的视图,LMArena 2024-09 上线(官方) |
2.3 |
| 风格偏置 |
style bias |
投票者/裁判偏爱长回答、重格式的系统性倾向 |
2.3 |
| K 因子 |
K-factor |
Elo 每场更新的步长系数,越大单场影响越大 |
2.1 |
二、指标与口径(第 3 章)
| 术语 |
原文 |
一句话定义 |
详见 |
| 精确匹配 |
Exact Match, EM |
回答与标准答案逐字相同才算对的判分方式 |
3.1 |
| 混淆矩阵 |
confusion matrix |
真假阳阴四格计数,分类指标的母亲表 |
3.1 |
| F1 |
F1 score |
精确率与召回率的调和平均,对不平衡数据比准确率诚实 |
3.1 |
| BLEU / ROUGE |
— |
n-gram 表面重合类生成指标,同义改写会被判零分 |
3.2 |
| pass@1 |
pass@1 |
一次生成通过单元测试的概率口径,代码评测常用 |
1.2 |
| 通过率陷阱 |
— |
分母与判定口径未钉死的"通过率"无法横向比较 |
3.3 / 《Evals 实战》4.1 |
三、可信度与折价(第 4~5 章)
| 术语 |
原文 |
一句话定义 |
详见 |
| 数据污染 |
data contamination |
基准题目混入训练数据,分数含"背题分" |
4.1 |
| 刷榜 |
benchmark gaming |
针对基准本身的定向优化,提高分数不提高能力 |
4.1 |
| 任务距离矩阵 |
— |
七维 0/1/2 打分衡量"考卷与你的场景隔多远",≥7 必须自测 |
4.2 |
| 可信度核对表 |
— |
四区十五项(出题/阅卷/统计/动机)0/1/2 打分的三档定级工具 |
4.3 |
| 模型一致性 |
model consistency |
接入的模型还是不是你以为的那个模型的问题 |
5.1 |
| 判定卡 |
— |
把观测归入 Match/Suspicious/Downgrade/Rerouted/Unlisted/Invalid 六类定性 |
5.1 |
| 行为指纹 |
behavioral fingerprint |
固定探针集上输出分布的稳定性特征,对微调/量化等改动稳健(2026 公开研究) |
5.2 |
| 元数据 |
metadata |
响应中服务端回传的 model 字段、版本口径等标识信息 |
5.2 |
| 快照口径 |
snapshot |
要求服务方确认当前部署的模型标识与版本(治理动作) |
5.1 |
四、自建实测(第 6 章)
| 术语 |
原文 |
一句话定义 |
详见 |
| 盲测 |
blind test |
判分人不知回答出自哪个模型的评测组织方式 |
6.1 |
| 0/1/2 判分 |
— |
每题三档人工/规则判分:全对/部分/全错 |
6.1 |
| 成对比较 |
pairwise comparison |
评审在两个匿名回答中二选一,偏好稳定性高于绝对量表 |
2.1 / 6.2 |
| 内部竞技场 |
internal arena |
用成对投票 + Elo 给内部候选排名的自建评测 |
6.2 |
| 对战矩阵 |
head-to-head matrix |
两两交手的胜负计数表,用于交叉验证 Elo 排名 |
6.2 |
| 模型裁判 |
LLM-as-a-judge |
用模型代替人做判分/投票,需治理位置与长度偏见 |
6.2 / 《Evals 实战》第 5 章 |
五、决策与跟踪(第 7~9 章、第 8 章场景)
| 术语 |
原文 |
一句话定义 |
详见 |
| 需求矩阵 |
— |
硬约束(门槛)+ 加权维度(权重和 10)的需求表达 |
7.1 |
| 硬约束 |
hard constraint |
不满足即出局的二值条件,永远不进权重 |
7.1 |
| Pareto 前沿 |
Pareto front |
三维(质量/成本/延迟)上互不支配的候选集合 |
7.2 |
| 被支配解 |
dominated solution |
三维上都被另一候选"不差且至少一维严格更好"的候选 |
7.2 |
| 选型报告 |
— |
一页七区块的可签字交付物,本书最终交付物 |
7.3 |
| 轨迹 |
trajectory |
Agent 每一步的输入、输出、工具调用与返回的完整记录 |
8.1 |
| 三态口径 |
— |
任务判定分成功/部分成功/失败三档,加权完成率=(S+0.5P)/N |
8.1 |
| 失败归因四分 |
— |
模型/工具/环境/题目歧义四类记账,只有模型归因进横向比较 |
8.1 |
| Overclaim(虚报) |
overclaiming |
Agent 自述与自身轨迹矛盾:声称做过而记录不支持 |
8.2 |
| OverclaimBench |
— |
量化 Agent 虚报倾向的评测套件(arXiv 2026-09-18),基于 transcript 覆盖率判定 |
8.2 |
| 三栏对照卡 |
— |
自述原文 | 三值判定 | 记录证据(带步骤号)的虚报判定工具 |
8.2 |
| 版本漂移 |
version drift |
模型服务或其依赖随时间发生的行为变化 |
9.1 |
| 锚点题集 |
anchor set |
从盲测题集挑出的 15~20 道高区分度常驻探针 |
9.1 |
| 触发器矩阵 |
— |
周期(月度/季度)× 事件(公告/价格/告警)的再评测排期表 |
9.1 |
| 自噪声 |
self-noise |
基线重复测量的自身波动(σ),告警线通常取 2σ |
9.2 |
六、通用与工程
| 术语 |
原文 |
一句话定义 |
详见 |
| token |
token |
模型读写的计费与长度单位,中文约 1~2 字/token(量级示意) |
0.2 |
| 上下文窗口 |
context window |
单次调用能容纳的输入+输出 token 上限 |
4.2 |
| 温度 |
temperature |
采样随机性参数:越低越确定,指纹探针必须钉死 |
5.2 |
| 量化 |
quantization |
降低权重数值精度以省算力的部署手段,可能引起行为漂移 |
5.1 |
| 灰度 |
canary/灰度发布 |
新版本按小比例流量先行验证再全量的发布方式 |
7.3 / 9.1 |
| SLA |
Service Level Agreement |
服务等级协议:可用性、延迟、通知义务等的合同承诺 |
5.1 |
| 脱敏 |
de-identification |
抽样真实数据造题时抹除个人信息与机密的处理 |
6.1 |
使用建议:本表按"忘了某个词在哪儿讲的"设计——先查表拿一句话定义,再跳"详见"章节。口径冲突时以正文为准。