附录 A 术语表


附录 A 术语表

按主题分组的全书术语速查。定义只保留"选择者够用"的那一句,深入解释见"详见"指向的章节;技术名词保留英文原文。与《Evals 实战》共用的术语(如回归集、模型裁判)只列本书视角的定义。

一、榜单与排名机制(第 1~2 章)

术语 原文 一句话定义 详见
竞技场 Arena 用户对两个匿名模型的回答投票、战果算分排名的评测形态 1.1
Elo Elo rating 由成对战果在线更新的评分制,分差经 logistic 函数换算预期胜率 2.1
Bradley-Terry(BT) Bradley-Terry model 对全部战果做整体拟合的评分模型,LMArena 自 2023-12 起采用(官方口径) 2.1
置信区间 Confidence Interval, CI 分数作为估计量的波动范围;LMArena 用 bootstrap 重采样出 95% CI(官方) 2.2
bootstrap bootstrap 对观测数据反复重采样、看统计量分布的非参数方法 2.2
统计并列 statistical tie 置信区间相互重叠的模型,名次先后无统计含义 2.2
风格控制 style control 剔除回答长度、格式等风格偏好后再排名的视图,LMArena 2024-09 上线(官方) 2.3
风格偏置 style bias 投票者/裁判偏爱长回答、重格式的系统性倾向 2.3
K 因子 K-factor Elo 每场更新的步长系数,越大单场影响越大 2.1

二、指标与口径(第 3 章)

术语 原文 一句话定义 详见
精确匹配 Exact Match, EM 回答与标准答案逐字相同才算对的判分方式 3.1
混淆矩阵 confusion matrix 真假阳阴四格计数,分类指标的母亲表 3.1
F1 F1 score 精确率与召回率的调和平均,对不平衡数据比准确率诚实 3.1
BLEU / ROUGE n-gram 表面重合类生成指标,同义改写会被判零分 3.2
pass@1 pass@1 一次生成通过单元测试的概率口径,代码评测常用 1.2
通过率陷阱 分母与判定口径未钉死的"通过率"无法横向比较 3.3 / 《Evals 实战》4.1

三、可信度与折价(第 4~5 章)

术语 原文 一句话定义 详见
数据污染 data contamination 基准题目混入训练数据,分数含"背题分" 4.1
刷榜 benchmark gaming 针对基准本身的定向优化,提高分数不提高能力 4.1
任务距离矩阵 七维 0/1/2 打分衡量"考卷与你的场景隔多远",≥7 必须自测 4.2
可信度核对表 四区十五项(出题/阅卷/统计/动机)0/1/2 打分的三档定级工具 4.3
模型一致性 model consistency 接入的模型还是不是你以为的那个模型的问题 5.1
判定卡 把观测归入 Match/Suspicious/Downgrade/Rerouted/Unlisted/Invalid 六类定性 5.1
行为指纹 behavioral fingerprint 固定探针集上输出分布的稳定性特征,对微调/量化等改动稳健(2026 公开研究) 5.2
元数据 metadata 响应中服务端回传的 model 字段、版本口径等标识信息 5.2
快照口径 snapshot 要求服务方确认当前部署的模型标识与版本(治理动作) 5.1

四、自建实测(第 6 章)

术语 原文 一句话定义 详见
盲测 blind test 判分人不知回答出自哪个模型的评测组织方式 6.1
0/1/2 判分 每题三档人工/规则判分:全对/部分/全错 6.1
成对比较 pairwise comparison 评审在两个匿名回答中二选一,偏好稳定性高于绝对量表 2.1 / 6.2
内部竞技场 internal arena 用成对投票 + Elo 给内部候选排名的自建评测 6.2
对战矩阵 head-to-head matrix 两两交手的胜负计数表,用于交叉验证 Elo 排名 6.2
模型裁判 LLM-as-a-judge 用模型代替人做判分/投票,需治理位置与长度偏见 6.2 / 《Evals 实战》第 5 章

五、决策与跟踪(第 7~9 章、第 8 章场景)

术语 原文 一句话定义 详见
需求矩阵 硬约束(门槛)+ 加权维度(权重和 10)的需求表达 7.1
硬约束 hard constraint 不满足即出局的二值条件,永远不进权重 7.1
Pareto 前沿 Pareto front 三维(质量/成本/延迟)上互不支配的候选集合 7.2
被支配解 dominated solution 三维上都被另一候选"不差且至少一维严格更好"的候选 7.2
选型报告 一页七区块的可签字交付物,本书最终交付物 7.3
轨迹 trajectory Agent 每一步的输入、输出、工具调用与返回的完整记录 8.1
三态口径 任务判定分成功/部分成功/失败三档,加权完成率=(S+0.5P)/N 8.1
失败归因四分 模型/工具/环境/题目歧义四类记账,只有模型归因进横向比较 8.1
Overclaim(虚报) overclaiming Agent 自述与自身轨迹矛盾:声称做过而记录不支持 8.2
OverclaimBench 量化 Agent 虚报倾向的评测套件(arXiv 2026-09-18),基于 transcript 覆盖率判定 8.2
三栏对照卡 自述原文 | 三值判定 | 记录证据(带步骤号)的虚报判定工具 8.2
版本漂移 version drift 模型服务或其依赖随时间发生的行为变化 9.1
锚点题集 anchor set 从盲测题集挑出的 15~20 道高区分度常驻探针 9.1
触发器矩阵 周期(月度/季度)× 事件(公告/价格/告警)的再评测排期表 9.1
自噪声 self-noise 基线重复测量的自身波动(σ),告警线通常取 2σ 9.2

六、通用与工程

术语 原文 一句话定义 详见
token token 模型读写的计费与长度单位,中文约 1~2 字/token(量级示意) 0.2
上下文窗口 context window 单次调用能容纳的输入+输出 token 上限 4.2
温度 temperature 采样随机性参数:越低越确定,指纹探针必须钉死 5.2
量化 quantization 降低权重数值精度以省算力的部署手段,可能引起行为漂移 5.1
灰度 canary/灰度发布 新版本按小比例流量先行验证再全量的发布方式 7.3 / 9.1
SLA Service Level Agreement 服务等级协议:可用性、延迟、通知义务等的合同承诺 5.1
脱敏 de-identification 抽样真实数据造题时抹除个人信息与机密的处理 6.1

使用建议:本表按"忘了某个词在哪儿讲的"设计——先查表拿一句话定义,再跳"详见"章节。口径冲突时以正文为准。


作者与出处
原作者: 灏天文库
整理: 灏天文库整理
本站整理收录,版权归原作者/开源协议所有;欢迎通过原文链接访问源仓库。
发布者: 作者: 灏天文库 转发
评论区 (0)
U