1.2 的速览扩展成一页速查表:按 1.1 的四形态归类,给"定位"与"选择者读法",不列名次不报分数(全书纪律)。口径 2026-09,以各家官方为准——名字、机制、入口随时会变,本表定格的是"怎么用"而不是"现在谁高"。
三条纪律照旧:回源(分数找到官方出处再看一眼)、看日期(没日期的分数不用)、不报数(本表与全书不出现具体名次与分数)。每一行的"读法"列都指回正文章节——速查表的目的是让你更快地回到方法,不是替你下结论。
| 名称 | 形态 | 定位/测什么 | 选择者读法 | 详见 |
|---|---|---|---|---|
| LMArena(前身 Chatbot Arena,LMSYS 发起) | 竞技场 | 开放对话的人类偏好投票排名(BT + bootstrap CI + 风格控制,官方口径) | 换算胜率 → 查区间是否重叠 → 剥风格;用官方站,镜像只当导航 | 2.1~2.3 |
| OpenCompass 司南 | 榜单 + 开源评测体系 | 覆盖多套公开基准的榜单与工具链(上海人工智能实验室,官方自述) | 代码开源可本地复跑——分数可以不信仰、可以自己验证 | 1.2 |
| SuperCLUE | 基准榜单 | 中文通用能力综合测评,四能力象限 12 项基础能力(官方自述) | 中文场景距离更近(4.2 语言维),读法同构不豁免折价 | 1.2 |
| MMLU 类(及 C-Eval、CMMLU 等中文变体) | 学术基准 | 多领域选择题,通识与专业知识,EM 判分 | 查题库日期与污染声明;距离矩阵先打分再决定信多少 | 4.1/4.2 |
| GSM8K 类 | 学术基准 | 小学数学应用题,多步推理 | 题型距离近时可参考推理基本盘(4.2 传导判据) | 4.2 |
| HumanEval 类 | 学术基准 | 代码补全 + 单元测试,pass@1 口径 | 公开最久的代码题库之一——污染窗口长,折价从严 | 4.1 |
| datalearner / LLMPodium / 聚模合等 | 聚合平台 | 收集各基准/竞技场分数进一张表 | 当索引不当结论:发现候选与维度,回官方核对原始分 | 1.2 |
| EvalScope 等评测框架 | 评测工具 | 自建评测的工具链 | 给要自己跑评测的人;轻度需求第 6 章脚本够用,体系化转《Evals 实战》第 6 章 | 1.2 |
| OverclaimBench | 基准(Agent 行为) | 量化 Agent 虚报倾向:自述 vs transcript 覆盖率(arXiv 2026-09-18) | 选 Agent 供应商时的三个问法来源;本书不转述具体成绩 | 8.2 |
| 内部竞技场(自建) | 竞技场(自建) | 你的题集 + 成对投票 + Elo | 最贴你场景的排名来源;组织纪律与读法见 6.2 | 6.2 |
| 形态 | 出题 | 阅卷 | 关键风险 | 一句话读法 |
|---|---|---|---|---|
| 静态基准 | 固定题库 | 规则/EM | 污染(4.1) | 查日期、查污染声明、多基准交叉 |
| 动态榜单 | 周期换题 | 规则为主 | 版本口径漂移 | 对齐评测时间窗再用 |
| 竞技场 | 用户实问 | 人类投票 | 风格偏置(2.3) | 换算胜率 + 查 CI + 剥风格 |
| 评测平台 | 混合 | 混合 | 利益结构复杂(1.1) | 核对表定档(4.3)再定权重 |
给常用信息源定角色的模板(用法见 4.2/4.3):
| 信息源 | 可信度档位(4.3) | 任务距离分(4.2) | 角色 | 核对日期 |
|---|---|---|---|---|
| (示例)LMArena 官方站 | 高/中/低 | ___/14 | 主源/交叉源/线索源 | ____-- |
| (示例)某聚合站 | 高/中/低 | ___/14 | 通常线索源 | ____-- |
一句话总结本表:榜单是地图,不是目的地——地图帮你圈出值得去测的候选(第 6 章),到达与否永远由你自己的五十条说了算。