附录 B 榜单与平台速查


附录 B 榜单与平台速查

1.2 的速览扩展成一页速查表:按 1.1 的四形态归类,给"定位"与"选择者读法",不列名次不报分数(全书纪律)。口径 2026-09,以各家官方为准——名字、机制、入口随时会变,本表定格的是"怎么用"而不是"现在谁高"。

一、使用说明

三条纪律照旧:回源(分数找到官方出处再看一眼)、看日期(没日期的分数不用)、不报数(本表与全书不出现具体名次与分数)。每一行的"读法"列都指回正文章节——速查表的目的是让你更快地回到方法,不是替你下结论。

二、速查表(口径 2026-09,以官方为准)

名称 形态 定位/测什么 选择者读法 详见
LMArena(前身 Chatbot Arena,LMSYS 发起) 竞技场 开放对话的人类偏好投票排名(BT + bootstrap CI + 风格控制,官方口径) 换算胜率 → 查区间是否重叠 → 剥风格;用官方站,镜像只当导航 2.1~2.3
OpenCompass 司南 榜单 + 开源评测体系 覆盖多套公开基准的榜单与工具链(上海人工智能实验室,官方自述) 代码开源可本地复跑——分数可以不信仰、可以自己验证 1.2
SuperCLUE 基准榜单 中文通用能力综合测评,四能力象限 12 项基础能力(官方自述) 中文场景距离更近(4.2 语言维),读法同构不豁免折价 1.2
MMLU 类(及 C-Eval、CMMLU 等中文变体) 学术基准 多领域选择题,通识与专业知识,EM 判分 查题库日期与污染声明;距离矩阵先打分再决定信多少 4.1/4.2
GSM8K 类 学术基准 小学数学应用题,多步推理 题型距离近时可参考推理基本盘(4.2 传导判据) 4.2
HumanEval 类 学术基准 代码补全 + 单元测试,pass@1 口径 公开最久的代码题库之一——污染窗口长,折价从严 4.1
datalearner / LLMPodium / 聚模合等 聚合平台 收集各基准/竞技场分数进一张表 当索引不当结论:发现候选与维度,回官方核对原始分 1.2
EvalScope 等评测框架 评测工具 自建评测的工具链 给要自己跑评测的人;轻度需求第 6 章脚本够用,体系化转《Evals 实战》第 6 章 1.2
OverclaimBench 基准(Agent 行为) 量化 Agent 虚报倾向:自述 vs transcript 覆盖率(arXiv 2026-09-18) 选 Agent 供应商时的三个问法来源;本书不转述具体成绩 8.2
内部竞技场(自建) 竞技场(自建) 你的题集 + 成对投票 + Elo 最贴你场景的排名来源;组织纪律与读法见 6.2 6.2

三、四形态读法对照(复习卡)

形态 出题 阅卷 关键风险 一句话读法
静态基准 固定题库 规则/EM 污染(4.1) 查日期、查污染声明、多基准交叉
动态榜单 周期换题 规则为主 版本口径漂移 对齐评测时间窗再用
竞技场 用户实问 人类投票 风格偏置(2.3) 换算胜率 + 查 CI + 剥风格
评测平台 混合 混合 利益结构复杂(1.1) 核对表定档(4.3)再定权重

四、信息源决策表模板

给常用信息源定角色的模板(用法见 4.2/4.3):

信息源 可信度档位(4.3) 任务距离分(4.2) 角色 核对日期
(示例)LMArena 官方站 高/中/低 ___/14 主源/交叉源/线索源 ____--
(示例)某聚合站 高/中/低 ___/14 通常线索源 ____--

一句话总结本表:榜单是地图,不是目的地——地图帮你圈出值得去测的候选(第 6 章),到达与否永远由你自己的五十条说了算。


作者与出处
原作者: 灏天文库
整理: 灏天文库整理
本站整理收录,版权归原作者/开源协议所有;欢迎通过原文链接访问源仓库。
发布者: 作者: 灏天文库 转发
评论区 (0)
U