AI 与大模型 · 第 16 期 · 第二季第 8 期

模型评测,跑分高不等于好用

benchmark 一维 vs 好用多维

一句话结论:跑分高 ≠ 好用。MMLU 跑分只测"知识问答"一维,但好用要测指令遵循、安全、长上下文、拒答、格式稳定等多维。模型可以刷分刷到很高但实际难用——过拟合 benchmark。选模型要看多维评测 + 你的真实任务,别只看排行榜。
⏱ 约 9 分钟 🎯 想选模型不被跑分骗的人 📦 源:ai-engineering-from-scratch §12

01反共识:benchmark 会过拟合

排行榜上的高分模型,换到你的任务上常常拉胯。因为 benchmark 数据会"漏"进训练集。

三个跑分陷阱:

所以跑分是必要不充分:能筛掉明显差的,但跑分高不保证好用。选模型要跑分 + 真实任务样本 + 人工盲评,三者结合。

跑分筛差的,
不保证好用。
灏天文库 · AI 与大模型 P.47

02评测维度闯关:选场景看该测什么

选你的使用场景,看该测哪些维度、各自多重要。

🎯 评测维度闯关
选场景,看该测哪些维度(必须/应该/加分)。

03怎么搭一个不被骗的评测

一个常见坑:只看一个总分选模型,结果上线后发现某个关键维度(如拒答)崩了。多维分开看短板,短板决定能不能用,长板只决定上限。

短板决定能不能用,
长板决定上限。
灏天文库 · AI 与大模型 P.48

04带走这套评测清单

✅ 模型评测 6 条可执行规则

  1. 跑分是必要不充分:能筛差的,不保证好用。
  2. 防数据污染:造私有 benchmark,定期换新。
  3. 多维分开看:指令遵循、安全、拒答、格式、长上下文。
  4. 人工盲评:匿名排序比自动指标接近好用。
  5. 加对抗样本:越狱、模糊指令、长上下文埋雷。
  6. 短板决定能不能用:先看短板再看长板。
跑分高是起点,
好用才是终点。
灏天文库 · AI 与大模型 P.49