内容摘要
模型评测·跑分高不等于好用 灏 灏天文库 · AI 与大模型 第 16 期 · 第二季连载 AI 与大模型 · 第 16 期 · 第二季第 8 期 模型评测, 跑分高不等于好用 benchmark 一维 vs 好用多维 一句话结论: 跑分高 ≠ 好用 。MMLU 跑分只测"知识问答"一维,但好用要测指令遵循、安全、长上下文、拒答、格式稳定等多维。模型可以刷分刷到很高但实际难用——过拟合 benchmark。选模型要看多维评测 + 你的真实任务,别只看排行榜。 ⏱ 约 9 分钟 🎯 想选模型不被跑分骗的人 📦 源:ai-engineering-from-scratch §12 01 反共识:benchmark 会过拟合 排行榜上的高分模型,换到你的任务上常常拉胯。因为 benchmark 数据会"漏"进训练集。 三个跑分陷阱: 数据污染 :MMLU/GSM8K 的题目被爬进训练数据,模型"背"了答案而不是"会"。表现为跑分虚高、稍改题目就崩。 单维偏科 :MMLU 测知识,不测指令遵循。一个"百科全书式但听不懂指令"的模型 MMLU 高但难用。