benchmark 一维 vs 好用多维
排行榜上的高分模型,换到你的任务上常常拉胯。因为 benchmark 数据会"漏"进训练集。
三个跑分陷阱:
所以跑分是必要不充分:能筛掉明显差的,但跑分高不保证好用。选模型要跑分 + 真实任务样本 + 人工盲评,三者结合。
选你的使用场景,看该测哪些维度、各自多重要。
一个常见坑:只看一个总分选模型,结果上线后发现某个关键维度(如拒答)崩了。多维分开看短板,短板决定能不能用,长板只决定上限。