4.2 能力分数与你的场景错位


4.2 能力分数与你的场景错位

本节摘要:「它 MMLU 都 90+ 了,做我的客服任务肯定没问题」——这句话犯了能力传导谬误:把"公开考卷上的通识能力"直接等同于"你场景分布上的业务表现"。错位有三个机制:分布不同(通识选择题 vs 你的工单、合同、方言口语)、判定不同(精确匹配 vs 你的语义与格式合规标准)、目标不同(考卷本身就是被优化的对象,4.1)。本节交付任务距离矩阵:七个维度——领域、题型、判定方式、错误代价、语言、上下文长度、工具使用——每个维度按 0(同型)/1(有差异)/2(完全不同)打分,总分 ≤3 距离近(分数可初筛)、46 距离中(折价使用)、≥7 距离远(仅供参考,必须自测),附打分脚本(示例场景:英文通识基准 vs 中文客服,9/14 → 必须自测)。矩阵的第二个用途:给你常看的 35 张榜单各打一遍分,据此分配信任权重——这就是选择者的信息源组合决策。最后诚实列出传导确实成立的情形(底层能力)与判据。

学习目标

阅读完本节,你应当能够:

  1. 说出能力传导谬误的三个机制(分布、判定、目标)。
  2. 用七维任务距离矩阵给"某基准 vs 我的场景"打分并判档。
  3. 用矩阵给常用榜单分配信任权重,形成信息源组合。
  4. 判断哪些底层能力确实可以跨场景传导、判据是什么。

一、MMLU 高分为什么救不了你的客服

三个机制,一层比一层深:

  1. 分布不同:MMLU 类基准考的是学术选择题的知识覆盖;你的客服场景是"工单 + 情绪 + 方言 + 内部术语"的分布。模型在 A 分布上的期望分数对 B 分布没有约束——就像高考数学满分不保证会算你家门店的对账单;
  2. 判定不同:基准用精确匹配判对错;你的场景要判"语义对、格式合规、口气得体、没有过度承诺"——四条标准基准一条都不考(第 3 章的口径问题在场景层重现);
  3. 目标不同:越有名的基准越被直接优化(4.1 的污染与刷榜)——你以为在测"通识能力",实际测的是"这份考卷的应试水平"。

⚠️ 最容易中招的人群恰恰是懂数学的人:看到 92 分 > 88 分就觉得"有 4 分优势"。错位面前,这两个数字谈论的是另一场考试。

二、任务距离矩阵:给"考卷 vs 场景"打分

七个维度,每维 0/1/2(0 = 同型,1 = 有差异,2 = 完全不同):

维度 打 0 的情形 打 2 的情形
领域 基准就是本领域题 通识题 vs 垂直领域
题型 任务形式一致(如都是分类) 选择题 vs 开放生成
判定方式 同类判定(EM/规则/裁判) EM vs 业务语义判定
错误代价 错误代价结构相似 低风险考试 vs 高风险合规
语言 同语言同地区 英文基准 vs 中文场景
上下文长度 长度量级一致 短问答 vs 长文档任务
工具使用 都不涉及 / 都涉及 纯文本 vs 需调工具与 API

打分脚本(把判定规则固化成代码,团队可以共用同一把尺):

# task_distance.py(纯标准库,可直接运行) """任务距离矩阵打分:基准与你的场景隔多远,决定分数能借用多少。""" DIMS = ["领域", "题型", "判定方式", "错误代价", "语言", "上下文长度", "工具使用"] def distance(scores): total = sum(scores.values()) if total <= 3: verdict = "距离近:榜单分数可直接作为初筛依据" elif total <= 6: verdict = "距离中:分数折价使用,进入盲测候选" else: verdict = "距离远:分数仅供参考,必须自测(第 6 章)" return total, verdict if __name__ == "__main__": # 评分口径:0=同型 1=有差异 2=完全不同(各维定义见正文表格) my_case = dict(zip(DIMS, [1, 1, 2, 2, 0, 1, 2])) # 示意:英文通识基准 vs 中文客服场景 for dim, s in my_case.items(): print(f" {dim}: {s}") total, verdict = distance(my_case) print(f"任务距离总分 {total}/14 → {verdict}")

一次运行的真实输出(实测):

领域: 1 题型: 1 判定方式: 2 错误代价: 2 语言: 0 上下文长度: 1 工具使用: 2 任务距离总分 9/14 → 距离远:分数仅供参考,必须自测(第 6 章)

示例解读(示意场景):拿英文通识基准给"中文客服"选型——语言维用中文基准可归 0,但判定方式(EM vs 业务判定)、错误代价(考试 vs 合规)、工具使用(纯文本 vs 工单系统联动)三项全隔,总分 9/14,必须自测。注意语言维打了 0 是因为示例假设你已换用中文基准——先把语言对齐再谈其他维度,是最便宜的纠偏动作。

三、矩阵的第二用途:给信息源组合定权重

距离矩阵不止判一次,更用于配置你的信息源组合。操作三步:

  1. 列出你常用的 3~5 张榜单/基准(1.2 的分类里挑);
  2. 各打一遍任务距离,得到每张的"距离分";
  3. 按距离分配权重:距离分低的当初筛主源,距离分中的当交叉验证源,距离分高的只当线索源(发现新模型用)。

这样"我看哪张榜"从口味问题变成了一张可写进选型报告的信息源决策表(第 7 章报告模板直接消费它)。三个来源若在同一能力上分歧巨大,分歧本身就是信息——通常指向污染(4.1)或风格效应(2.3)。

四、"通用能力溢出"的辩护与反驳

诚实地讲,通识分并非全不传导。传导成立的情形(社区经验归纳)与判据:

能力 传导判据
指令遵循(格式、约束遵守) 基准的指令形态与你的指令形态接近时,传导较稳
长上下文的稳定性(不丢中部信息) 上下文长度同量级时,可参考长上下文基准
推理的基本盘 题型距离近的推理基准(如同为数学应用题)可参考
领域知识、格式合规、业务容错 几乎不传导——分布与判定都在你家里

判据一句话:该能力在你的场景里被"原样调用"则传导,被"重新组装"则不传导。指令遵循是原样调用("输出 JSON"到哪都是"输出 JSON");领域答案是重新组装(你的知识分布、你的口径、你的容错)。

五、错位的最终解法

矩阵告诉你分数能借用多少,但没有任何矩阵能把别人的分数变成你的证据。距离分 ≥7 的场景,唯一出路是第 6 章的五十条盲测:五十条你自己的题、你自己的判定、你自己的代价权重——两小时内跑完一次可复用的实测(第 6 章,含完整脚本)。在那之前,先用 4.3 的核对表把"我为什么不信这个分数"变成可写下的理由。

本节要点回顾

  1. 传导谬误三机制:分布不同、判定不同、目标不同(考卷本身被优化)。
  2. 任务距离矩阵:七维 0/1/2 打分,≤3 初筛可用 / 4~6 折价 / ≥7 必须自测(脚本固化,团队共用一把尺)。
  3. 信息源组合:给常看的榜单各打一遍距离分,按分分配主源/交叉源/线索源角色。
  4. 传导判据:能力被"原样调用"则传导,被"重新组装"则不传导。
  5. 最终解法:距离远的分数只能当线索,证据要自己造(第 6 章盲测)。

污染折价(4.1)+ 错位折价(本节)还差最后一道:动机折价,以及把三道折价变成一页纸的操作流程——4.3 评测可信度核对表,本书的核心交付物。


作者与出处
原作者: 灏天文库
整理: 灏天文库整理
本站整理收录,版权归原作者/开源协议所有;欢迎通过原文链接访问源仓库。
发布者: 作者: 灏天文库 转发
评论区 (0)
U