本节摘要:「它 MMLU 都 90+ 了,做我的客服任务肯定没问题」——这句话犯了能力传导谬误:把"公开考卷上的通识能力"直接等同于"你场景分布上的业务表现"。错位有三个机制:分布不同(通识选择题 vs 你的工单、合同、方言口语)、判定不同(精确匹配 vs 你的语义与格式合规标准)、目标不同(考卷本身就是被优化的对象,4.1)。本节交付任务距离矩阵:七个维度——领域、题型、判定方式、错误代价、语言、上下文长度、工具使用——每个维度按 0(同型)/1(有差异)/2(完全不同)打分,总分 ≤3 距离近(分数可初筛)、46 距离中(折价使用)、≥7 距离远(仅供参考,必须自测),附打分脚本(示例场景:英文通识基准 vs 中文客服,9/14 → 必须自测)。矩阵的第二个用途:给你常看的 35 张榜单各打一遍分,据此分配信任权重——这就是选择者的信息源组合决策。最后诚实列出传导确实成立的情形(底层能力)与判据。
阅读完本节,你应当能够:
三个机制,一层比一层深:
⚠️ 最容易中招的人群恰恰是懂数学的人:看到 92 分 > 88 分就觉得"有 4 分优势"。错位面前,这两个数字谈论的是另一场考试。
七个维度,每维 0/1/2(0 = 同型,1 = 有差异,2 = 完全不同):
| 维度 | 打 0 的情形 | 打 2 的情形 |
|---|---|---|
| 领域 | 基准就是本领域题 | 通识题 vs 垂直领域 |
| 题型 | 任务形式一致(如都是分类) | 选择题 vs 开放生成 |
| 判定方式 | 同类判定(EM/规则/裁判) | EM vs 业务语义判定 |
| 错误代价 | 错误代价结构相似 | 低风险考试 vs 高风险合规 |
| 语言 | 同语言同地区 | 英文基准 vs 中文场景 |
| 上下文长度 | 长度量级一致 | 短问答 vs 长文档任务 |
| 工具使用 | 都不涉及 / 都涉及 | 纯文本 vs 需调工具与 API |
打分脚本(把判定规则固化成代码,团队可以共用同一把尺):
# task_distance.py(纯标准库,可直接运行) """任务距离矩阵打分:基准与你的场景隔多远,决定分数能借用多少。""" DIMS = ["领域", "题型", "判定方式", "错误代价", "语言", "上下文长度", "工具使用"] def distance(scores): total = sum(scores.values()) if total <= 3: verdict = "距离近:榜单分数可直接作为初筛依据" elif total <= 6: verdict = "距离中:分数折价使用,进入盲测候选" else: verdict = "距离远:分数仅供参考,必须自测(第 6 章)" return total, verdict if __name__ == "__main__": # 评分口径:0=同型 1=有差异 2=完全不同(各维定义见正文表格) my_case = dict(zip(DIMS, [1, 1, 2, 2, 0, 1, 2])) # 示意:英文通识基准 vs 中文客服场景 for dim, s in my_case.items(): print(f" {dim}: {s}") total, verdict = distance(my_case) print(f"任务距离总分 {total}/14 → {verdict}")
一次运行的真实输出(实测):
领域: 1 题型: 1 判定方式: 2 错误代价: 2 语言: 0 上下文长度: 1 工具使用: 2 任务距离总分 9/14 → 距离远:分数仅供参考,必须自测(第 6 章)
示例解读(示意场景):拿英文通识基准给"中文客服"选型——语言维用中文基准可归 0,但判定方式(EM vs 业务判定)、错误代价(考试 vs 合规)、工具使用(纯文本 vs 工单系统联动)三项全隔,总分 9/14,必须自测。注意语言维打了 0 是因为示例假设你已换用中文基准——先把语言对齐再谈其他维度,是最便宜的纠偏动作。
距离矩阵不止判一次,更用于配置你的信息源组合。操作三步:
这样"我看哪张榜"从口味问题变成了一张可写进选型报告的信息源决策表(第 7 章报告模板直接消费它)。三个来源若在同一能力上分歧巨大,分歧本身就是信息——通常指向污染(4.1)或风格效应(2.3)。
诚实地讲,通识分并非全不传导。传导成立的情形(社区经验归纳)与判据:
| 能力 | 传导判据 |
|---|---|
| 指令遵循(格式、约束遵守) | 基准的指令形态与你的指令形态接近时,传导较稳 |
| 长上下文的稳定性(不丢中部信息) | 上下文长度同量级时,可参考长上下文基准 |
| 推理的基本盘 | 题型距离近的推理基准(如同为数学应用题)可参考 |
| 领域知识、格式合规、业务容错 | 几乎不传导——分布与判定都在你家里 |
判据一句话:该能力在你的场景里被"原样调用"则传导,被"重新组装"则不传导。指令遵循是原样调用("输出 JSON"到哪都是"输出 JSON");领域答案是重新组装(你的知识分布、你的口径、你的容错)。
矩阵告诉你分数能借用多少,但没有任何矩阵能把别人的分数变成你的证据。距离分 ≥7 的场景,唯一出路是第 6 章的五十条盲测:五十条你自己的题、你自己的判定、你自己的代价权重——两小时内跑完一次可复用的实测(第 6 章,含完整脚本)。在那之前,先用 4.3 的核对表把"我为什么不信这个分数"变成可写下的理由。
污染折价(4.1)+ 错位折价(本节)还差最后一道:动机折价,以及把三道折价变成一页纸的操作流程——4.3 评测可信度核对表,本书的核心交付物。