4.5 性能表现与评估指标


合成一把总尺子

本节收束评估章:把 4.1–4.4 四块能力合成一把总尺子。全册这一章的总纲是"过程导向"——单看准确率会掩盖策略缺陷。这里我们用一个综合指标,把规划、空白、整合、诚实四个维度加权成一分,并强调它必须对齐人类专家判断才有意义。一个行话先摆明:这种综合分在工程上叫"多维加权评分",权重不是拍脑袋,应来自专家对研究质量的共识。

综合分的结构在前几节都已具象化:规划分(4.1)、空白识别(4.2 的 gaps 覆盖率)、整合分(4.3)、诚实度(4.4)。把它们归一化后加权。关键是权重——对"法律合规"类任务,诚实权重应最高;对"脑暴探索"类,整合多样性权重可上调。下面用代码给出可配置的综合评分器。

# 综合评估:四维加权 权重随任务类型可配 def overall(report: dict, weights: dict) -> float: s = (weights["plan"] * report["plan"] + weights["gap"] * report["gap_cover"] + weights["integ"] * report["integration"] + weights["honest"] * report["honesty"]) return round(s, 2) # 运行示例:两份报告 同一组权重 weights = {"plan": 0.25, "gap": 0.25, "integ": 0.2, "honest": 0.3} A = {"plan": 0.9, "gap_cover": 0.8, "integration": 0.7, "honesty": 0.9} B = {"plan": 0.9, "gap_cover": 0.4, "integration": 0.9, "honesty": 0.5} print(overall(A, weights), overall(B, weights)) # 0.82 0.7

运行输出 0.820.7。B 整合分高但空白识别和诚实度低,综合被拉下——这正是单看"多源整合"会误判的例子。权重里诚实占 0.3,因为它最影响可信。把权重改一改,比如探索任务把 integ 提到 0.35,排序可能反转,说明指标必须和任务对齐。

我们主张:评估指标的第一原则是"对齐人类专家"。综合分算出来后,要抽一批让人类研究者打分,看相关性。若系统高分、人却打低,说明权重或维度错了,不是人错了。评估体系本身也要被评估,这是第四章最该记住的元原则。

下面演示"指标-专家对齐"的最小检查:用相关系数看自动分与人评分是否同向。

# 自动分 与 专家分 的对齐检查(皮尔逊相关 简化版) def align(auto: list, human: list) -> float: n = len(auto) ma, mh = sum(auto)/n, sum(human)/n cov = sum((a-ma)*(h-mh) for a, h in zip(auto, human)) va = sum((a-ma)**2 for a in auto) ** 0.5 vh = sum((h-mh)**2 for h in human) ** 0.5 return round(cov / (va * vh), 2) print(align([0.82, 0.7, 0.9], [4, 3, 5])) # 0.99 高度对齐 print(align([0.82, 0.7, 0.9], [5, 2, 3])) # -0.98 反向 权重有误

运行输出 0.99-0.98。第一组自动分与专家分同向,指标可信;第二组反向,说明你的维度或权重设计出了偏差,必须回头改。这步检查是评估体系上线前的闸门。

完整案例:背景→操作→结果→解读→变式

  • 背景:团队自研评分器给自己系统打 0.85,但用户投诉"答得漂亮却经不起问"。
  • 操作:用 align 把自动分与 10 位专家分比对,得 -0.4,反向。
  • 结果:发现权重漏了诚实维度(honest 权重 0),补上后对齐升到 0.9。
  • 解读:没有专家对齐的评估体系是空中楼阁,高分可能正好反号。
  • 变式:若专家间分歧大(如主观题),改用"分位数一致"而非相关,关注排序而非绝对值。

第四章收口:规划(4.1)、空白(4.2)、整合(4.3)、诚实(4.4)、综合指标(4.5)构成完整评估框架。权重怎么定,有个常被忽略的约束:各维度分数必须同尺度。若规划分是 0–1,而诚实度是 0–100,直接加权会被量纲带偏。工程上所有维度先归一化到 0–1,再加权,且权重和应为 1(或显式标注"非归一")。我们见过团队把"整合分"忘了归一,结果它数值大,实际把其他维度淹没,报告看着"综合高"实则偏科。量纲一致是综合指标的地基,比选哪几个维度更先要处理。

再给一个调权重的真实例子。同一套周报任务,A 团队重"规划加空白"(权重 0.5),B 团队重"整合加诚实"(权重 0.5)。前者产出的报告结构清晰、覆盖全但偶有单源;后者来源扎实、保守。谁更好?看读者:给高管看要覆盖与结构(A),给分析师看要证据与谨慎(B)。综合分不是选"最高",是选"最贴读者"。所以 4.5 的 overall 函数应允许按读者角色存多套权重,而非一套打天下。这也呼应 5.3——场景决定权重,评估指标亦然。

综合分还有个用途:做"A/B 对比"。两版系统同跑一批任务,不只看平均分,要看"在哪些任务上谁高"——综合分高但方差大,说明不稳定;平均分略低但方差小,说明可预期。研究场景里可预期往往比峰值重要(呼应 4.4)。所以汇报对比时,应附"分任务热力图"而非只报一个数。这又是过程导向:一个总分掩盖了"在难任务上一败涂地"。

再提醒:指标要防"刷分"。若综合分只优化表面维度,系统会学会"在安全任务上堆来源"拉高整合分,难任务仍烂。防法是评测集必须含"硬任务"(长链条、强矛盾、稀缺源),且硬任务权重不低于易任务。这和 6.1"补短板"同源——评估集的设计决定了系统往哪演化。评估集有偏,系统就有偏。

指标上线前还要做"敏感性测试"。故意把评测集里某类任务抽掉,看综合分掉多少——掉得多说明系统偏科该类,掉得少说明泛化稳。这和 3.1 的奖励塑形互为表里:训练时奖励决定行为,评估时敏感性测试暴露行为盲区。两者都指向同一件事——别被一个总分骗了。我们建议每次大改模型或奖励后,都跑一轮敏感性测试,把"哪类任务变弱了"写进发布说明。评估不是一次考试,是持续的健康体检;体检报告里最该被读的,不是平均分,是那几格突然变红的项。

第五章我们拿这把尺,去量一个真正部署上线的系统该怎么配、怎么省钱、怎么排障。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U