3.3 Score:刻度评分


3.3 Score:刻度评分

本节摘要:Score 是 Jev 的落位原语:在 2~10 个有序等级上打分,返回概率加权的连续分值 score、各级分布 probabilities、图例 legend 和置信度。三条设计准则:每个等级描述一个具体情形而非程度副词("核心功能受损,但有临时绕过办法" ✅,"中等严重" ❌);一个 Score 只测一个维度,综合分在代码里加权组合(第 6.3 节);等级从 0 起、方向一致(建议由最严重/最极端往中性排),减少理解歧义。Score 是内容分级、风险评分、相关性打分的主力原语。

学习目标

阅读完本节,你应当能够:

  1. 写出等级描述合格的 Score 请求并解读 score 字段的加权语义。
  2. 解释"程度副词等级表"为什么是坑。
  3. 把一个"综合大判断"正确拆成多个 Score。

一、语义与请求/响应

语义criteria 是一个有序数组(等级 0 起向上),每级一段描述;模型给出各级的概率分布,score 是按概率加权的均值。

{ "severity": { "type": "score", "instructions": "评估该线上故障的严重程度", "criteria": [ "核心功能完全不可用,且没有任何绕过办法", "核心功能受损,但存在临时绕过办法", "次要功能异常,核心功能完好", "仅界面或文案瑕疵,功能完好", "无实际问题" ] } }

响应(示意):

{ "score": 1.4, "legend": ["核心不可用且无绕过", "核心受损有绕过", "次要异常", "外观瑕疵", "无问题"], "probabilities": { "0": 0.35, "1": 0.50, "2": 0.10, "3": 0.03, "4": 0.02 }, "confidence": 0.7 }

解读:分布集中在等级 0 和 1 之间、略偏 1,加权得 1.4——"很可能是'核心受损但有绕过',且不小概率更糟"。连续的 score 让你可以直接拿去做不等式if score < 2.0: 拉响P2),也保留了分布供你做更细的决策。

二、设计准则

准则一:等级描述具体情形,不是程度副词

❌ 程度副词等级 ✅ 具体情形等级
非常严重 核心功能不可用且无绕过
比较严重 核心功能受损但有绕过
一般 次要功能异常
轻微 仅外观瑕疵

"中等"对模型和对你意味着不同的东西;具体情形是双方共同的锚点。这也是独立评测公认的 Jev 使用要点之一。

准则二:一个 Score 一个维度

不要做"严重性和影响面综合分"——两个维度混在一条标尺上,等级描述必然自相矛盾("严重但影响面小"算哪级?)。正确做法:

severity → 一个 Score(多严重) blast_radius → 一个 Score(波及多广) 代码里按业务权重组合 → 复合分(第 6.3 节完整实现)

维度拆开后,每个 Score 的等级描述都能写得具体、可回归测试;权重变化只改代码,不动模型请求。

准则三:方向一致,极端在前

等级从 0 向上,建议由最严重/最极端排向中性(如上例),同一场景的所有 Score 保持同向(都是"0 = 最严重")。方向混乱会让"加权组合"与"跨维度比较"失去意义。

三、典型用途

用途 标尺
内容风险分级 0 危险 … 4 无害
RAG 检索相关性 0 完全无关 … 4 直接回答问题
线索质量 0 高意向 … 4 无意向
代码评审结论 0 必须修改 … 4 无意见

本节要点回顾

  1. 语义:有序等级(2~10 级)→ 加权连续分 + 分布 + 置信度;不等式可直接作用于 score。
  2. 准则:具体情形(不写程度副词)、单维度、方向一致极端在前。
  3. 拆分:综合判断 = 多个单维 Score + 代码加权——这是第 6.3 节复合评分模式的地基。

三种原语集齐了。遇到一个新需求,Noul、Choice、Score 怎么选、怎么拆、怎么组?下一节给出一棵选型决策树和请求骨架总览,为第 4 章的动手做好准备。


作者与出处
原作者: 灏天文库
整理: 灏天文库整理
本站整理收录,版权归原作者/开源协议所有;欢迎通过原文链接访问源仓库。
发布者: 作者: 灏天文库 转发
评论区 (0)
U