本节摘要:Score 是 Jev 的落位原语:在 2~10 个有序等级上打分,返回概率加权的连续分值
score、各级分布probabilities、图例legend和置信度。三条设计准则:每个等级描述一个具体情形而非程度副词("核心功能受损,但有临时绕过办法" ✅,"中等严重" ❌);一个 Score 只测一个维度,综合分在代码里加权组合(第 6.3 节);等级从 0 起、方向一致(建议由最严重/最极端往中性排),减少理解歧义。Score 是内容分级、风险评分、相关性打分的主力原语。
阅读完本节,你应当能够:
score 字段的加权语义。语义:criteria 是一个有序数组(等级 0 起向上),每级一段描述;模型给出各级的概率分布,score 是按概率加权的均值。
{ "severity": { "type": "score", "instructions": "评估该线上故障的严重程度", "criteria": [ "核心功能完全不可用,且没有任何绕过办法", "核心功能受损,但存在临时绕过办法", "次要功能异常,核心功能完好", "仅界面或文案瑕疵,功能完好", "无实际问题" ] } }
响应(示意):
{ "score": 1.4, "legend": ["核心不可用且无绕过", "核心受损有绕过", "次要异常", "外观瑕疵", "无问题"], "probabilities": { "0": 0.35, "1": 0.50, "2": 0.10, "3": 0.03, "4": 0.02 }, "confidence": 0.7 }
解读:分布集中在等级 0 和 1 之间、略偏 1,加权得 1.4——"很可能是'核心受损但有绕过',且不小概率更糟"。连续的 score 让你可以直接拿去做不等式(if score < 2.0: 拉响P2),也保留了分布供你做更细的决策。
| ❌ 程度副词等级 | ✅ 具体情形等级 |
|---|---|
| 非常严重 | 核心功能不可用且无绕过 |
| 比较严重 | 核心功能受损但有绕过 |
| 一般 | 次要功能异常 |
| 轻微 | 仅外观瑕疵 |
"中等"对模型和对你意味着不同的东西;具体情形是双方共同的锚点。这也是独立评测公认的 Jev 使用要点之一。
不要做"严重性和影响面综合分"——两个维度混在一条标尺上,等级描述必然自相矛盾("严重但影响面小"算哪级?)。正确做法:
severity → 一个 Score(多严重) blast_radius → 一个 Score(波及多广) 代码里按业务权重组合 → 复合分(第 6.3 节完整实现)
维度拆开后,每个 Score 的等级描述都能写得具体、可回归测试;权重变化只改代码,不动模型请求。
等级从 0 向上,建议由最严重/最极端排向中性(如上例),同一场景的所有 Score 保持同向(都是"0 = 最严重")。方向混乱会让"加权组合"与"跨维度比较"失去意义。
| 用途 | 标尺 |
|---|---|
| 内容风险分级 | 0 危险 … 4 无害 |
| RAG 检索相关性 | 0 完全无关 … 4 直接回答问题 |
| 线索质量 | 0 高意向 … 4 无意向 |
| 代码评审结论 | 0 必须修改 … 4 无意见 |
三种原语集齐了。遇到一个新需求,Noul、Choice、Score 怎么选、怎么拆、怎么组?下一节给出一棵选型决策树和请求骨架总览,为第 4 章的动手做好准备。