本节摘要:LLM 也"有"概率(logprobs),但那是采样温度的副产品,未经校准——说 80% 把握的预测实际可能只有 60% 正确。Jev 的训练目标是 RLCD(Reinforcement Learning for Calibrated Decisions,面向校准决策的强化学习):奖励"认识论上诚实"的概率输出,与 RLHF(优化人类偏好,聊天模型用)、RLVR(优化可验证奖励,推理模型用)并列为三种 RL 范式。校准的实操含义:Jev 说 0.9,长期来看约 90% 命中——概率第一次成为可作为工程契约的量:你可以围绕它设计 SLA、兜底与预算。但契约有一个前提:校准是"在你的数据分布上"的性质,第 9 章的验证流程是这份契约的公证处。
阅读完本节,你应当能够:
让 LLM "给出置信度",你会得到三种东西,没有一种是校准概率:
未校准概率的工程后果:if p > 0.9 不再意味着 90% 命中——你可能以为买了保险,实际免赔额高得多。所有围绕阈值的 SLA、预算、兜底设计都会失真。
TypeSafe 对 Jev 用的训练范式是 RLCD——Reinforcement Learning for Calibrated Decisions,官方表述为优化"在 System One 任务上给出认识论上诚实概率的答案":
| 优化目标 | 训练信号 | 用于 | |
|---|---|---|---|
| RLHF | 人类偏好(哪个回答更讨喜) | 人工排序 | 聊天模型 |
| RLVR | 可验证奖励(代码能跑通、答案可对) | 程序判定 | 推理模型 |
| RLCD | 校准的决策概率 | 判断正确性 × 概率诚实度 | Jev / System One 模型 |
直观理解 RLCD 塑造的行为:
这也解释了第 3.1 节的"0.5 = 拿不准":那是训练目标刻意保留的诚实信号,不是缺陷。
校准让概率从"数字"升级为"合同":
p(紧急) = 0.9 ⇒ 长期来看,这个分支每走 10 次约 9 次走对 ⇒ 可以设计 SLA(自动化率 ≥ X%) ⇒ 可以设计预算(错误处理的期望成本 = 错误率 × 单次代价) ⇒ 可以设计兜底(0.4~0.6 区间转人工,覆盖率可预估)
但这份合同有两个前提,缺一不可:
💡 一个务实的类比:校准概率像一台标定过的秤。出厂标定(RLCD)让它可信,但你卖黄金之前,还是要用自己的砝码(回归集)再校一次。
概率可信了,但 Choice/Score 的返回里还有一个容易与它混淆的字段:confidence。下一节讲清楚这两个正交的维度,以及怎么组合它们做门控。