5.2 RLCD:概率是练出来的


5.2 RLCD:概率是练出来的

本节摘要:LLM 也"有"概率(logprobs),但那是采样温度的副产品,未经校准——说 80% 把握的预测实际可能只有 60% 正确。Jev 的训练目标是 RLCD(Reinforcement Learning for Calibrated Decisions,面向校准决策的强化学习):奖励"认识论上诚实"的概率输出,与 RLHF(优化人类偏好,聊天模型用)、RLVR(优化可验证奖励,推理模型用)并列为三种 RL 范式。校准的实操含义:Jev 说 0.9,长期来看约 90% 命中——概率第一次成为可作为工程契约的量:你可以围绕它设计 SLA、兜底与预算。但契约有一个前提:校准是"在你的数据分布上"的性质,第 9 章的验证流程是这份契约的公证处。

学习目标

阅读完本节,你应当能够:

  1. 解释"未校准的概率"与"校准的概率"在工程上的差别。
  2. 说出 RLCD 与 RLHF/RLVR 各自的优化目标与适用模型。
  3. 阐述"概率即契约"的两个前提(分布内、需验证)。

一、为什么 LLM 的概率不能直接用

让 LLM "给出置信度",你会得到三种东西,没有一种是校准概率:

  • 语气副词:"大概率是计费问题"——没有刻度,不可比;
  • logprob:下一个 token 的采样倾向,受温度影响,未经校准;
  • 自报数字:让模型"输出 0~100 的把握",研究表明这类数字系统性过度自信。

未校准概率的工程后果if p > 0.9 不再意味着 90% 命中——你可能以为买了保险,实际免赔额高得多。所有围绕阈值的 SLA、预算、兜底设计都会失真。

二、RLCD:把校准练进模型

TypeSafe 对 Jev 用的训练范式是 RLCD——Reinforcement Learning for Calibrated Decisions,官方表述为优化"在 System One 任务上给出认识论上诚实概率的答案":

优化目标 训练信号 用于
RLHF 人类偏好(哪个回答更讨喜) 人工排序 聊天模型
RLVR 可验证奖励(代码能跑通、答案可对) 程序判定 推理模型
RLCD 校准的决策概率 判断正确性 × 概率诚实度 Jev / System One 模型

直观理解 RLCD 塑造的行为:

  • 模型有把握时,敢给 0.95;没把握时,诚实地回到 0.5 附近,而不是硬给一个偏向;
  • 长期统计上,它说 90% 的地方,命中就是 ~90%——过度自信在训练目标里就是扣分项

这也解释了第 3.1 节的"0.5 = 拿不准":那是训练目标刻意保留的诚实信号,不是缺陷。

三、概率即契约(及两个前提)

校准让概率从"数字"升级为"合同":

p(紧急) = 0.9 ⇒ 长期来看,这个分支每走 10 次约 9 次走对 ⇒ 可以设计 SLA(自动化率 ≥ X%) ⇒ 可以设计预算(错误处理的期望成本 = 错误率 × 单次代价) ⇒ 可以设计兜底(0.4~0.6 区间转人工,覆盖率可预估)

但这份合同有两个前提,缺一不可:

  1. 分布内:校准是模型在训练分布及其邻近分布上的性质。你的流量如果漂移(新用户群、新攻击模式、新语言风格),校准可能失效——第 9.4 节的持续监控就是为此。
  2. 需公证:厂商宣传的校准 ≠ 你的场景里的校准。第 9 章的可靠性曲线与 ECE 是把合同条款落到自己数据上的手段——30 行代码的事,别跳过

💡 一个务实的类比:校准概率像一台标定过的秤。出厂标定(RLCD)让它可信,但你卖黄金之前,还是要用自己的砝码(回归集)再校一次。

本节要点回顾

  1. LLM 概率不可用:语气副词、logprob、自报数字都未经校准,阈值设计会失真。
  2. RLCD:把"概率诚实"练成训练目标——有把握敢说,没把握回到 0.5。
  3. 契约两前提:分布内有效;必须在自己的数据上验证(第 9 章)。

概率可信了,但 Choice/Score 的返回里还有一个容易与它混淆的字段:confidence。下一节讲清楚这两个正交的维度,以及怎么组合它们做门控。


作者与出处
原作者: 灏天文库
整理: 灏天文库整理
本站整理收录,版权归原作者/开源协议所有;欢迎通过原文链接访问源仓库。
发布者: 作者: 灏天文库 转发
评论区 (0)
U