章节摘要:本章回答三个"凭什么":凭什么多问反而便宜——Jev 对一个请求里的所有问题并行求值,延迟主要由 state 大小决定,独立实测 13 个问题一次问完比串行问 13 次便宜约 12 倍、快约 10 倍,由此诞生"投机性扇出"的工程姿势;概率凭什么能当工程契约——RLCD(面向校准决策的强化学习)把"认识论上诚实的概率"作为训练目标,使"Jev 说 0.9"约等于"长期 90% 命中",这与 RLHF/RLVR 的对照、以及"校准要在自己数据上验证"的纪律(第 9 章)构成一体;confidence 凭什么和 probabilities 是两回事——分布回答"选项间怎么分",置信度回答"这道题我做得有多有底气",两者组合出门控阈值的通用基线。理解本章,Jev 从"一个 API"变成"一个可推理其行为的组件"。
阅读完本章,你应当能够:
一句话金句:概率未经校准时只是数字,经过校准时才是合同。
串行生成 vs 并行求值的本质差异;13 问实测数据;"反正都问了,答案留着总有用"。
RLCD/RLHF/RLVR 对照表;校准的实操含义;以及"别只信宣传页,第 9 章自己量"。
probabilities 与 confidence 的正交性;三个经典组合读法;门控阈值基线。
5.1 并行求值(快与便宜的来源) │ ▼ 5.2 RLCD 校准(概率可信的来源) │ ▼ 5.3 分布与置信度(怎么读答案、怎么设阈值) │ ▼ 第 6~7 章:六大应用模式全部建立在这三块机制上
前置知识:第 3~4 章(类型与调用)。
为后续奠定基础:5.1 的扇出是第 67 章所有多问题模式的组织方式;5.3 的门控基线在第 7.3(护栏阈值)、第 89 章(上线与调参)反复使用。