副题:并行求值与多数投票——一条 50% 分水岭上的数学
一次判断的正确率如果是 78%,五次独立判断投票之后会变成 92%——前提是你的单次正确率过半。这条「多数投票数学」有一条锋利的分水岭:单次正确率高于 50%,票越多越准;低于 50%,票越多越错。所以「问 5 遍」不是玄学仪式,是可计算的策略——先校准,再投票。
这期的另一半:为什么把 13 个问题打包一次问,比逐个问便宜 12.2 倍、快 10 倍。
调节「单次判断正确率」和「投票人数」,看多数票正确率怎么变。点「模拟一次投票」看现场的票型——注意把 p 拖到 0.5 以下时发生什么:
多数票正确率 = P(过半数判断正确) = Σ C(N,k)·pᵏ·(1−p)ᴺ⁻ᵏ(k > N/2),二项分布精确计算。这就是 18 世纪孔多塞陪审团定理的当代版本。
把 p 拖到 48% 以下再加大 N,你会看到多数票正确率一路奔向 0——这不是模拟器坏了,这是定理在警告你:
所以「多问几遍取多数」之前的那个步骤才是关键:校准——先在已知答案的题目上测出你的(或模型的)真实正确率,过半才配投票。投票放大的是方向,不是正确;方向错了,人多势众恰恰是最坏的消息。
对人的翻译:集体讨论前,先各自独立写下判断再同时亮牌——既保住独立性(投票的数学前提),又能当场算出「我们组在这类问题上的 p 大概是多少」。顺序反过来(先讨论后表态),独立性就没了,25 张嘴只剩 3 个声音。
工程侧的另一半故事。生成模型输出是串行链条——第 N 个词依赖前 N−1 个,所以越写越贵、越写越慢;判断模型对一个请求里的 K 个问题同时求值:
| 生成(串行) | 判断(并行) | |
|---|---|---|
| 第 N 个输出依赖前 N−1 个吗 | 是 | 否——K 个问题同时算 |
| 延迟主要取决于 | 生成长度 | 上下文(state)大小 |
| 多问一个问题 | ≈ 重来一次完整调用 | 几乎不变慢,只加一点 token 费 |
直觉算术:一次调用的成本 ≈ state token × 单价(输出免费),延迟 ≈ state 处理时间。串行 13 次 = 付 13 次 state 的钱、等 13 次;打包 = 付 1 次 state + 13 段几十 token 的问题描述。同一份上下文上的所有判断,无论几道,都该合并进一个请求。
「投机性」的含义:你赌其中一部分答案将来有用——赌注极低(每问千分之一美分级),赌赢一次(少发一次请求、少等一轮)就回本。三条纪律:同一份 state 的问题才合并;问题 ID 稳定命名(它是日志与回归的主键);答案全量落盘——「没用上」的答案在校准里全是金子。
拦错和放错,各值多少钱?把两张代价表写清楚,最优阈值不是拍出来的,是解出来的。收官期讲门控三段式:低阈拦、高阈放、中间人工——附一个可调代价的门控沙盘,看 L(t) 曲线在你手里弯出最优工作点。