灏天文库 · 知识工坊 | 人生决策实验室 · 第 4 期

同一个问题问 5 遍 AI,答案不一样?这不是 bug,是方法

副题:并行求值与多数投票——一条 50% 分水岭上的数学

一句话结论

一次判断的正确率如果是 78%,五次独立判断投票之后会变成 92%——前提是你的单次正确率过半。这条「多数投票数学」有一条锋利的分水岭:单次正确率高于 50%,票越多越准;低于 50%,票越多越错。所以「问 5 遍」不是玄学仪式,是可计算的策略——先校准,再投票。

这期的另一半:为什么把 13 个问题打包一次问,比逐个问便宜 12.2 倍、快 10 倍。

01投票模拟器:亲眼看数学发生

调节「单次判断正确率」和「投票人数」,看多数票正确率怎么变。点「模拟一次投票」看现场的票型——注意把 p 拖到 0.5 以下时发生什么:

交互实验 · 多数投票模拟器二项分布 · 实时计算
单次判断正确率 p78%
独立判断次数 N(奇数)5 次
78%
单次正确率
92%
多数票正确率
+14pp
投票增益

多数票正确率 = P(过半数判断正确) = Σ C(N,k)·pᵏ·(1−p)ᴺ⁻ᵏ(k > N/2),二项分布精确计算。这就是 18 世纪孔多塞陪审团定理的当代版本。

0250% 分水岭:投票放大的是方向,不是正确

把 p 拖到 48% 以下再加大 N,你会看到多数票正确率一路奔向 0——这不是模拟器坏了,这是定理在警告你:

所以「多问几遍取多数」之前的那个步骤才是关键:校准——先在已知答案的题目上测出你的(或模型的)真实正确率,过半才配投票。投票放大的是方向,不是正确;方向错了,人多势众恰恰是最坏的消息。

金句卡 1 / 3
投票放大的是方向,不是正确——先校准,再投票。
灏天文库 · 人生决策实验室 · 第 4 期

对人的翻译:集体讨论前,先各自独立写下判断再同时亮牌——既保住独立性(投票的数学前提),又能当场算出「我们组在这类问题上的 p 大概是多少」。顺序反过来(先讨论后表态),独立性就没了,25 张嘴只剩 3 个声音。

0312.2 倍的秘密:并行求值的经济学

工程侧的另一半故事。生成模型输出是串行链条——第 N 个词依赖前 N−1 个,所以越写越贵、越写越慢;判断模型对一个请求里的 K 个问题同时求值:

生成(串行)判断(并行)
第 N 个输出依赖前 N−1 个吗是否——K 个问题同时算
延迟主要取决于生成长度上下文(state)大小
多问一个问题≈ 重来一次完整调用几乎不变慢,只加一点 token 费
12.2×
便宜倍数:13 问打包 vs 串行问 13 次(独立实测)
10×
快慢倍数:同一对照实验
state
成本大头——省的是重复传输上下文的钱

直觉算术:一次调用的成本 ≈ state token × 单价(输出免费),延迟 ≈ state 处理时间。串行 13 次 = 付 13 次 state 的钱、等 13 次;打包 = 付 1 次 state + 13 段几十 token 的问题描述。同一份上下文上的所有判断,无论几道,都该合并进一个请求。

04投机性扇出:把可能用到的判断一次问完

判断昂贵时代的惯性能少调一次是一次(懒执行);要一个「大而全综合判断」;结果即用即弃。
→
判断廉价时代的姿势把场景里所有可能用到的判断一次声明——路由要用的、排序要用的、现在没用但顺手问的;答案全量落盘,喂给下一轮校准。

「投机性」的含义:你赌其中一部分答案将来有用——赌注极低(每问千分之一美分级),赌赢一次(少发一次请求、少等一轮)就回本。三条纪律:同一份 state 的问题才合并;问题 ID 稳定命名(它是日志与回归的主键);答案全量落盘——「没用上」的答案在校准里全是金子。

金句卡 2 / 3
判断便宜到可以「浪费」——而「浪费」出来的数据,反过来让判断越来越可靠。
灏天文库 · 人生决策实验室 · 第 4 期

✓看完带走什么

  • 团队决策改流程:先独立写判断 → 同时亮牌 → 算出多数与分歧——分歧大 = 你们的 p 离 0.5 很近,值得上系统二。
  • 把重要判断「问 3 遍取多数」之前,先在 10 个已知答案的题上测正确率——不过半就别投票,先修判断。
  • 合并你的「请求」:同一背景下的几个小决定,一次想清再行动——人脑切换上下文同样昂贵。
  • 顺手多问:既然已经调集了全部背景信息,把「暂时用不上」的相关判断一起做了并记录。
  • 建立你的判断台账:每次预测记下结论与概率,季度复盘你的 p 值——这是第 5 期阈值管理的地基。
金句卡 3 / 3 · 转发卡
问五遍不是求心安——是用数学换正确率,前提是你的第一遍没有系统性跑偏。
灏天文库 · 人生决策实验室 · 第 4 期