副题:门控、期望损失与三段式——把「信多少」变成一道可解的题
「AI 说的有八成把握,我该不该听?」——这个问题本身问错了。正确的问题是一张代价表:错放(该拦没拦)值多少钱,错拦(误打扰)值多少钱?把两张账写清楚,最优阈值不是拍出来的,是解出来的:阈值是混淆代价函数的解,不是感觉。
收官期把前四期串成一条完整的决策流水线:认识预算 → 改写判断题 → 题型设计 → 投票放大 → 最后一块拼图,门控阈值。
任何门控决策都只有两种错误——错放(该拦没拦/该转人工没转)和错拦(误打扰/多走人工)。先给它们标价:
| 场景 | 错放 | 错拦 | 阈值倾向 |
|---|---|---|---|
| 命令护栏 AI 替你执行删除/提交 | 删库/泄密,不可逆(≈5 万) | 一次确认弹窗(≈0.5 元) | 极不对称 |
| 垃圾过滤 | 用户看到垃圾(≈0.1) | 正常邮件进垃圾箱(≈5) | 拦截偏高 |
| 工单路由 | 转错组再转一次(≈0.3) | 同左 | 对称:0.5 即可 |
期望损失一句话:L(t) = 错放数(t) × 错放代价 + 错拦数(t) × 错拦代价——错放数和错拦数都是阈值 t 的函数(t 越高越敢拦……不,t 越高越敢放,错放越多、错拦越少)。扫一遍 t,找 L(t) 最小的那个点,就是你的工作点。
模型给危险判断输出的概率分布在下方沙盘里(危险项集中在高分、安全项集中在低分,中间有重叠——重叠区就是全部难题所在)。调节两张代价表和阈值 t,看 L(t) 曲线弯向哪里:
沙盘用两个合成分布(安全≈Beta(2,6)、危险≈Beta(7,2),各 1000 次/千次流量)精确计算 L(t)。注意工作点不一定取 L 最小:合规常要求「错放率绝对上限」——曲线给选项,约束定取舍。
代价极不对称时(比如命令护栏:错放=删库,错拦=点一下确认),单点阈值有个致命伤——L(t) 最小值常落在「高自动化」区,但一次删库就摧毁全部节省。工程解法是把阈值拆成三段:
中间带的宽度就是你能承受的人工确认量。这个设计的精髓:机器不替你赌大的,人只在数学说不清的那一小段出场——第一期的「深思预算」,在这里找到了数学化的花法。
阈值定好不是终点——校准随输入分布漂移:用户构成变了、攻击者开始针对了、内容风格演进了。判断系统的体检节奏:
对个人的翻译:你的「直觉阈值」同样会漂移——换行业、换城市、换了朋友圈之后,旧概率不再可信,需要重新攒回归集。这就是为什么第 4 期让你建「判断台账」:它是你个人的校准数据。
第一季把判断交给了数学,第二季把镜头转回人的非理性:沉没成本、损失厌恶、最优停止(面试到第几个该停)、贝叶斯更新(体检阳性=得病吗)。上线时间以本集更新为准。