10.2 核心批评:约束形状,不约束判断


10.2 核心批评:约束形状,不约束判断

本节摘要:围绕 Jev 最重要的批评,来自软件工程师 Anthony Maio 的分析(被 pearpages、tensorplay、chatmaxima、aisignal 等多方引用):"Jev 约束的是输出的形状,它不约束判断本身。" 展开说:0% 幻觉/0% 类型错误是结构保证——答案空间被你的请求枚举死,模型不可能产出 billing 之外的字符串;但选错选项、给错概率,结构管不着。Sean Goedecke 更尖锐,称"零幻觉"的说法是"语义上的闪避(a semantic dodge)"。一个设计糟糕的 schema(选项重叠、描述含糊、缺逃生门)不仅不会因类型安全而变好,反而可能比自由生成更糟——错误被包装成一个看起来自信的合法答案。TypeSafe 创始人 Almeida 对此的回应是承认:结构保证 ≠ 正确性保证,正确性要在自己数据上评测。本教程的立场:这个批评不是"别用 Jev",而是"schema 设计成为一等编程技能"——并给出三条落地回应。

学习目标

阅读完本节,你应当能够:

  1. 准确复述批评并解释"形状 vs 判断"的区分。
  2. 说出"为什么坏 schema 可能比自由生成更糟"的机制。
  3. 用第 3/9 章的工具回应这条批评。

一、批评原文与语境

"Jev 约束的是输出的形状。它不约束判断。"
"Jev constrains the shape of the output. It does not constrain the judgment." —— Anthony Maio

"(零幻觉的)说法是一种语义上的闪避。" "a semantic dodge" —— Sean Goedecke(pearpages)

两句话合起来的完整逻辑:

保证 不保证
结构层(数学保证) 答案必在枚举空间内;永不解析失败;永不产出未见过的"选项"
判断层(经验问题) 选对选项;概率分布合理;置信度如实

官方基准里"0% 幻觉"指的是左列——由构造成立,不需要实验证明;而用户期待的往往是右列——选得对不对。宣传语与期待之间的这道缝,就是批评者说的"闪避"。

二、为什么坏 schema 可能比自由生成更糟

机制有三:

  1. 错误穿上了合法的外衣。LLM 答错时输出一段离谱的话,人一眼起疑;Jev 答错时输出 {"choice": "billing", "probabilities": {"billing": 0.86}, "confidence": 0.7}——格式完美、概率自信,下游代码毫无防备地执行
  2. 逃生门缺失放大误判。没有 other 的选项表,强迫每个模糊输入都"自信地"站队(第 3.2 节准则二)——错误率被 schema 亲手抬高。
  3. 耦合更深的自动化。"类型安全"给人虚假的信心,让使用者敢于把判断接到更关键的路径上(自动执行、自动放行),错误的第一现场从"人读到的怪话"变成"系统做错的动作"。

⚠️ 一句必须记住的话:它不能幻觉出新选项,但它可以自信地选错

三、三条落地回应

批评的正面价值是把责任交还给工程。本教程贯穿的三件工具就是回应:

  1. schema 即模型(第 3 章全部准则 + 第 6.1 节三查):选项表的具体性、覆盖性(other 占比监控)、判别性(双高格排查);instructions 写判别标准——判断质量的上限由你写的 schema 决定,这不是运维细节,是核心设计。
  2. 回归集即测试(第 9.1 节):改一句 instructions 就重跑——"约束判断"的正确姿势不是找一个保证判断的模型,而是用数据闭环约束判断的演化
  3. 校准验证即公证(第 9.2 节):概率能不能当合同,ECE 说了算——你的分布、你的标注、你的数字。

TypeSafe 创始人 Almeida 的公开回应也落在同一方向:承认结构保证与正确性保证的区分,正确性需使用方评测。(延伸的开放问题:评测基准均为厂商自报、独立第三方复现尚少——TrueFoundry 等的分析指出"什么可验证、基准没覆盖什么"仍是进行时。)

四、给决策者的一段话

如果你在评估"要不要在生产里用 Jev",这条批评翻译成三个检查动作:

  1. 我的schema经得起三查吗?(选项描述给一个新同事看,他能独立做出和我预期一致的选择吗?)
  2. 我的回归集在吗?改动的 gating 流程在吗?
  3. 我的代价分析做了吗?(判断错了最坏损失多少、人工出口在哪。)

三问皆有答案——用;一问含糊——先补作业再用。这与第 8.2 节影子模式、第 9 章评测体系完全同构:工具的新颖不改变工程的纪律。

本节要点回顾

  1. 批评:结构保证形状(数学的),不保证判断(经验的);"零幻觉"若被读作"不会错"即是闪避。
  2. 机制:错误穿合法外衣、逃生门缺失放大误判、虚假信心加深自动化耦合。
  3. 回应:schema 即模型、回归集即测试、校准验证即公证——约束判断靠数据闭环,不靠承诺。

批评消化完,最后一节收拢全书:四种方案怎么选、Jev 放在哪一层、以及资源地图。


作者与出处
原作者: 灏天文库
整理: 灏天文库整理
本站整理收录,版权归原作者/开源协议所有;欢迎通过原文链接访问源仓库。
发布者: 作者: 灏天文库 转发
评论区 (0)
U