8 道题覆盖概念、找错、实践、校准与设计,难度递进;先自己做,再看折叠提示。带 ★ 的为动手题。
第 1 题 把下面四个判断各归到 Noul / Choice / Score / 不适合 Jev:
(a) Noul——一道闸;(b) Choice——归堆;(c) Score——有序落位;(d) 生成题(答案空间开放)——LLM 的活(第 2.2 节)。
第 2 题 用一句话解释:为什么说 Jev "0% 幻觉",又说它"可以自信地选错"?这两句话矛盾吗?
不矛盾——前者是结构保证(答案必在枚举空间内,数学上成立);后者是判断质量(选错选项结构管不着)。区分见第 2.1 与 10.2 节。
第 3 题 下面的 Choice 定义有 三个 设计错误,找出来:
{ "type": "choice", "instructions": "分类该用户反馈", "criteria": { "good": "好的反馈", "bad": "坏的反馈", "mixed": "好坏参半" } }
① 选项描述是程度词不是具体情形(阅卷细则缺失);② 没有 other 逃生门(模糊输入会被硬塞);③ instructions 只写了任务没写判别标准("以什么为准"缺失)。参照第 3.2 节四准则与第 6.1 节三查。
第 4 题 这段上线路径缺了什么关键步骤?
"写好 questions → 用 20 条自己编的样例试了试,感觉不错 → 全量切到自动路由。"
缺了几乎整个第 8.2 节:没用真实流量(影子日志);没做对账与回归集(20 条自编样本 ≠ 真实分布);没灰度;没定门控阈值与人工出口;没配监控与回退条件。另外"感觉不错"不是指标——混淆矩阵和 ECE 才是。
第 5 题 ★ 参照 6.2 节内嵌脚本,为你的领域写一个路由器:选出 3~5 个下游路径,写出选项表;然后回答——你的 confidence 阈值取多少?错发到哪个路径的代价最高,阈值怎么体现这种不对称?
先填第 9.3 节的代价表再定阈值;"错发不可恢复路径"(对外发送类)设高阈值 + 抽检;组间互转低代价的 0.5 即可。
第 6 题 ★ 为"用户注册邮箱验证"写一组 3 个 Noul 闸门(格式合法 / 疑似一次性邮箱 / 疑似钓鱼域名),放进同一个请求。然后指出:其中哪一道其实更适合用代码(正则/DNS 查询)替代?
格式合法是机器可计算的(正则),不该用 Jev(第 1.3、10.1 节);一次性邮箱域名可用已知列表 + Jev 兜底判新域名;钓鱼域名是语义判断,适合 Jev。
第 7 题 ★ 把 9.2 节脚本在你自己标注的 50 条数据上跑一遍(没有 Key 就先用 MOCK 理解算法)。如果 0.9 桶的实际命中率只有 0.7,你的阈值策略该怎么改?
该分布上模型过度自信(ECE 偏大):阈值整体上调一档(把 0.9 当 0.8 用)、或收紧 instructions 措辞后重测;同时检查 0.9 桶样本有没有共同特征(短文本?外语?)——第 9.2 节"从体检到处方"表。
第 8 题 一个编码 Agent 要自动执行 shell 命令。画出"规则层 → Jev 层 → 人工层"三层防线:每层拦截什么、Jev 层设哪几道闸门、拦/放阈值为什么不一致?再回答:既然 Jev 对对抗性文本不可靠,为什么这套防线仍然成立?
规则层:白/黑名单模式硬判(零成本挡大头);Jev 层:破坏性/外传/涉密三道 Noul(一次请求),低阈拦(0.3)+ 高阈自动放(危险 p>0.9)+ 中间人工——错放不可逆、错拦只是打扰,代价不对称所以阈值不对称。防线成立的原因:Jev 层前面有规则层挡掉模式化危险、后面有人审兜底右尾方差,它只需要扛"规则判不了的语义面",且影子模式先行校准过真实流量(第 7.3、10.1 节)。