Jev 决策编程 · 第 7 章 排名、验证、护栏


Jev 决策编程 · 第 7 章 排名、验证、护栏

章节摘要:应用篇的下半场,三大进阶模式。排名(7.1):Jev 没有原生 rank 类型,标准做法是逐项打分再排序——对每个候选用同一套逐字一致的 Score/Noul 问"满足标准的程度",然后代码排序;每次评估必须独立请求(state 不同)、instructions 必须逐字相同(否则不可比),而校准概率带来的稳定刻度正是 Jev 排序对"LLM 打个分吧"式排序的核心优势。验证(7.2):检查 LLM 自己的输出是否满足约束——忠实性、完整性、无捏造三道 Noul 闸门一次问完,任一不过即触发重生成或降级;验证标准由你写死在代码里,与生成方利益分离。护栏(7.3):Agent 工具调用前的风险拦截,多道独立 Noul 闸门(破坏性/外传/涉密),阈值不对称(拦 0.3 就拦、放要 0.9),先影子后启用;本节内嵌完整的命令护栏脚本。三个模式共同回应第 2.3 节的架构:Jev 管门,LLM 管活。

学习目标

阅读完本章,你应当能够:

  1. 实现逐项打分式排名,并保证各次评估可比。
  2. 为 LLM 输出设计一组验证闸门并接入重生成循环。
  3. 实现多层命令护栏(内嵌脚本),解释拦/放阈值为什么不对称。
  4. 说出护栏的诚实边界:对抗性文本不可靠,护栏必须多层。

核心概念速览

一句话金句:让生成的东西过你自己写的闸门——验证标准写在代码里,而不是 prompt 里。

子章节导航

7.1 排名:同一把尺子量所有候选

逐项打分再排序;三次评估纪律;为什么 LLM 的分数没有稳定刻度而 Jev 的有。

7.2 验证:给 LLM 输出装质检

三道经典闸门;重生成循环;验证者与生成者利益分离。

7.3 护栏:Agent 的手前之门

命令护栏完整代码(04_guardrail_shell_command.py);不对称阈值;影子先行;多层防线。

子章节之间的逻辑关系

7.1 排名(一把尺子量 N 个候选 —— state 每次变) │ ▼ 7.2 验证(N 道闸门量 1 个输出 —— 第 2.3 节架构的输出侧) │ ▼ 7.3 护栏(N 道闸门量 1 个动作 —— 同一架构的工具侧;风险最高,阈值最讲究)

前置知识与后续延伸

前置知识:第 5 章(扇出、门控)、第 6 章(评分模式是排名的一半)。

为后续奠定基础:7.2/7.3 的闸门组是第 8.2 节影子模式的典型对象;7.3 的阈值不对称是第 9.3 节代价分析的最好例题。


作者与出处
原作者: 灏天文库
整理: 灏天文库整理
本站整理收录,版权归原作者/开源协议所有;欢迎通过原文链接访问源仓库。
发布者: 作者: 灏天文库 转发
评论区 (0)
U