本节摘要:把一个语义判断接进生产流量的正确姿势,是 Jev 官方与独立评测共同给出的共识路径——影子模式四步法:第一周影子记录(Jev 只记录不生效,与现行为并行跑,全量落盘);第二周对账改表(抽样比对分歧,修订 instructions/选项表);第三周灰度切流(低风险路径先自动,高风险加门控);第四周起扩量监控(按置信度阈值放大自动比例,盯校准漂移)。两条铁律贯穿全程:能确定性判断的 if 别换(
len(x) > 0换 Jev 是花钱买不稳定);永远留人工出口(低置信路径指向人,而不是硬猜)。附监控指标与回退条件清单。
阅读完本节,你应当能够:
第 1 周 影子模式:Jev 只记录不生效,与现行为并行跑,落盘全部答案 │ 产出:完整日志(state摘要 / questions / 答案 / 概率 / confidence / 最终分支) ▼ 第 2 周 对账:抽样比对 Jev 与人类/现有系统的分歧,改 instructions/选项表 │ 产出:分歧清单 + schema 修订 + 首版回归集(第 9.1 节) ▼ 第 3 周 灰度:低风险路径(排序、打标)先切自动,高风险路径加门控 │ 产出:分路径的自动化率/错误率基线 ▼ 第 4 周 扩量:按 confidence 阈值逐步放大自动比例,监控校准漂移 产出:稳态运行 + 周度校准体检(第 9.4 节)
第 1 步 · 影子:Jev 的答案与现行为(人工或旧系统)的结果同时落盘、互不影响。这一步零风险、全收益——日志是此后一切(对账、回归集、阈值调优)的原料。落盘字段至少:请求摘要、问题 ID、choice/noul/score、probabilities、confidence、现行为结果、时间戳。
第 2 步 · 对账:抽样看分歧(Jev 说的和现行为做的不同),三类归因:
| 分歧样子 | 归因 | 动作 |
|---|---|---|
| 两类选项间系统性互混 | schema 判别性不足 | 补排他描述(第 6.1 节三查) |
| 大量落入 other | 覆盖不足 | 细分选项表 |
| Jev 对、现行为错(抽样确认) | 旧系统有偏差 | 这是收获——记录为案例 |
| 零散、无模式 | 边界样本 | 进回归集作为 hard case |
第 3 步 · 灰度:按错误代价从低到高切流——先自动打标/排序(错了几乎无感),再自动路由(错了可恢复),最后才是护栏类放行决策(错了不可逆,配三段式阈值 + 人工确认带)。
第 4 步 · 扩量:用第 9.3 节的"阈值 × 自动化比例 × 错误率"曲线选工作点,逐步收紧/放宽;每周用新采样重复校准体检(第 9.4 节),漂移超线即回影子模式。
if len(cart) > 0、if user.role == "admin"、正则能精确匹配的——保持原样。Jev 只接管语义判断;拿它替换确定性分支是花钱买不稳定(还占限速额度)。| 指标 | 健康信号 | 回退触发 |
|---|---|---|
| 自动化率 | 稳定在预期区间(如 70~85%) | 骤降(分布漂移 → 回影子) |
| 转人工率 | 与 confidence 阈值预期一致 | 持续超预期 2 倍 |
| 抽检错误率 | 低于回归集基线 | 超基线 → 冻结扩量,查漂移 |
| ECE(周度,第 9.4 节) | < 0.05~0.10 | > 0.15 → 回影子模式重校准 |
| P95 延迟 | 数百 ms 内 | 秒级 → 查 state 是否膨胀/网络 |
| 429/529 频率 | 偶发、退避可吸收 | 持续 → 申请提额或降并发 |
💡 回退不是失败:影子模式的全部意义就是让"回退"成为一个便宜且常态化的动作——新版本 schema 上线也走同一条四步路(这时第一周的影子数据已经躺在日志里了)。
Jev 判断的"代码"由三部分组成,变更策略各不同:
| 变更 | 影响 | 纪律 |
|---|---|---|
| 权重/阈值(代码) | 立即生效、可回滚 | 走正常代码发布流程 |
| instructions/criteria | 等于换模型 | 必须重跑回归集(第 9.1 节)再走影子 |
model 版本 |
模型行为变化 | 钉版本(第 8.3 节),升级走完整四步法 |
流量切进来了,接下来算账与保稳:一次调用多少钱、一个月多少钱、超时了怎么办、版本怎么钉——运行面三件套在下一节。