章节摘要:全书最后一章把官方的诚实声明展开成工程清单。10.1 节讲第一条边界:底座检查点 zero-shot 接近随机猜(官方口径),laya 是「微调框架」而不是「开箱模型」——直接上线等于掷硬币,本节给一份部署前的最小验证集自测清单。10.2 节讲位置偏差:选项顺序会影响概率分布,这一缺陷 laya、Jev、Kev 都有(Kev 官方还提供了 permute 实验来量化它),本节给检测方法(打乱重测、逐位置统计)与缓解手段(顺序增强、推理时对称化),以及代价核算。10.3 节讲两笔绕不开的运维账:高基数场景官方承认不如 Jev(约二十个以上选项),工程补偿是第 6.3 节的 shortlist 与 tournament,但要为正确性付费;校准不自动跟随微调——每次微调后温度必须重拟合,还要定期重校准与监控漂移。混合语言的输入要先测 Router 的脚本检测。读完本章,第 9 章的选型结论应放在这些边界条件下复读一遍。
三条边界与各自的应对(图中口径均为官方 README) ┌─────────────────────────┐ ┌─────────────────────────┐ ┌─────────────────────────┐ │ 10.1 zero-shot 近随机 │ │ 10.2 位置偏差 │ │ 10.3 高基数与校准自理 │ │ 底座直接用≈随机猜 │ │ 选项顺序影响概率 │ │ 20+ 选项不如 Jev │ │ │ │ │ │ │ │ │ │ │ ▼ │ │ ▼ │ │ ▼ │ │ 先微调(第 5 章) │ │ 检测:打乱重测 │ │ shortlist/tournament │ │ 再验证(最小验证集) │ │ 缓解:顺序增强/对称化 │ │ 微调后重拟合温度 │ │ 才上线 │ │ (代价×N 次推理) │ │ 定期重校准+漂移监控 │ └─────────────────────────┘ └─────────────────────────┘ └─────────────────────────┘
一句话金句:边界不是模型的耻辱,是部署清单的第一页。
(文字流程图)读官方诚实声明 ──▶ 逐条变成自测项 ──▶ 微调与校准补齐能力 ──▶ 带着监控上线 ──▶ 定期复读边界条件。
三节按「能不能用、准不准、养不养得起」递进:10.1 决定有没有资格上线,10.2 决定结果可不可信,10.3 决定长期成本。
┌──────────────────┐ 微调补齐能力 ┌──────────────────┐ 可信后再算账 ┌──────────────────┐ │ 10.1 近随机 │ ─────────────▶ │ 10.2 位置偏差 │ ─────────────▶ │ 10.3 高基数与校准 │ │ 上线资格 │ │ 结果可信度 │ │ 长期运维成本 │ └────────┬─────────┘ └────────┬─────────┘ └────────┬─────────┘ │ 第 5 章微调是解药 │ 检测数据回流训练 │ 每次微调后回到 7.1 ▼ ▼ ▼ 第 9 章选型结论在边界条件下复读 第 7 章校准与弃权 第 9.3 节迁移验收指标