本节摘要:本书全部方法的收口处:一页选型报告。它是选型决定的载体——可签字、可复核、可追责,半年后回看还知道当时为什么这么定。模板七个区块:决定与生效条件(选了谁、备选谁、什么条件下生效与退出);背景与需求矩阵摘要(业务诉求、硬约束、权重表——7.1 的产物);候选与证据链(每个结论旁边站着来源与日期,核对表档位与距离分在此引用);盲测证据摘要(题集口径、总均分带区间、分项、竞技场排序——第 6 章的产物);成本延迟质量数据(7.2 的三角表,每个数带测量日期);风险与预案(含 5.1 的治理三件事与切换预案);复核节奏(引出第 9 章)。写法纪律四条:证据必须带来源与日期、分数必须带区间、失败案例必须写、未验证的必须标注。附一份示意填写样例(模型用代号,不涉及真实名次)与十五分钟评审会流程。与 3.3 的关系:那边的十问清单审别人的报告,这边确保自己的报告经得起同样的审。
阅读完本节,你应当能够:
三个理由:可签字——决定、条件、风险在一页上,签字人看得完;可复核——每个数字带来源,接手的人查得到;可追责——半年后模型出事,翻出报告能定位"当时基于什么证据、谁拍板"。反例是五十页评测汇总:什么都写了,等于什么都没决定。一页纸的强制力恰恰来自篇幅——写不进一页的结论,说明还没想清楚。
── 选型报告 · [业务场景] · [日期] · [作者/评审人] ────────────────── ① 决定与生效条件 选定:[模型代号/版本](接入口径:API 端点与版本号,5.2 留档) 备选:[第二名](启用条件:[价格/合规/质量触发线]) 生效条件:[灰度方案、并行窗口、回滚路径] ② 背景与需求矩阵摘要 业务诉求一句话;硬约束 [合规/语言/部署];加权维度与权重(和=10) → 漏斗轨迹:候选 [N] 个 → 硬约束存活 [n] 个 → 盲测复核 [m] 个 ③ 候选与证据链 信息源清单(名称 + 可信度档位[4.3 核对表] + 距离分[4.2] + 访问日期) ④ 盲测证据摘要 题集口径:[N] 题 / [维度构成] / 判分 0/1/2 / 日期 结果:[模型A] 均分 [x]/2(CI [lo, hi]);分项:… 竞技场(如适用):排序 + 对战矩阵 ⑤ 成本延迟质量数据 [模型]:质量 [盲测分±CI] | 成本 [x 元/千任务,测量日期] | 延迟 [P95 x ms,样本 n 次] Pareto 结论:[前沿成员;出局者及支配者] ⑥ 风险与预案 治理三件事落位:变更通知条款[有/无] | 快照口径[口径] | 退出条款[路径] 已知短板:[失败案例 1~2 条,来自盲测];预案:[降级/转人工/回退] ⑦ 复核节奏 锚点漂移监测 [月度,5.2];全量再评测 [季度/事件触发,第 9 章]; 下次复核日期:[日期] ──────────────────────────────────────────────────────
90 分(6.1 盲测,2026-09-18,题集 v1)是合格写法,裸的 90 分 不合格;💡 自检办法:拿 3.3 的十问清单审自己的报告。你用本书方法写出的报告,应该能扛住本书给别人的那套审问——这是全书方法闭环的方式。
── 选型报告 · 电商客服一级应答 · 2026-09-22 · 作者:评审=1:3 ───────── ① 决定:选定 fam-x-7b(端点/版本号见附件 baseline.json,5.2 留档) 备选 fam-y-8b(启用条件:fam-x 连续两月锚点分跌 >5pt 且未获解释) 生效:双模型并行两周 → 按 10% 流量灰度 → 全量;回滚路径见 ⑥ ② 矩阵:硬约束=数据不出境+中文达标;权重=盲测 3/稳定 2/生态 2/价格 2/风险 1 漏斗:8 → 4 → 2 ④ 盲测:50 题(退款/物流/安抚/格式/边界 各10),判分 0/1/2,2026-09-18 fam-x-7b 均分 1.80/2;fam-y-8b 0.80/2(差 +1.00,CI [+0.74,+1.24]) 分项:fam-y 安抚与格式 0 分——偏科明确,若启用备选需补 prompt 约束 ⑤ 三角:fam-x 质量 90±6 | 成本 12 元/千任务(9-20 测) | P95 2400ms(n=120) 前沿:cloud-a/fam-x/fam-x-mini/local-3b;fam-y-8b 被 fam-x-mini 支配出局 ⑥ 风险:治理三件事已入合同草案;短板:fam-x 奇数轮次回答偏简(盲测分项 1.5) 预案:格式维度加输出模板约束;安抚场景保留人工兜底 ⑦ 复核:月度锚点(15 题,5.2);季度全量;下次 2026-10-22 ──────────────────────────────────────────────────────
(示意填写:模型为代号,数字沿用 6.1/7.1/7.2 脚本的真实输出,场景为教学构造)
议程固定四段:证据质疑(7 分钟)——只允许问"这个数字哪来的",不允许问"你觉得准不准";风险过堂(4 分钟)——⑥ 区块逐条读,任何一条没有预案就退回;决定与条件(3 分钟)——签字人确认①与⑦;记录(1 分钟)——反对意见原样记入附录,不改结论。反对意见入档是报告"可追责"的最后一块:三个月后复盘时,当时的分歧本身就是证据。
报告签完,选型就结束了吗?恰恰相反——模型是租来的基础设施,租约条款会变(第 5 章),你的业务也会变。第 8 章先处理场景延伸(Agent 任务的评测口径不同),第 9 章把"决定之后"的持续跟踪自动化。