7.1 优化闭环:缓存、路由与模型分级


7.1 优化闭环:缓存、路由与模型分级

本节摘要:第 3.3 节立过预算三线,但省钱不能靠砍预算,要靠一个持续转动的闭环:账本 → 归因 → 动作 → 验证 → 固化,以周为节奏。本节先立闭环五步与它的纪律(没有验证的优化只是折腾;质量护栏不达标就回滚),再展开三大杠杆:缓存——前缀稳定化让命中率从"碰运气"变成"设计值"(第 3.1 节:缓存读约为输入价 1/10,官方口径,这是最大的单项杠杆);路由与模型分级——用轻量分类把简单请求送去小模型;输出治理——max_tokens 收紧与输出模板化直击最贵的账二。然后是一个带前后数字的完整案例(示意):客服问答功能月成本从 4,800 美元降到 2,850 美元,降四成,而探针合格率与点踩率持平略升——每个动作的节省额与质量护栏一并给出。缓存与路由的工程纵深见本站《请求缓存与智能路由降低 token 成本》文集,本节管的是"把它们纳入账本驱动的闭环"。

学习目标

  • 说出闭环五步、周节奏与两条纪律(验证与质量护栏)
  • 会用三大杠杆并知道各自的见效量级与陷阱
  • 读懂带前后数字的闭环案例,指出主要节省来自哪个杠杆
  • 会写一份优化决议:动作、预期节省、质量护栏、回滚条件

一、闭环五步与周节奏

(文字流程图,以周为节奏) 账本 ──▶ 归因 ──▶ 动作 ──▶ 验证 ──▶ 固化 ──▶ 下一轮(回到账本) (3.1/3.2) 三本账哪本涨 三大杠杆 前后对比 写进 runbook 哪个维度涨 +质量护栏 与默认配置 ​

五步里最容易跳过的是验证与固化。验证 = 每个动作上线后用同一套视图(成本日结、探针合格率、点踩率)对比前后至少一周(第 1.2 节第 12 问"新旧版本的质量与成本对比");固化 = 验证通过的动作写进默认配置与 runbook,防止下一次重构悄悄改回去。没有验证的优化只是折腾,没有固化的优化只是一次性运气。

质量护栏是闭环的另一半:每个成本动作必须同时盯两个质量指标(点踩率、探针合格率),任一恶化超过带宽(如相对恶化 10%,示意)即回滚——第 3.3 节那句"成本与质量是一根绳上的两个结"在这里变成硬规则。

二、三大杠杆

杠杆一:缓存。 第 3.1 节的账三:缓存读单价约为输入的 1/10(官方,Anthropic 口径量级),命中率每上一个台阶,账一就等比往下掉。工程要点不是"开缓存",而是前缀稳定化:系统提示词与知识库前缀放在最前且内容不变,把时间戳、用户名、实验参数这类易变内容挪到 prompt 尾部——前缀一变,整段缓存全 miss(第 3.1 节"缓存失效"来源)。陷阱:命中率的分母要按"写入后实际读到的比例"算(第 3.1 节口径),只看"开启率"会自欺。

杠杆二:路由与模型分级。 不是所有请求都配用旗舰模型:简单查询、格式转换、常规问答走轻量模型(单价约为旗舰的 1/5,示意),复杂推理才升级。判据用轻量分类器或规则(意图标签本来就有,第 4.2 节主题分类可复用),关键设计是分级判据本身要被观测:路由错误率(该升级没升级带来的质量分下跌)进面板。陷阱:分级省的是账一账二,若分类器自身要调一次大模型,省的又被吃回去——判据保持便宜。

杠杆三:输出治理。 账二单价通常是输入的 3~5 倍(示意),而"过程冗长的输出"是最常见的浪费:max_tokens 形同虚设、让模型"详细解释"导致过程性文字占大头。动作:收紧 max_tokens、输出模板化(结构化字段代替自由发挥)、对"仅需要结论"的场景去掉思维链展示。陷阱:一刀切压长度会伤完整性——护栏就是干这个的(第 4.2 节超短占比信号会先亮)。

杠杆 主要压哪本账 见效量级(示意案例) 护栏重点
缓存前缀稳定化 账一 命中率 22%→71% 命中率与答案一致性
路由与模型分级 账一账二同降 62% 流量走小模型 探针合格率(分级错杀)
输出治理 账二 输出均值降约四成 超短占比、完整性维度分

三、闭环案例:一个月降四成(示意)

背景:客服问答功能,月调用 120 万次,月成本 4,800 美元,探针合格率 91%,点踩率 2.1%。

第一步(归因):成本结构周报(第 3.2 节模板)显示账二占 61%(输出均值 620 token,远超必要);缓存命中率仅 22%(系统提示词里嵌了变动时间戳);TopN 会话另有零星循环(已由熔断兜住,非主要矛盾)。

第二步(动作与验证,每周一个):

周 动作 质量护栏观察 结果(示意)
第 1~2 周 意图分类路由:62% 简单查询转小模型(单价约 1/5) 合格率 91%→91%,分级错杀率 1.8%(可接受) 月化成本 4,800→3,720 美元
第 3 周 前缀稳定化:时间戳等易变内容移出前缀 命中率 22%→71%,答案一致性抽检通过 月化成本 3,720→3,180 美元
第 4 周 输出治理:max_tokens 4096→1200、结论模板化 输出均值 620→370 token,超短占比 0.4%(未越带) 月化成本 3,180→2,850 美元

第三步(固化):路由判据版本化进配置中心;前缀规范写进 prompt 模板库;max_tokens 与模板成为该功能默认值——三项都进 runbook,并加了两条守卫告警(命中率跌破 50%、输出均值回升)。

结局对照:月成本 4,800→2,850 美元(-41%),每成功会话成本 0.052→0.031 美元(第 3.2 节单位经济),探针合格率 92%、点踩率 1.9%(均持平略升),P95 延迟 4.1s→2.9s(小模型更快是意外红利)。降四成,质量不降反略升——因为归因发现的两项浪费(冗长输出、缓存 miss)本来就不创造价值。

⚠️ 别把案例数字当承诺:三项杠杆的见效取决于你的流量结构(简单请求占比、多轮会话占比、输出冗长度)。闭环的意义是用你自己的账本找到你的那三成,而不是抄别人的动作清单。

四、优化决议模板

每个动作开工前写一页(半页也行),四栏:

优化决议(示意模板) 动作:把 X 类请求路由到 <模型>;预期节省:账一账二月降约 N 美元(依据:账本第 X 周数据) 质量护栏:探针合格率跌幅 ≤2 个百分点、点踩率涨幅 ≤0.5 个百分点(示意带宽) 回滚条件:护栏任一越线,或分级错杀率 >3%;验证窗口:上线后 7 天 ​

这份模板的妙处在于它逼你把"预期"写下来——一周后账本会告诉你预测准不准,预测能力本身也是闭环在训练的肌肉。

五、闭环跑在什么节奏上

优化闭环不是"有空时优化一下",是固定节奏的例会机制(第 1.2 节第 20 问"周期性复盘"的落地形态):

节奏 会议 议程固定三件 输出
每周 成本质量例会(30 分钟) 上周决议回顾、本周账本异动 TopN、下一个优化动作 一页优化决议
每月 复盘会 三支柱月报、对账差异、告警命中率盘点 行动项带责任人与验收
每季 复评 第 1.2 节 21 问重答、预算与容量重新核定 成熟度变化与下季目标

两个纪律让机制不空转:例会看数字不看故事——所有陈述必须能指到账本或探针的视图上;上一次的行动项开场先查——没完成的当场重新排期或明确放弃,不允许"下次再说"。第 1.2 节第 21 问问的"清单是否约定复评周期与责任人",答案就是这张表的最后一行。

本节要点回顾

  • 闭环五步:账本→归因→动作→验证→固化,周节奏;没有验证的优化只是折腾,没有固化的优化只是运气。
  • 三大杠杆:缓存(前缀稳定化)、路由与模型分级(判据要便宜且被观测)、输出治理(直击最贵的账二);每个都配质量护栏与回滚条件。
  • 案例(示意):4,800→2,850 美元/月(-41%),质量持平略升——浪费本来就不创造价值。
  • 优化决议四栏:动作与预期、护栏带宽、回滚条件、验证窗口。
  • 治理节奏:周例会、月复盘、季复评(21 问重答);看数字不看故事,行动项开场先查。

闭环把成本压到了该在的位置,但它管不了"明天运营搞个大促、流量翻十倍"——那是容量与限速的领地。第 7.2 节从日调用量推到峰值 token/分钟与并发,用三层令牌桶和降级链保证峰值来了不翻车。


作者与出处
原作者: 灏天文库
整理: 灏天文库整理
本站整理收录,版权归原作者/开源协议所有;欢迎通过原文链接访问源仓库。
发布者: 作者: 灏天文库 转发
评论区 (0)
U