作为降本原语的模型路由


文档摘要

作为降本原语的模型路由 本节摘要:一个动态中介评估每个请求(任务类型、token 长度、embedding 相似度、置信度),把简单查询发给便宜模型,把复杂的升级到前沿模型——也称模型级联(model cascading)。生产案例显示,在美/英/欧部署上同等质量下成本降低 20%60%;一个高量 SaaS 上 30% 的路由效率提升就变成六位数年度节省。2026 年的背景是 LLM 推理价格每年降约 10 倍——一个 GPT-4 级 token 从 2022 年末的 20 美元/百万降到 2026 年的约 0.40 美元/百万,其中大部分降幅来自更好的服务栈(第 0409 节),而非硬件。路由,是你把那价格降幅转成毛利而不让产品退化的手段。

作为降本原语的模型路由

本节摘要:一个动态中介评估每个请求(任务类型、token 长度、embedding 相似度、置信度),把简单查询发给便宜模型,把复杂的升级到前沿模型——也称模型级联(model cascading)。生产案例显示,在美/英/欧部署上同等质量下成本降低 20%60%;一个高量 SaaS 上 30% 的路由效率提升就变成六位数年度节省。2026 年的背景是 LLM 推理价格每年降约 10 倍——一个 GPT-4 级 token 从 2022 年末的 20 美元/百万降到 2026 年的约 0.40 美元/百万,其中大部分降幅来自更好的服务栈(第 0409 节),而非硬件。路由,是你把那价格降幅转成毛利而不让产品退化的手段。失败模式是廉价模型漂移:路由把 40% 推给弱模型,推理任务质量掉 3~5%,一个季度没人注意。用在线质量指标给路由设门,而非只靠离线评测集

对应原课程:Phase 17 · Lesson 16 · 16-model-routing(原英文 phases/17-infrastructure-and-production/16-model-routing/docs/en.md)。

学习目标

阅读完本节,你应当能够:

  1. 解释模型级联:廉价优先 + 置信度检查,低置信度升级。
  2. 列出四个路由信号(任务分类、提示长度、与已知难集的 embedding 相似度、首遍自置信)。
  3. 在目标路由分流与质量损失容忍度下,算出预期混合成本。
  4. 说出能抓住廉价模型 creep 的漂移监控指标(在线质量门)。

一、问题与直觉

你的服务在 GPT-5 上月花 8 万美元。分析显示 70% 查询很简单:「巴黎几点了?」「把这句改写一下」。一个 Haiku 级模型用 3% 的成本就能完美处理。30% 需要 GPT-5 的推理——编码、数学、多步规划。

如果你把 70% 路由到便宜、30% 到昂贵,账单在同等产品质量下降约 65%。这就是路由。诀窍是建中介而不退化质量。

二、核心概念

四个路由信号

  1. 任务分类:简单/复杂/代码生成/数学/聊天。可以是规则分类器、小 LLM(Haiku 级,0.25 美元/百万)、或对标注桶的 embedding 相似度。输出:route = 便宜 / 平衡 / 前沿。

  2. 提示长度:>4K token 提示常需前沿保连贯;<500 token 通常不用。

  3. 与已知难集的 embedding 相似度:若查询与已知难桶接近(余弦 >0.88),直接升级到前沿。

  4. 首遍自置信:发给便宜;若模型 log-prob 显示低置信、或拒绝、或输出含糊措辞,在前沿上重试。给约 10% 流量加 P95 延迟,但为另 90% 省 50%+。

三种模式

预路由(前置分类器):加约 5~10 ms 延迟;总体最快。

级联(廉价优先,低置信升级):中位延迟约 1.2×(廉价跑 + 验证),升级的约 2×。质量底线最好。

集成路由(并行跑廉价与前沿,采样,奖励模型挑):质量最高、成本最高;仅用于关键 A/B。

实现

AI 网关(第 19 节)暴露路由。LiteLLM 有带回落与成本路由的 router 配置;Portkey 有护栏 + 路由;Kong AI 网关有基于插件的路由;OpenRouter 的模型卖场暴露推荐 API。

开源:RouteLLM(LMSYS)、Not Diamond(商业)、Prompt Mule。

2026 价格曲线

模型级别 2022 年末 2026 变化
GPT-4 级质量 约 20 美元/百万 约 0.40 美元/百万 便宜 50 倍
前沿(GPT-5、Claude 4) 约 3~10 美元/百万 新档

多数改善来自服务效率——第 04~09 节的核心课程转成了厂商侧成本下降。路由让你在应用层捕获这些收益,而不必等所有用户迁到便宜档。

漂移才是真风险

你的路由把 40% 推给便宜模型。半年里任务分布漂移(用户更老练,问更长的问题)。路由器没察觉,因为它的分类器训练在 Q1 数据上。质量默默掉。没人抱怨得够大声。你在输给的竞品基准里才发现。

用在线质量指标给路由设门:

  • 每条路由的用户点赞 / 踩。
  • 在留出样本(5%)上每条路由的自动化 LLM 裁判。
  • 升级率:若级联上路由 >30%,便宜模型被过度路由了。
  • 每条路由的拒绝率。

你该记住的数字

  • 2026 路由节省(同等质量):案例 20%~60%。
  • LLM 价格降幅 2022-2026:聚合每年约 10 倍。
  • GPT-4 级 2022 vs 2026:约 20 美元/百万 → 约 0.40 美元/百万。
  • 级联延迟影响:中位约 1.2×,升级的约 2×(约 10% 流量)。

三、从零实现:级联路由模拟器

原课程 code/main.py 在混合工作负载上模拟预路由、级联、集成,报告混合成本、质量损失、升级率。下面给最小可读的混合成本骨架。

def blended_cost(traffic_split, cheap_per_m, frontier_per_m, escalation_rate=0.0, verify_overhead=1.2): """估算级联路由的混合 $/M token。 traffic_split: dict {'cheap': 比例, 'frontier': 比例}(预路由模式) 或 {'cheap_first': 比例}(级联模式,escalation_rate 决定升级) """ if "cheap_first" in traffic_split: base = traffic_split["cheap_first"] escalated = base * escalation_rate cheap = base - escalated # 升级的付便宜跑(× 开销) + 前沿跑 cost = (cheap * cheap_per_m + escalated * (cheap_per_m * verify_overhead + frontier_per_m)) else: cost = (traffic_split.get("cheap", 0) * cheap_per_m + traffic_split.get("frontier", 0) * frontier_per_m) return round(cost, 3) # 案例:70% 简单(便宜 0.25 美元/M)+ 30% 复杂(前沿 5 美元/M) all_frontier = blended_cost({"frontier": 1.0}, 0.25, 5.0) routed = blended_cost({"cheap": 0.7, "frontier": 0.3}, 0.25, 5.0) cascade = blended_cost({"cheap_first": 1.0}, 0.25, 5.0, escalation_rate=0.12) print(f"全前沿 ${all_frontier}/M → 预路由 ${routed}/M → 级联(12% 升级)${cascade}/M")

💡 路由的真正风险不是「省得不够」,是「悄悄退化」。把升级率、LLM 裁判采样、用户点赞都接进监控,你才能在漂移发生当周发现,而非季度复盘时。

四、框架对比:三种路由模式横向对照

模式 延迟 成本 质量底线 适合
预路由 +5~10 ms 依分类器准确率 延迟敏感、流量大
级联 中位 1.2×,升级 2× 最好(有回落) 质量不可妥协
集成路由 高(并行) 最高 关键 A/B、低量

工具:LiteLLM router(回落 + 成本路由)、Portkey(护栏 + 路由)、Kong AI 网关(插件)、RouteLLM(开源)、Not Diamond(商业 SaaS)。

五、可复用产物

本节产出 outputs/skill-router-plan.md(原课程目录)。给定工作负载与质量预算,它选出路由模式与信号:

  1. 模式选择:预路由 / 级联 / 集成,依延迟容忍与质量底线。
  2. 信号配置:四信号的权重与阈值。
  3. 在线质量门:LLM 裁判采样比例、升级率阈值、点赞监控。
  4. 漂移检测:分布漂移时自动重训分类器的触发条件。

六、练习

  1. 跑通模拟器:运行 code/main.py。在什么准确率底线上,级联胜过预路由?

  2. 混合用户群:你的用户 30% 企业(复杂查询)、70% 免费层(简单)。设计路由分流。哪个在线指标设门?

  3. 质量 vs 成本:某路由质量降 2% 但省 40%。这该不该上?依产品——两边都论证。

  4. 置信检查:用 OpenAI / Anthropic API 的 logprobs 实现一个置信检查。你起步用什么阈值?

  5. 漂移诊断:半年里升级率从 8% 升到 22%。诊断三个原因及各自修复。

本节要点回顾

  1. 模型路由 = 动态中介:按请求选模型,简单走便宜、复杂走前沿,同质量降 20%~60%。
  2. 四个信号:任务分类、提示长度、与难集 embedding 相似度、首遍自置信。
  3. 三种模式:预路由(最快)、级联(质量底线最好)、集成(质量最高成本最高)。
  4. 2026 价格每年降约 10 倍:GPT-4 级从 20 美元/M 降到 0.40 美元/M,多数来自服务栈而非硬件。
  5. 路由把价格降幅转成毛利:不等用户迁便宜档,应用层直接捕获。
  6. 漂移是真风险:40% 推便宜模型,半年后任务分布变,质量默默掉 3~5%。
  7. 在线质量门是必须:LLM 裁判采样、升级率、点赞/踩、拒绝率,而非只靠离线评测集。
  8. 网关暴露路由:LiteLLM/Portkey/Kong/RouteLLM/Not Diamond 都可用。

下一节,我们钻进推理架构的最大重构——分离式 prefill/decode:看 NVIDIA Dynamo 与 llm-d 如何把计算受限的 prefill 与内存受限的 decode 拆到不同 GPU 池。


发布者: 作者: Rohit Gupta 转发
评论区 (0)
U