作为降本原语的模型路由 本节摘要:一个动态中介评估每个请求(任务类型、token 长度、embedding 相似度、置信度),把简单查询发给便宜模型,把复杂的升级到前沿模型——也称模型级联(model cascading)。生产案例显示,在美/英/欧部署上同等质量下成本降低 20%60%;一个高量 SaaS 上 30% 的路由效率提升就变成六位数年度节省。2026 年的背景是 LLM 推理价格每年降约 10 倍——一个 GPT-4 级 token 从 2022 年末的 20 美元/百万降到 2026 年的约 0.40 美元/百万,其中大部分降幅来自更好的服务栈(第 0409 节),而非硬件。路由,是你把那价格降幅转成毛利而不让产品退化的手段。
本节摘要:一个动态中介评估每个请求(任务类型、token 长度、embedding 相似度、置信度),把简单查询发给便宜模型,把复杂的升级到前沿模型——也称模型级联(model cascading)。生产案例显示,在美/英/欧部署上同等质量下成本降低 20%60%;一个高量 SaaS 上 30% 的路由效率提升就变成六位数年度节省。2026 年的背景是 LLM 推理价格每年降约 10 倍——一个 GPT-4 级 token 从 2022 年末的 20 美元/百万降到 2026 年的约 0.40 美元/百万,其中大部分降幅来自更好的服务栈(第 0409 节),而非硬件。路由,是你把那价格降幅转成毛利而不让产品退化的手段。失败模式是廉价模型漂移:路由把 40% 推给弱模型,推理任务质量掉 3~5%,一个季度没人注意。用在线质量指标给路由设门,而非只靠离线评测集。
对应原课程:Phase 17 · Lesson 16 ·
16-model-routing(原英文phases/17-infrastructure-and-production/16-model-routing/docs/en.md)。
阅读完本节,你应当能够:
你的服务在 GPT-5 上月花 8 万美元。分析显示 70% 查询很简单:「巴黎几点了?」「把这句改写一下」。一个 Haiku 级模型用 3% 的成本就能完美处理。30% 需要 GPT-5 的推理——编码、数学、多步规划。
如果你把 70% 路由到便宜、30% 到昂贵,账单在同等产品质量下降约 65%。这就是路由。诀窍是建中介而不退化质量。
任务分类:简单/复杂/代码生成/数学/聊天。可以是规则分类器、小 LLM(Haiku 级,0.25 美元/百万)、或对标注桶的 embedding 相似度。输出:route = 便宜 / 平衡 / 前沿。
提示长度:>4K token 提示常需前沿保连贯;<500 token 通常不用。
与已知难集的 embedding 相似度:若查询与已知难桶接近(余弦 >0.88),直接升级到前沿。
首遍自置信:发给便宜;若模型 log-prob 显示低置信、或拒绝、或输出含糊措辞,在前沿上重试。给约 10% 流量加 P95 延迟,但为另 90% 省 50%+。
预路由(前置分类器):加约 5~10 ms 延迟;总体最快。
级联(廉价优先,低置信升级):中位延迟约 1.2×(廉价跑 + 验证),升级的约 2×。质量底线最好。
集成路由(并行跑廉价与前沿,采样,奖励模型挑):质量最高、成本最高;仅用于关键 A/B。
AI 网关(第 19 节)暴露路由。LiteLLM 有带回落与成本路由的 router 配置;Portkey 有护栏 + 路由;Kong AI 网关有基于插件的路由;OpenRouter 的模型卖场暴露推荐 API。
开源:RouteLLM(LMSYS)、Not Diamond(商业)、Prompt Mule。
| 模型级别 | 2022 年末 | 2026 | 变化 |
|---|---|---|---|
| GPT-4 级质量 | 约 20 美元/百万 | 约 0.40 美元/百万 | 便宜 50 倍 |
| 前沿(GPT-5、Claude 4) | — | 约 3~10 美元/百万 | 新档 |
多数改善来自服务效率——第 04~09 节的核心课程转成了厂商侧成本下降。路由让你在应用层捕获这些收益,而不必等所有用户迁到便宜档。
你的路由把 40% 推给便宜模型。半年里任务分布漂移(用户更老练,问更长的问题)。路由器没察觉,因为它的分类器训练在 Q1 数据上。质量默默掉。没人抱怨得够大声。你在输给的竞品基准里才发现。
用在线质量指标给路由设门:
原课程 code/main.py 在混合工作负载上模拟预路由、级联、集成,报告混合成本、质量损失、升级率。下面给最小可读的混合成本骨架。
def blended_cost(traffic_split, cheap_per_m, frontier_per_m, escalation_rate=0.0, verify_overhead=1.2): """估算级联路由的混合 $/M token。 traffic_split: dict {'cheap': 比例, 'frontier': 比例}(预路由模式) 或 {'cheap_first': 比例}(级联模式,escalation_rate 决定升级) """ if "cheap_first" in traffic_split: base = traffic_split["cheap_first"] escalated = base * escalation_rate cheap = base - escalated # 升级的付便宜跑(× 开销) + 前沿跑 cost = (cheap * cheap_per_m + escalated * (cheap_per_m * verify_overhead + frontier_per_m)) else: cost = (traffic_split.get("cheap", 0) * cheap_per_m + traffic_split.get("frontier", 0) * frontier_per_m) return round(cost, 3) # 案例:70% 简单(便宜 0.25 美元/M)+ 30% 复杂(前沿 5 美元/M) all_frontier = blended_cost({"frontier": 1.0}, 0.25, 5.0) routed = blended_cost({"cheap": 0.7, "frontier": 0.3}, 0.25, 5.0) cascade = blended_cost({"cheap_first": 1.0}, 0.25, 5.0, escalation_rate=0.12) print(f"全前沿 ${all_frontier}/M → 预路由 ${routed}/M → 级联(12% 升级)${cascade}/M")
💡 路由的真正风险不是「省得不够」,是「悄悄退化」。把升级率、LLM 裁判采样、用户点赞都接进监控,你才能在漂移发生当周发现,而非季度复盘时。
| 模式 | 延迟 | 成本 | 质量底线 | 适合 |
|---|---|---|---|---|
| 预路由 | +5~10 ms | 低 | 依分类器准确率 | 延迟敏感、流量大 |
| 级联 | 中位 1.2×,升级 2× | 中 | 最好(有回落) | 质量不可妥协 |
| 集成路由 | 高(并行) | 高 | 最高 | 关键 A/B、低量 |
工具:LiteLLM router(回落 + 成本路由)、Portkey(护栏 + 路由)、Kong AI 网关(插件)、RouteLLM(开源)、Not Diamond(商业 SaaS)。
本节产出 outputs/skill-router-plan.md(原课程目录)。给定工作负载与质量预算,它选出路由模式与信号:
跑通模拟器:运行 code/main.py。在什么准确率底线上,级联胜过预路由?
混合用户群:你的用户 30% 企业(复杂查询)、70% 免费层(简单)。设计路由分流。哪个在线指标设门?
质量 vs 成本:某路由质量降 2% 但省 40%。这该不该上?依产品——两边都论证。
置信检查:用 OpenAI / Anthropic API 的 logprobs 实现一个置信检查。你起步用什么阈值?
漂移诊断:半年里升级率从 8% 升到 22%。诊断三个原因及各自修复。
下一节,我们钻进推理架构的最大重构——分离式 prefill/decode:看 NVIDIA Dynamo 与 llm-d 如何把计算受限的 prefill 与内存受限的 decode 拆到不同 GPU 池。