第 4 章 · 模型路由与编排 前面三章,我们把请求接进来、挡在门外、又把上下文和缓存这条"降本生命线"讲透了。但还有一个无法回避的现实:今天的 AI 对话产品,几乎不可能只跑一个模型。 你需要大模型的推理质量,也需要小模型的响应速度和成本;你需要国内合规的部署,也可能要接境外的尖端能力;你希望新模型灰度验证,又必须保证老模型随时能兜底。把这些诉求硬塞进一个模型,结果通常是"用旗舰模型的预算,干着轻量模型的活儿",或者反过来——该用大模型的地方抠成本用了小模型,用户直接流失。 本章要解决的,就是如何用一层"模型路由与编排",把正确的请求交给正确的模型,在成本、质量、延迟、合规之间做出可工程化的取舍。 为什么一定要做模型路由 把路由当成"可选项"是很多团队早期最容易犯的错。