第 3 章 · 上下文与缓存 导读:在 AI 对话引擎里,最贵的从来不是网络带宽,而是你把多少 token 一遍遍喂给 GPU。上下文越长,prefill 越慢、KV Cache 越胀、显存越紧张;而真实流量里,绝大多数请求其实都在重复问相似的问题、重复读相似的上下文。本章要做的,就是用「多级缓存」和「上下文压缩」这两把刀,把重复计算砍掉一大半——这是整套架构里投入产出比最高的降本杠杆。 为什么是这一章 把一座百万级 QPS 的对话引擎拆开看,成本结构出奇地集中:推理集群的算力开销占据了运营成本的绝对大头,而推理开销的核心驱动因素又是两个——「被喂给模型的 token 总数」和「这些 token 被重复算了多少遍」。