第 3 章 · 上下文与缓存层:打平推理成本的胜负手 导读:高并发 × 长上下文 = 海量 KV Cache 和推理成本。如果不做上下文压缩和缓存,成本会指数级膨胀,平台注定亏损。这一章讲透对话历史压缩、KV Cache 管理、语义缓存——这是高并发大模型服务降本的胜负手。缓存命中率每提升 10 个百分点,单请求成本就下降约 8%10%。 本章核心问题 上下文怎么压? —— 长对话的历史如何压缩而不丢关键信息。 KV Cache 怎么管? —— 跨请求复用显存,省 prefill。 语义缓存怎么命中? —— 把"问法不同但语义等价"的请求导向历史响应。 本章小节 3.1 对话历史压缩与 KV Cache 管理 —— 滑动窗口、摘要压缩、KV Cache 复用与失效。 3.