3.2 语义缓存:把推理算力砍掉一两成的杠杆 1.3 节的反模式三讲过一个案例:一个团队只做精确缓存,命中率长期低于 1%,推理成本始终降不下来。我接手后做的第一件事就是上线语义缓存,两周内命中率爬到 22%,单请求成本降了将近 20%。团队的反应是"这么有效,为什么我们之前没做"——答案是他们被"用户问题千差万别"这个直觉误导了,以为缓存没用。但真实数据是:在 FAQ、客服、通用知识这些场景里,意图相同的请求比例远超想象,只是问法不同而已。 这一节讲透语义缓存的原理、命中率优化、失效机制,以及它的收益模型。对百万级平台来说,这是每年能省下数百万甚至数千万 GPU 成本的杠杆,值得认真对待。 语义缓存的原理 先说清楚为什么精确缓存几乎没用。