第7章 前沿对比与全景收束 章节摘要:本章跟着一条线走——把前六章攒下的"缓存能在哪省、能省多少"的判断力,收束成一次能写进技术方案的完整决策。第 6 章把账算到了 TCO 和盈亏平衡点,但账算得越清楚,越会发现缓存不是唯一解,也不是总能放心用。这一章先划出跨请求共享的安全边界,看清复用收益的顶在哪、泄漏风险的底在哪;再把镜头推到端侧小设备,看那套云端经济学如何被显存和功耗重写;随后把缓存、蒸馏、截断、语义压缩四条降本路线摆到同一张成本框架里正面对决;最后落到一张选型决策树和一份术语速查表。读完这章,读者应当能独立回答三件事:该不该缓存、在哪一层缓存、不缓存还能怎么办。
章节摘要:本章跟着一条线走——把前六章攒下的"缓存能在哪省、能省多少"的判断力,收束成一次能写进技术方案的完整决策。第 6 章把账算到了 TCO 和盈亏平衡点,但账算得越清楚,越会发现缓存不是唯一解,也不是总能放心用。这一章先划出跨请求共享的安全边界,看清复用收益的顶在哪、泄漏风险的底在哪;再把镜头推到端侧小设备,看那套云端经济学如何被显存和功耗重写;随后把缓存、蒸馏、截断、语义压缩四条降本路线摆到同一张成本框架里正面对决;最后落到一张选型决策树和一份术语速查表。读完这章,读者应当能独立回答三件事:该不该缓存、在哪一层缓存、不缓存还能怎么办。
我们借用一个贯穿全章的场景串起所有内容:一家把大模型嵌进协作产品的 SaaS 公司,它的账单里既有"几乎所有请求都带着同一份几百页产品手册"的稳定前缀,也有"成千上万用户各自随心所欲地提问"的杂乱长尾,服务还跑在一批显存紧张的端侧节点上。这条线的起点是第 6 章的成本模型——我们已经会算"复用一次省多少钱";终点则是一次能落地的决策:哪些 token 值得共享、哪些必须隔离、端侧要不要留缓存、以及当缓存本身不够用时该换哪张牌。值得强调的是,这条主线不是线性递进的教程章节,而是一次"带着账单进手术室"的操练:前面六章给的是器官和工具,这一章教的是怎么下刀。读者不必记住每一层缓存的实现细节,但必须能在面对一份真实账单时,判断问题出在复用率、单价还是冗余输入上,并知道该翻回哪一章找解法。
顺着主线往下,四节各有推进:
本章真正的认知拐点是:缓存只是"回收预付算力"的一种手段,它的收益有物理上限(前缀必须稳定、上下文必须可复用),它的成本有合规下限(别人的内容不能进你的上下文预算)。当上限够不到、下限又碰不得时,就该换牌——蒸馏把单价结构性拉低,截断直接舍弃冗余,语义压缩在保留信息的前提下缩短输入。四种手段不是互斥的,最优解往往是叠加:先用缓存吃掉稳定前缀,再用压缩缩短易变的长尾,最后对高频场景叠一层蒸馏把单价底座整体压下来。这个拐点之所以关键,是因为它把前六章零散的机制收成了一个判断框架——读者此后看任何一份 LLM 账单,脑海里浮现的不该是某条具体命令,而是一条"先量前提、再排路线、敢换牌"的决策链。
这是全册终章,没有下一章接棒。但收束不等于结束:本章的决策树和术语表是读者离开教程后独立作战的工具,而第 2 章到第 5 章的机制细节,正是这棵决策树每一片叶子的实现依据。遇到具体落地问题时,按图索骥回到对应章节即可。全册的主线始终是同一句话——算力是预付的,缓存是回收,而回收的手艺,决定了一笔推理账单最终是亏是赚。