第 1 章 · 缓存为什么存在于 LLM 系统


文档摘要

第 1 章 · 缓存为什么存在于 LLM 系统 章节摘要:本章跟着一张真实的推理账单走完全程:从"一次 LLM 调用到底烧了多少算力"出发,看懂 Prefill 与 Decode 两段式流水线的成本结构,再站上四层缓存版图确认每一层的复用机会,最后用键、值、失效三要素把"命中"与"浪费"的边界划清楚。读完后,你应当能用数字回答"缓存为什么是 LLM 推理的第一杠杆",并为第 2 章拆解 KV Cache 做好全部铺垫。 一条主线 导读把四层缓存版图铺开时,留了一个问题悬着:这些层为什么恰好长成这样?本章用一条主线把答案补齐——一张智能客服团队的月度账单。这家团队用大模型回答用户关于"重复计费"的咨询,模型没换、话术没改,账单却逐月上涨。

第 1 章 · 缓存为什么存在于 LLM 系统

章节摘要:本章跟着一张真实的推理账单走完全程:从"一次 LLM 调用到底烧了多少算力"出发,看懂 Prefill 与 Decode 两段式流水线的成本结构,再站上四层缓存版图确认每一层的复用机会,最后用键、值、失效三要素把"命中"与"浪费"的边界划清楚。读完后,你应当能用数字回答"缓存为什么是 LLM 推理的第一杠杆",并为第 2 章拆解 KV Cache 做好全部铺垫。

一条主线

导读把四层缓存版图铺开时,留了一个问题悬着:这些层为什么恰好长成这样?本章用一条主线把答案补齐——一张智能客服团队的月度账单。这家团队用大模型回答用户关于"重复计费"的咨询,模型没换、话术没改,账单却逐月上涨。整章就沿着这张账单往下追:先算清单次调用的 token 构成,再算清多轮对话的膨胀曲线,然后潜入推理流水线内部找到浪费的物理位置,最后回到缓存本身,回答"在哪一层、用什么键、能省多少"。

起点交代完毕:一个真实业务、一笔糊涂账、一条追问线索。全章四个站点都从这条线上走过,每个站点解决账单暴露的一个疑问。

沿途站点

1.1 一次推理的算力账单——把一次调用拆成系统提示词、历史上下文、用户输入、输出四块,给出 token 估算公式与可运行的测算脚本。站点产出是一张表格:多轮对话里每一轮"实际付费 token 数"如何从 880 涨到 10 万量级,输入侧重复付费占比如何逼近 99%。这是全章的问题起点,也是复用经济学的第一个数据点。

1.2 Prefill 与 Decode 的两段式成本——顺着账单往流水线里走,解剖两段计算的性格差异:Prefill 一次并行处理全部输入 token,计算密集、GPU 利用率高;Decode 逐 token 生成,访存密集、利用率常低于一成。站点产出是一个定位结论:多轮对话中最大的浪费是"重复 Prefill"——没变的那几千上万个 token,每轮都被重新算一遍、重新收一次费。

1.3 LLM 缓存四层版图——既然浪费发生在"重算没变的前缀",缓存就是回收算力的手段。本节提出四层分类框架:显存层 KV Cache、框架层前缀复用、平台 API 层 context caching、应用层语义缓存,每层用"缓存键、缓存值、命中收益"三元组刻画。站点产出是一张三元组对照表和一张请求穿过四层的数据流架构图。

1.4 命中、未命中与失效——通用缓存语义进入 LLM 场景后有三处变形:键从 URL 变成有序前缀或嵌入向量,值从响应体变成 KV 张量或生成结果,失效从"源数据变了"变成"前缀变了、模型版本变了"。本节用一次"改个日期、命中率归零"的复盘把前缀敏感性讲成可操作的布局法则。

拐点与结论

本章的认知拐点出现在 1.2 与 1.3 之间。1.2 结束时,读者看到的是"浪费在重复 Prefill"——这是成本视角;进入 1.3 后视角切换为"浪费可以被分层回收"——这是复用视角。两个视角叠加,才是全册主调的完整含义:算力是预付的,缓存是回收。Prefill 为输入里的每个 token 预付了算力,只要前缀不变,这笔预付就值得被反复回收,而不是每次请求都重新预付。

最终落点是一个可迁移的判断框架:看到任何 LLM 优化手段,先问三个问题——它属于四层中的哪一层?缓存键是什么?命中后免掉的是重复 Prefill、重复 Decode,还是整次推理?这三个问题贯穿后续六章,每一章都在用它们拆解具体技术。反过来,这个框架也能识别伪优化:一项号称"降本"的手段,如果说不清自己在哪一层缓存了什么键、命中后免掉了哪段计算,多半只是把成本从账单的一个科目挪到了另一个科目。

读完你应该

  • 能拆解一次 LLM 调用的 token 构成,写出多轮对话付费 token 的累加公式,并用脚本复现本章的膨胀表;
  • 能推导多轮对话中重复 Prefill 的 token 数量,解释它为何随轮次逼近输入总量的 99%;
  • 能对比 Prefill 与 Decode 的计算特征,说清两者分别在算力与显存带宽上受限的原因,以及 batching 对两段的不同影响;
  • 能按四层版图定位任意一项缓存技术(如 PagedAttention、context caching、语义缓存)的层级、键类型与命中收益;
  • 能判断一个提示词布局是否缓存友好,并预测改动某个字段后命中率的变化方向。

下一章的接力

本章把四层版图画了出来,但没有深入任何一层的内部实现。第 2 章潜入最底层——显存层 KV Cache:它是什么张量、占多少显存、为什么能免掉重复计算、又为什么极容易把显存撑爆;1.2 节的两段式成本模型将在那里变成逐层的张量计算,2.3 与 2.4 节还会接手框架层的 PagedAttention 与 RadixAttention。第 3 章上移到平台 API 层,讲各家 context caching 的计费经济学与缓存友好改造,正是 1.4 节"位置就是成本"法则的工程化落地。本章的三元组对照表,是后续所有章节的索引。

本章知识结构


作者与出处
原作者: 灏天文库
整理: 灏天文库整理
本站整理收录,版权归原作者/开源协议所有;欢迎通过原文链接访问源仓库。
发布者: 作者: 灏天文库 转发
评论区 (0)
U