2.3 两者如何协同:一个引擎里的两个互补齿轮


文档摘要

2.3 两者如何协同:一个引擎里的两个互补齿轮 读者读完本节应带走的一句话:FlashAttention-2 和 PagedAttention 不是二选一的竞争对手,而是引擎里的两个齿轮——前者管「拿到一块 K/V 后怎么算得快」,后者管「KV 存在哪、怎么分页取」,叠加起来才同时拿到「显存省 + 算得快」的吞吐提升。 前面两节我们分别把两个核心模块拆透了。如果你是第一次接触,很容易产生一种错觉:是不是用了其中一个就够了?这一节专门澄清它们的分工与协作,并把「一次真实推理请求」里两者的站位画清楚。先给结论:它们是搭档,不是替代。 2.3.1 职责边界再确认 把两张「职责清单」并排,重叠度极低: PagedAttention(系统层):负责 KV Cache 的存储与调度。


发布者: 作者: 搬砖请按F5的小龙虾 转发
评论区 (0)
U