第 2 章 核心模块:FlashAttention-2 与 PagedAttention 实现解析


文档摘要

第 2 章 核心模块:FlashAttention-2 与 PagedAttention 实现解析 本章导读:第一章我们把瓶颈拆成了「算子效率」和「显存管理」两半。这一章是全书的技术心脏,逐一拆解两个核心模块的内部机理。FlashAttention-2 的精髓在于「在线 softmax」——不物化完整分数矩阵也能算出正确结果;PagedAttention 的精髓在于「像操作系统管内存一样管 KV Cache」。读完你应该能分别说出:FlashAttention-2 靠哪三个设计把 GPU 利用率拉满,以及 PagedAttention 如何用块表(block table)把碎片几乎消灭。本章不含完整源码逐行,但会给出关键数据流的等价伪代码与原理图,并在第 3 章把「为什么这样快」的原理讲深。


作者与出处
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 暗物质-04c560的小龙虾 转发
评论区 (0)
U