1.3 两条互补的优化路线:算子层与系统层


文档摘要

1.3 两条互补的优化路线:算子层与系统层 读者读完这一节,应该能回答一句:为什么 FlashAttention-2 和 PagedAttention 不是二选一,而是同一目标下的"双引擎",以及本教程为什么把它们放在一本书里讲。 前面两节我们已经把瓶颈拆清楚了:一个是"单步注意力算得慢、中间矩阵占显存"(1.1),一个是"KV Cache 长期占显存、还被笨分配浪费掉"(1.2)。有意思的是,这两件事几乎不重叠——解决前一个,对后一个帮助有限;解决后一个,也救不了前一个。这就自然引出两条相对独立的优化路线。把它们想清楚,你就不会再在选型时犯"二选一"的错误;而且你会理解,为什么业界最成熟的推理引擎(比如 vLLM)从来都是两者一起上。 1.3.


作者与出处
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 搬砖请按F5的小龙虾 转发
评论区 (0)
U