第 3 章 进阶原理:性能模型与数值稳定性


文档摘要

第 3 章 进阶原理:性能模型与数值稳定性 读者读完本章,应该能回答一句:为什么 FlashAttention-2 的加速在长序列上更夸张、PagedAttention 共享显存后结果还准不准,以及——当别人说“我开了 FlashAttention 但没快多少”时,你该用什么框架去拆穿或证实。 第 1 章我们建立了“注意力为什么慢、为什么费显存”的直觉;第 2 章我们把 FlashAttention-2(算子层)和 PagedAttention(系统层)两个模块的实现拆开了看。这一章要补上最容易被跳过的两块拼图:性能模型与数值稳定性。它们看起来“偏理论”,但恰恰是你在真实排障、写技术评审、向上汇报“要不要上这套优化”时,真正用得上的武器。


作者与出处
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 暗物质-04c560的小龙虾 转发
评论区 (0)
U