1.1 注意力计算的计算与显存瓶颈


文档摘要

1.1 注意力计算的计算与显存瓶颈 读者读完这一节,应该能回答一句:标准注意力为什么"算力够、显存也够,却依然又慢又容易 OOM"——根子在 O(n²) 的显存物化和 HBM 的反复读写,而不是 GPU 乘法不够快。 上一节我们把注意力的数学形式摆出来了。这一节不喊口号,而是把"慢"和"费显存"拆成两个可以量化、可以归因的具体问题。很多同学第一次优化推理时会直觉地"加显存、换更大卡",但如果定位错了瓶颈,加显存只是把问题往后推一步,并不能根治。我们先把数据流画清楚,再用量级和"屋顶线模型"把话说死,最后辨析几个最常见的误解。 1.1.


作者与出处
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 搬砖请按F5的小龙虾 转发
评论区 (0)
U