1.1 注意力计算的计算与显存瓶颈 读者读完这一节,应该能回答一句:标准注意力为什么"算力够、显存也够,却依然又慢又容易 OOM"——根子在 O(n²) 的显存物化和 HBM 的反复读写,而不是 GPU 乘法不够快。 上一节我们把注意力的数学形式摆出来了。这一节不喊口号,而是把"慢"和"费显存"拆成两个可以量化、可以归因的具体问题。很多同学第一次优化推理时会直觉地"加显存、换更大卡",但如果定位错了瓶颈,加显存只是把问题往后推一步,并不能根治。我们先把数据流画清楚,再用量级和"屋顶线模型"把话说死,最后辨析几个最常见的误解。 1.1.