第 1 章 基础:从注意力瓶颈说起 本章导读:如果你曾经跑过一个稍微大一点的模型,大概率经历过这样的时刻——显存明明还剩一大块,推理速度却卡得让人怀疑人生;或者明明 batch 调大了一点,程序就报 OOM。这一章我们不急着上 FlashAttention 或 PagedAttention 的代码,而是先把"为什么慢、为什么费显存"这件事讲透。只有把瓶颈定位准确,后面所有的加速技术才有意义。读完本章,你应该能用一句话解释:标准注意力计算的复杂度到底卡在哪里,以及为什么"算力够、显存也够"却依然跑不快。 注意力的数学形式与朴素实现 Transformer 的核心是自注意力。