3.1 性能模型:用 Roofline 与算术强度算清“为什么快、为什么长序列更赚” 读者读完这一节,应该能回答一句:FlashAttention-2 的加速不是“玄学提速”,而是把注意力的算术强度从“带宽受限区”往“算力屋顶”抬了一截;而且因为朴素注意力的 HBM 往返成本随序列长度被平方放大,序列越长,这截抬升带来的相对收益就越大。 第 2 章讲 FA-2 时我们反复提到“把数据留在 SRAM、减少 HBM 往返”。这一节,我要把这句话变成一个你能手算的数字。否则它永远只是句漂亮话,遇到“我开了 FA-2 但只快了 10%”的情况,你没法判断是 FA-2 没生效、还是业务本身不在瓶颈上。 3.1.