4.3 FlashAttention-2与FlashAttention-3演进 从FlashAttention到FlashAttention-2:核心改进 FlashAttention的原始版本在2022年提出时,已经展示了通过精确注意力计算实现IO感知算法设计的巨大潜力。然而,Tri Dao等人在后续工作中发现,原始实现仍存在显著的优化空间,这些空间主要体现在计算效率、硬件利用率和实际部署性能三个维度。 计算效率的全面提升 FlashAttention-2在计算层面进行了多项关键优化。首先,它改进了线程块的工作分配策略。原始FlashAttention使用Warp级别的并行来处理Q矩阵的不同行,而FlashAttention-2重新设计了并行策略,让每个Warp处理K和V矩阵的不同块。