6.3 MoE与稀疏注意力机制的融合趋势 引言 MoE通过稀疏激活FFN层实现了参数量与计算量的解耦,而稀疏注意力机制(如Flash Attention、Longformer、BigBird等)则在注意力计算中实现了计算效率的优化。将这两种稀疏策略融合,是当前大模型架构演进的重要趋势。本章将探讨MoE与稀疏注意力机制的融合方式和最新进展。 稀疏注意力机制概览 全注意力的计算瓶颈 标准自注意力的计算复杂度为 $O(T^2 d)$,其中 $T$ 是序列长度。当 $T$ 增大时,计算量和显存占用呈二次增长。 稀疏注意力的分类 1.