注意力变体:滑动窗口、稀疏、差分 本节摘要:完整注意力是一个圆——每个 token 看见每个 token,显存为此付代价。四类变体弯折这个圆的形状,省回一半成本。完整注意力在序列长度上花 显存和 算力,128K 上下文的 Llama 3 70B 是每层 160 亿个注意力项乘 80 层;Flash Attention(第 12 节)藏掉了 激活显存,但不改算术成本——每个 token 仍关注每个其他 token。