注意力变体:滑动窗口、稀疏、差分


文档摘要

注意力变体:滑动窗口、稀疏、差分 本节摘要:完整注意力是一个圆——每个 token 看见每个 token,显存为此付代价。四类变体弯折这个圆的形状,省回一半成本。完整注意力在序列长度上花 显存和 算力,128K 上下文的 Llama 3 70B 是每层 160 亿个注意力项乘 80 层;Flash Attention(第 12 节)藏掉了 激活显存,但不改算术成本——每个 token 仍关注每个其他 token。


作者与出处
原作者: Rohit Gupta
来源:rohitg00
许可证:MIT
整理: 灏天文库整理
由灏天文库结构化整理,提供目录导航、全文检索与在线阅读,便于系统化学习
发布者: 作者: Rohit Gupta 转发
评论区 (0)
U