self-attention · attention is a matrix
"注意力机制"这名字误导了很多人,以为模型在"关注"某些词。其实它做的是一件很数学的事:给当前词,对句子里每个词算一个权重,加权求和。
Q(查询)、K(键)、V(值)都是输入变换出来的矩阵。QKT 算"当前词和每个词有多相关",softmax 归一化成权重,乘 V 加权求和。一句话:当前词 = 句子里所有词的加权平均,权重由相关性决定。这就是"注意力"的全部。
下面是一句话"猫 追 老鼠 因为 它 饿"。点任意词,看它在注意谁(颜色越深权重越高)。重点看"它"在注意谁——这就是代词消解。
把注意力装进完整 Transformer,就这 8 步:
没有黑魔法,每一步都是矩阵乘法 + 归一化。从零搭一遍(ai-engineering-from-scratch §8 给了完整代码),你就知道那些"涌现能力"其实是从这个简单结构 + 海量数据里出来的。