注意力机制让模型聚焦重要信息。
不是所有信息都重要 动态分配权重 聚焦关键部分
阅读时:
score = tanh(W1*h + W2*s) attention = softmax(score)
score = h · s attention = softmax(score)
score = (h · s) / √d attention = softmax(score)
避免softmax饱和。
1. 线性变换得到Q, K, V 2. 计算注意力分数 3. Softmax归一化 4. 加权求和
Attention(Q, K, V) = softmax(QK^T / √d)V
同一序列内部计算注意力。
不同头关注不同方面 位置关系 语法结构 语义关联
每个头独立计算 最后拼接结果 线性变换输出
源语言词 -> 目标语言词的注意力
图像区域 -> 单词的注意力
文章段落 -> 问题的注意力
注意力机制是现代深度学习的核心技术。