内容摘要
Transformer 从零搭 · 注意力到底在注意什么 灏 灏天文库 · AI 与大模型 第 5 期 AI 与大模型 · 第 5 期 Transformer 从零搭, 注意力 到底在注意什么 self-attention · attention is a matrix "注意力"不是比喻,是一个 你能算出来的矩阵 。每个词去"看"句子里其他每个词,看多紧就是一个 0~1 的权重——所有词的权重排成矩阵,就是注意力矩阵。代词指谁、长依赖怎么连,全藏在这个矩阵里。8 步从零搭,你就懂了 Transformer 的心脏。 ⏱ 约 12 分钟 🎯 想真正理解 Transformer 的人 📦 源:ai-engineering-from-scratch §8 01 一个反共识:注意力不是"关注",是加权 "注意力机制"这名字误导了很多人,以为模型在"关注"某些词。其实它做的是一件很数学的事:给当前词,对句子里每个词算一个权重,加权求和。 Attention(Q,K,V) = softmax(QK T /√d k ) V Q(查询)、K(键)、V(值)都是输入变换出来的矩阵。