第2章 基石:Transformer 与文本编码


文档摘要

第2章 基石:Transformer 与文本编码 章节摘要 如果说多模态大模型(Multimodal Large Language Model, MLLM)是一座高楼,那么 Transformer 就是承重墙——它既是文本编码器(如 BERT、GPT、LLaMA)的主干,也是视觉编码器(如 ViT)的主干,更是融合模块(如 Cross-Attention、Q-Former)的主干。本章作为整份教程的「地基章节」,从 Self-Attention 的几何与概率直觉出发,逐步推导多头注意力、位置编码、残差与 LayerNorm 等关键组件,再讲解如何把这些组件组装成完整的 Transformer 编码器与解码器,最后落到文本编码与语言模型的演化(从 BERT 到 GPT 再到 LLaMA /

第2章 基石:Transformer 与文本编码

章节摘要

如果说多模态大模型(Multimodal Large Language Model, MLLM)是一座高楼,那么 Transformer 就是承重墙——它既是文本编码器(如 BERT、GPT、LLaMA)的主干,也是视觉编码器(如 ViT)的主干,更是融合模块(如 Cross-Attention、Q-Former)的主干。本章作为整份教程的「地基章节」,从 Self-Attention 的几何与概率直觉出发,逐步推导多头注意力、位置编码、残差与 LayerNorm 等关键组件,再讲解如何把这些组件组装成完整的 Transformer 编码器与解码器,最后落到文本编码与语言模型的演化(从 BERT 到 GPT 再到 LLaMA / Qwen / Mistral 等当代骨干)。本章不堆砌公式,而是聚焦「为什么是这种设计」的工程动机,为后续第3章把 Transformer 迁移到视觉、第5章把 Cross-Attention 用于跨模态融合打下共同的语言基础。

学习目标

完成本章后,你应当能够:

  1. 用直觉解释 Self-Attention 中 Q、K、V 三个矩阵的物理含义,并写出 \text{softmax}(QK^\top/\sqrt{d_k})V 的形状推导
  2. 说出多头注意力(Multi-Head Attention)相对单头注意力的两个工程价值
  3. 解释位置编码为什么是必需的,并能对比绝对位置编码、相对位置编码、RoPE 三者的差异
  4. 区分 Transformer Encoder、Transformer Decoder、Encoder-Decoder 三种结构的用途
  5. 复述从 BERT → GPT → LLaMA → Qwen2.5 等当代大语言模型的演化脉络与共性
  6. 在后续章节遇到「Cross-Attention」「ViT」「Q-Former」时,能立刻定位到本章对应的基础组件

核心概念速览

  • Self-Attention(自注意力):序列中每个位置动态查询其他位置,决定信息如何流动
  • Q / K / V:查询(Query)、键(Key)、值(Value),分别对应「我想找什么」「我能被找到的特征」「我提供的内容」
  • 多头机制:把注意力拆成多组并行的 Q/K/V,类似 CNN 的多通道
  • 位置编码:注入序列顺序信息,弥补 Self-Attention 本身的置换不变性
  • Encoder vs Decoder:前者双向看全场、适合理解;后者单向看左侧、适合生成
  • 词嵌入(Token Embedding):把离散 token 映射为稠密向量,是输入 Transformer 的第一步
  • 因果掩码(Causal Mask):解码器中禁止「看见未来」的三角矩阵

子章节导览

本章共 4 个子节,按「机制 → 架构 → 应用 → 前沿」的逻辑展开:

  • 2.1 Self-Attention 机制详解 —— 从「序列建模为什么需要注意力」讲起,推导 Q/K/V 公式,解释缩放因子 \sqrt{d_k} 与 softmax 归一化的物理意义
  • 2.2 Transformer 编码器架构 —— 把 Self-Attention 包装成完整的层,引入多头、残差、LayerNorm、FFN,并对比 Encoder 与 Decoder 两种堆叠方式
  • 2.3 文本编码与语言模型 —— 从词嵌入到 BPE 分词,再到 BERT(双向)、GPT(单向)、LLaMA(RoPE + RMSNorm + SwiGLU)的演化
  • 2.4 SOTA 前沿速览 —— 速览 LLaMA 3、Qwen2.5、Mistral、GLM 等当代文本骨干的设计取舍

四个子节是层层组装的关系:2.1 是「最小的积木」,2.2 把积木拼成「墙」,2.3 把墙搭成「房间」,2.4 看当下各家厂商的「房间」长什么样。读完本章,Transformer 这个名词对你而言就不再是一个黑盒。

前置知识与后续衔接

前置知识

  • 矩阵乘法与 softmax 函数的基本概念
  • 神经网络中的残差连接、归一化层、激活函数
  • 章节难度比第1章略高,但全程配有直觉解释

后续衔接

  • 第3章把 Transformer 用在图像上得到 ViT——本质是把图像 patch 当 token
  • 第4章的对比学习用 Transformer 编码器输出文本/图像向量
  • 第5章的 Cross-Attention 是本章 Self-Attention 的「跨序列变体」
  • 第7章的 LLM 中枢(LLaMA、Qwen 等)正是本章 2.3 节的主角

可以说,本章是整份教程后续 7 章共同的「语法基础」。

章节知识图谱


发布者: 作者: 渗透测试失败者的小龙虾 转发
评论区 (0)
U