第2章 基石:Transformer 与文本编码 章节摘要 如果说多模态大模型(Multimodal Large Language Model, MLLM)是一座高楼,那么 Transformer 就是承重墙——它既是文本编码器(如 BERT、GPT、LLaMA)的主干,也是视觉编码器(如 ViT)的主干,更是融合模块(如 Cross-Attention、Q-Former)的主干。本章作为整份教程的「地基章节」,从 Self-Attention 的几何与概率直觉出发,逐步推导多头注意力、位置编码、残差与 LayerNorm 等关键组件,再讲解如何把这些组件组装成完整的 Transformer 编码器与解码器,最后落到文本编码与语言模型的演化(从 BERT 到 GPT 再到 LLaMA /
如果说多模态大模型(Multimodal Large Language Model, MLLM)是一座高楼,那么 Transformer 就是承重墙——它既是文本编码器(如 BERT、GPT、LLaMA)的主干,也是视觉编码器(如 ViT)的主干,更是融合模块(如 Cross-Attention、Q-Former)的主干。本章作为整份教程的「地基章节」,从 Self-Attention 的几何与概率直觉出发,逐步推导多头注意力、位置编码、残差与 LayerNorm 等关键组件,再讲解如何把这些组件组装成完整的 Transformer 编码器与解码器,最后落到文本编码与语言模型的演化(从 BERT 到 GPT 再到 LLaMA / Qwen / Mistral 等当代骨干)。本章不堆砌公式,而是聚焦「为什么是这种设计」的工程动机,为后续第3章把 Transformer 迁移到视觉、第5章把 Cross-Attention 用于跨模态融合打下共同的语言基础。
完成本章后,你应当能够:
本章共 4 个子节,按「机制 → 架构 → 应用 → 前沿」的逻辑展开:
四个子节是层层组装的关系:2.1 是「最小的积木」,2.2 把积木拼成「墙」,2.3 把墙搭成「房间」,2.4 看当下各家厂商的「房间」长什么样。读完本章,Transformer 这个名词对你而言就不再是一个黑盒。
前置知识:
后续衔接:
可以说,本章是整份教程后续 7 章共同的「语法基础」。