Transformer 与语言模型 Transformer 用自注意力取代了循环,成为语言理解与生成的主导架构。本文件涵盖 BERT、GPT、T5、位置编码(正弦、RoPE)、预训练目标(MLM、CLM)、微调、提示工程以及缩放定律——现代 LLM 背后的蓝图。 在第 6 章中,我们介绍了 Transformer 架构:自注意力、多头注意力、位置编码以及编码器-解码器结构。这里我们聚焦于 Transformer 如何被适配到具体的 NLP 范式、定义了现代 NLP 的那些模型(BERT、GPT、T5),以及让它们能在规模上落地实用的那些技术。