第 7 章 计算语言学 计算语言学(NLP)是 AI 中最古老、也最炙手可热的领域——从语言的形态、句法、语义一路讲到 ChatGPT 背后的 Transformer、注意力机制、RLHF 对齐和 Mamba 这类现代架构。本章是理解大语言模型(LLM)的核心章节:你将看到一行英文是如何被切成词元、压缩成稠密向量、被自注意力一层层加工,又如何被对齐成"有用、无害、诚实"的助手。 本章简介 如果说第 6 章是深度学习的通用引擎,那么本章就是把它专门用在人类语言上。语言是离散的、符号化的、高度结构化的,却又充满歧义和语境——这让 NLP 既迷人又困难。本章从语言学的结构(形态、句法、语义、语用)出发,先建立一套词汇来谈论"语言本身怎么运作";
计算语言学(NLP)是 AI 中最古老、也最炙手可热的领域——从语言的形态、句法、语义一路讲到 ChatGPT 背后的 Transformer、注意力机制、RLHF 对齐和 Mamba 这类现代架构。本章是理解大语言模型(LLM)的核心章节:你将看到一行英文是如何被切成词元、压缩成稠密向量、被自注意力一层层加工,又如何被对齐成"有用、无害、诚实"的助手。
如果说第 6 章是深度学习的通用引擎,那么本章就是把它专门用在人类语言上。语言是离散的、符号化的、高度结构化的,却又充满歧义和语境——这让 NLP 既迷人又困难。本章从语言学的结构(形态、句法、语义、语用)出发,先建立一套词汇来谈论"语言本身怎么运作";再走完经典 NLP 的流水线(分词、TF-IDF、n-gram、POS、NER),看看在神经网络之前人们是怎么处理文本的;接着进入表示学习(Word2Vec、GloVe、RNN/LSTM、seq2seq),理解把词变成向量这件事为什么会改变一切;然后是定义了现代 AI 的 Transformer 与语言模型(BERT、GPT、T5、位置编码、缩放定律、MoE、评测);最后落到前沿(文本扩散、OCR、RLHF/DPO 对齐、长上下文、RAG、投机解码、SSM/Mamba、GQA/MLA)。
本章有五条主线相互呼应:语言的结构性(语言学)、文本的工程化处理(经典 NLP)、从稀疏到稠密的表示(嵌入与序列模型)、Transformer 范式(语言模型与评测)、以及把模型做到生产级并对其进行对齐和加速(高级生成)。读完后,你应当既能看懂一篇 LLM 论文里的 RoPE、GQA、DPO 公式,也能理解 ChatGPT 这类系统从词元到回答的整条链路。
前置知识:本章假定你已经学过第 1 至 6 章。第 1 章的向量、内积和余弦相似度贯穿词嵌入、注意力打分和 TF-IDF 检索;第 2 章的矩阵运算是 Transformer、RNN 和所有线性投影的语言;第 3 章的链式法则是反向传播和策略梯度的灵魂;第 4 章的期望、最大似然和交叉熵直接出现在 n-gram 平滑、困惑度、KL 散度(DPO、知识蒸馏)和 HMM/CRF 中;第 5 章的概率分布、贝叶斯思想、信息论(PMI、熵)更是无处不在。尤其关键的是第 6 章里关于**注意力(attention)**和 Transformer 的部分——本章第 4、5 节大量直接引用它们,并在其上构建 BERT/GPT/T5、RoPE、GQA/MLA、MoE 等内容;第 6 章的 RL(PPO、策略梯度)是理解 RLHF 的前提,分布式训练(MoE、混合精度)则在第 5 节的现代架构中反复出现。
后续章节:本章是多个后续章节的基石。第 10 章多模态学习会大量复用本章的 Transformer、注意力、文本嵌入和 CLIP 式的双编码器来对齐图像与文本;第 17 章 AI 推理会深入 KV 缓存、GQA/MLA、投机解码、MoE 路由和长上下文部署——这些正是本章第 5 节的内容;第 9 章音频与语音会用到本章提到的音系学、CTC、CRNN,以及与文本语言模型紧密结合的语音识别/合成系统。可以说,不读懂本章,就难以真正读懂任何一个以语言为核心能力的现代 AI 系统。