第 7 章 计算语言学


文档摘要

第 7 章 计算语言学 计算语言学(NLP)是 AI 中最古老、也最炙手可热的领域——从语言的形态、句法、语义一路讲到 ChatGPT 背后的 Transformer、注意力机制、RLHF 对齐和 Mamba 这类现代架构。本章是理解大语言模型(LLM)的核心章节:你将看到一行英文是如何被切成词元、压缩成稠密向量、被自注意力一层层加工,又如何被对齐成"有用、无害、诚实"的助手。 本章简介 如果说第 6 章是深度学习的通用引擎,那么本章就是把它专门用在人类语言上。语言是离散的、符号化的、高度结构化的,却又充满歧义和语境——这让 NLP 既迷人又困难。本章从语言学的结构(形态、句法、语义、语用)出发,先建立一套词汇来谈论"语言本身怎么运作";

第 7 章 计算语言学

计算语言学(NLP)是 AI 中最古老、也最炙手可热的领域——从语言的形态、句法、语义一路讲到 ChatGPT 背后的 Transformer、注意力机制、RLHF 对齐和 Mamba 这类现代架构。本章是理解大语言模型(LLM)的核心章节:你将看到一行英文是如何被切成词元、压缩成稠密向量、被自注意力一层层加工,又如何被对齐成"有用、无害、诚实"的助手。

本章简介

如果说第 6 章是深度学习的通用引擎,那么本章就是把它专门用在人类语言上。语言是离散的、符号化的、高度结构化的,却又充满歧义和语境——这让 NLP 既迷人又困难。本章从语言学的结构(形态、句法、语义、语用)出发,先建立一套词汇来谈论"语言本身怎么运作";再走完经典 NLP 的流水线(分词、TF-IDF、n-gram、POS、NER),看看在神经网络之前人们是怎么处理文本的;接着进入表示学习(Word2Vec、GloVe、RNN/LSTM、seq2seq),理解把词变成向量这件事为什么会改变一切;然后是定义了现代 AI 的 Transformer 与语言模型(BERT、GPT、T5、位置编码、缩放定律、MoE、评测);最后落到前沿(文本扩散、OCR、RLHF/DPO 对齐、长上下文、RAG、投机解码、SSM/Mamba、GQA/MLA)。

本章有五条主线相互呼应:语言的结构性(语言学)、文本的工程化处理(经典 NLP)、从稀疏到稠密的表示(嵌入与序列模型)、Transformer 范式(语言模型与评测)、以及把模型做到生产级并对其进行对齐和加速(高级生成)。读完后,你应当既能看懂一篇 LLM 论文里的 RoPE、GQA、DPO 公式,也能理解 ChatGPT 这类系统从词元到回答的整条链路。

本章小节

  • 第 1 节 语言学基础:形态学、句法、语义、语用、音系——语言在每一层都有结构,而这些结构正是分词、语法分析和意义建模的根基。
  • 第 2 节 文本处理与经典 NLP:分词(词级、子词、BPE、WordPiece)、文本归一化、编辑距离、TF-IDF、n-gram 语言模型、POS 标注、NER——神经网络时代之前统治 NLP 的那套流水线。
  • 第 3 节 词嵌入与序列模型:Word2Vec、GloVe、FastText、RNN、LSTM、GRU、seq2seq 与注意力——从稀疏的词袋走向稠密的上下文表示。
  • 第 4 节 Transformer 与语言模型:自注意力、BERT、GPT、T5、位置编码(正弦、RoPE、ALiBi)、预训练目标(MLM、CLM)、微调与 PEFT、提示工程、缩放定律、MoE,以及 NLP 评测体系。
  • 第 5 节 高级文本生成:文本扩散(D3PM、MDLM)、OCR、RLHF 与 DPO 对齐、长上下文(稀疏/滑动窗口/环形注意力、RoPE 缩放、YaRN)、RAG、投机解码、SSM 与 Mamba、以及 GQA/MLA 等现代 LLM 架构创新。

学习路径

前置知识:本章假定你已经学过第 1 至 6 章。第 1 章的向量、内积和余弦相似度贯穿词嵌入、注意力打分和 TF-IDF 检索;第 2 章的矩阵运算是 Transformer、RNN 和所有线性投影的语言;第 3 章的链式法则是反向传播和策略梯度的灵魂;第 4 章的期望、最大似然和交叉熵直接出现在 n-gram 平滑、困惑度、KL 散度(DPO、知识蒸馏)和 HMM/CRF 中;第 5 章的概率分布、贝叶斯思想、信息论(PMI、熵)更是无处不在。尤其关键的是第 6 章里关于**注意力(attention)**和 Transformer 的部分——本章第 4、5 节大量直接引用它们,并在其上构建 BERT/GPT/T5、RoPE、GQA/MLA、MoE 等内容;第 6 章的 RL(PPO、策略梯度)是理解 RLHF 的前提,分布式训练(MoE、混合精度)则在第 5 节的现代架构中反复出现。

后续章节:本章是多个后续章节的基石。第 10 章多模态学习会大量复用本章的 Transformer、注意力、文本嵌入和 CLIP 式的双编码器来对齐图像与文本;第 17 章 AI 推理会深入 KV 缓存、GQA/MLA、投机解码、MoE 路由和长上下文部署——这些正是本章第 5 节的内容;第 9 章音频与语音会用到本章提到的音系学、CTC、CRNN,以及与文本语言模型紧密结合的语音识别/合成系统。可以说,不读懂本章,就难以真正读懂任何一个以语言为核心能力的现代 AI 系统。

关键概念速览

  • 注意力(attention):用查询、键、值(Q/K/V)让模型回看所有输入位置并加权聚合,\text{softmax}(QK^T/\sqrt{d_k})V,是 Transformer 的核心,也是 BERT、GPT、T5 共同的引擎。
  • 词嵌入(word embedding):把离散的词压缩成稠密的低维向量,让语义相似性变成几何上的邻近;Word2Vec 证明 v_{\text{king}} - v_{\text{man}} + v_{\text{woman}} \approx v_{\text{queen}}
  • 分词(tokenisation):把原始文本切成模型能处理的离散单元;子词方法(BPE、WordPiece、Unigram)在词级和字符级之间取得平衡,优雅地处理未登录词。
  • 缩放定律(scaling laws):损失随参数量、数据量和算力按幂律下降;Chinchilla 给出"每参数约 20 词元"的算力最优配比,解释了为什么大模型曾被严重训练不足。
  • RLHF / DPO:用人类偏好(哪个回答更好)对齐语言模型;RLHF 训练奖励模型再用 PPO 优化,DPO 则通过一个闭式解把奖励模型和 RL 训练坍缩成单步有监督损失。
  • MoE(混合专家):用门控网络为每个词元只激活少数几个专家 FFN,在不按比例增加计算量的情况下扩展参数容量,是 DeepSeek-V3、Mixtral、Llama 4 等前沿模型的主导架构。

作者与出处
原作者: HenryNdubuaku
来源:HenryNdubuaku
许可证:Apache-2.0
整理: 灏天文库整理
由灏天文库结构化整理,提供目录导航、全文检索与在线阅读,便于系统化学习
发布者: 作者: HenryNdubuaku 转发
评论区 (0)
U