第 6 章 机器学习 机器学习是整个 AI 领域的核心方法论——它让计算机从数据中自己学会规律,而不是被人一条条写死规则。本章从最朴素的朴素贝叶斯、决策树一路讲到深度学习里的 Transformer、强化学习里的 PPO/RLHF,再到把模型训到数千 GPU 上的分布式技术,让你既能看懂论文里的损失函数,也能理解 GPT 这类大模型是怎么被训练出来的。 本章简介 如果说前五章是数学的地基,那么本章就是在这块地基上盖起的整栋大楼。机器学习把线性代数、微积分、概率论和信息论这些工具拧成一股绳,去解决一个核心问题:怎样让模型从数据里学到有用的模式,并在新数据上泛化得足够好。 本章有五条主线。
机器学习是整个 AI 领域的核心方法论——它让计算机从数据中自己学会规律,而不是被人一条条写死规则。本章从最朴素的朴素贝叶斯、决策树一路讲到深度学习里的 Transformer、强化学习里的 PPO/RLHF,再到把模型训到数千 GPU 上的分布式技术,让你既能看懂论文里的损失函数,也能理解 GPT 这类大模型是怎么被训练出来的。
如果说前五章是数学的地基,那么本章就是在这块地基上盖起的整栋大楼。机器学习把线性代数、微积分、概率论和信息论这些工具拧成一股绳,去解决一个核心问题:怎样让模型从数据里学到有用的模式,并在新数据上泛化得足够好。
本章有五条主线。其一是经典机器学习:朴素贝叶斯、决策树、随机森林、SVM、k-means 和 GMM,它们靠解析解或启发式搜索,是理解"学习"这件事最直接的入口。其二是基于梯度的学习:线性/逻辑回归、SGD、Adam 等优化器、L1/L2 正则化和评估指标——这是此后所有神经网络共同的训练引擎。其三是深度学习:从 MLP、CNN、RNN/LSTM 到注意力、Transformer、ViT、自编码器和 VAE,深度网络靠层层堆叠的非线性构建出层次化的表示。其四是强化学习:MDP、Q-learning、策略梯度、actor-critic、PPO 以及让语言模型与人类对齐的 RLHF 和 DPO。其五是分布式训练:数据/模型/流水线/张量并行、混合精度、缩放定律和 MoE,是把模型推向 GPT 规模的工程根基。
前置知识:本章假定你已经学过第 1 至 5 章的数学基础。第 1 章的向量、内积和余弦相似度会出现在注意力和 SVM 的核函数里;第 2 章的矩阵运算、特征值是 MLP、CNN 和所有分布式并行的语言;第 3 章的链式法则是反向传播和策略梯度的灵魂;第 4 章的偏差-方差权衡、期望直接用于正则化和评估;第 5 章的概率分布、贝叶斯定理、交叉熵与 KL 散度更是贯穿几乎所有损失函数。
后续章节:本章是后面所有应用领域的共同地基。第 7 章 NLP 把 Transformer 和注意力用在语言模型上;第 8 章计算机视觉用 CNN 和 ViT 处理图像;第 9 章音频语音、第 10 章多模态、第 11 章自动驾驶、第 12 章图神经网络都建立在本章的模型和训练方法之上。可以说,不读懂本章,就难以真正读懂任何一个现代 AI 系统。