第 6 章 机器学习


文档摘要

第 6 章 机器学习 机器学习是整个 AI 领域的核心方法论——它让计算机从数据中自己学会规律,而不是被人一条条写死规则。本章从最朴素的朴素贝叶斯、决策树一路讲到深度学习里的 Transformer、强化学习里的 PPO/RLHF,再到把模型训到数千 GPU 上的分布式技术,让你既能看懂论文里的损失函数,也能理解 GPT 这类大模型是怎么被训练出来的。 本章简介 如果说前五章是数学的地基,那么本章就是在这块地基上盖起的整栋大楼。机器学习把线性代数、微积分、概率论和信息论这些工具拧成一股绳,去解决一个核心问题:怎样让模型从数据里学到有用的模式,并在新数据上泛化得足够好。 本章有五条主线。

第 6 章 机器学习

机器学习是整个 AI 领域的核心方法论——它让计算机从数据中自己学会规律,而不是被人一条条写死规则。本章从最朴素的朴素贝叶斯、决策树一路讲到深度学习里的 Transformer、强化学习里的 PPO/RLHF,再到把模型训到数千 GPU 上的分布式技术,让你既能看懂论文里的损失函数,也能理解 GPT 这类大模型是怎么被训练出来的。

本章简介

如果说前五章是数学的地基,那么本章就是在这块地基上盖起的整栋大楼。机器学习把线性代数、微积分、概率论和信息论这些工具拧成一股绳,去解决一个核心问题:怎样让模型从数据里学到有用的模式,并在新数据上泛化得足够好。

本章有五条主线。其一是经典机器学习:朴素贝叶斯、决策树、随机森林、SVM、k-means 和 GMM,它们靠解析解或启发式搜索,是理解"学习"这件事最直接的入口。其二是基于梯度的学习:线性/逻辑回归、SGD、Adam 等优化器、L1/L2 正则化和评估指标——这是此后所有神经网络共同的训练引擎。其三是深度学习:从 MLP、CNN、RNN/LSTM 到注意力、Transformer、ViT、自编码器和 VAE,深度网络靠层层堆叠的非线性构建出层次化的表示。其四是强化学习:MDP、Q-learning、策略梯度、actor-critic、PPO 以及让语言模型与人类对齐的 RLHF 和 DPO。其五是分布式训练:数据/模型/流水线/张量并行、混合精度、缩放定律和 MoE,是把模型推向 GPT 规模的工程根基。

本章小节

  • 第 1 节 经典机器学习:朴素贝叶斯、决策树、随机森林、SVM、k-means 聚类和 GMM——靠解析解或启发式工作的传统算法,是理解"从数据中学习"的起点。
  • 第 2 节 基于梯度的机器学习:线性/逻辑回归、SGD、Adam、损失函数、L1/L2 正则化和评估指标——所有神经网络背后的训练引擎。
  • 第 3 节 深度学习:MLP、CNN、RNN、LSTM、注意力、Transformer、ViT、自编码器和 VAE——用堆叠的非线性层构建层次化表示。
  • 第 4 节 强化学习:MDP、Q-learning、策略梯度、actor-critic、PPO、RLHF 和 DPO——通过试错最大化累积奖励,也是语言模型对齐的框架。
  • 第 5 节 分布式深度学习:数据/模型/流水线/张量并行、混合精度、缩放定律和 MoE——把模型训练扩展到数千 GPU 的工程基石。

学习路径

前置知识:本章假定你已经学过第 1 至 5 章的数学基础。第 1 章的向量、内积和余弦相似度会出现在注意力和 SVM 的核函数里;第 2 章的矩阵运算、特征值是 MLP、CNN 和所有分布式并行的语言;第 3 章的链式法则是反向传播和策略梯度的灵魂;第 4 章的偏差-方差权衡、期望直接用于正则化和评估;第 5 章的概率分布、贝叶斯定理、交叉熵与 KL 散度更是贯穿几乎所有损失函数。

后续章节:本章是后面所有应用领域的共同地基。第 7 章 NLP 把 Transformer 和注意力用在语言模型上;第 8 章计算机视觉用 CNN 和 ViT 处理图像;第 9 章音频语音、第 10 章多模态、第 11 章自动驾驶、第 12 章图神经网络都建立在本章的模型和训练方法之上。可以说,不读懂本章,就难以真正读懂任何一个现代 AI 系统。

关键概念速览

  • 梯度下降(gradient descent):沿着损失曲面的负梯度方向小步下山,w \leftarrow w - \eta \nabla \mathcal{L},是几乎所有参数学习的核心更新规则。
  • 反向传播(backpropagation):把链式法则系统地应用在计算图上,高效计算损失对每个参数的梯度,代价约为一次前向传播的两倍。
  • 注意力(attention):用查询、键、值(Q/K/V)让模型回看所有输入位置并加权聚合,\text{softmax}(QK^T/\sqrt{d_k})V,是 Transformer 的核心。
  • 正则化(regularisation):通过 L1/L2 等惩罚项约束模型复杂度,L2 把权重整体收缩、L1 鼓励稀疏,从而抑制过拟合。
  • PPO:带裁剪代理目标的策略梯度算法,更新小而稳,是 RLHF 训练 ChatGPT 式模型的业界标准。
  • 缩放定律(scaling laws):损失随参数量、数据量和算力按幂律下降,Chinchilla 给出"每参数约 20 词元"的算力最优配比。

作者与出处
原作者: HenryNdubuaku
来源:HenryNdubuaku
许可证:Apache-2.0
整理: 灏天文库整理
由灏天文库结构化整理,提供目录导航、全文检索与在线阅读,便于系统化学习
发布者: 作者: HenryNdubuaku 转发
评论区 (0)
U