第 5 章 概率 概率是机器学习在不确定性下做决策的语言。本章将从计数与公理出发,一路讲到分布、贝叶斯推断与信息论,让你理解模型如何在噪声与缺失中做出预测、如何量化"我有多确信"。掌握概率,你才真正具备阅读现代 ML 论文和调试损失函数的底子。 本章简介 概率论是机器学习的数学母语。现实世界的数据充满噪声、不完整和歧义,而概率论给了我们一套精确的工具来对这种不确定性建模——从描述单个事件发生的可能性,到刻画整个分布的形状。 在本章中你会看到三条主线。其一是概率的基本概念与分布:样本空间、条件概率、贝叶斯定理,以及伯努利、二项、泊松、高斯、指数、Beta、Dirichlet 等关键分布,它们既是噪声模型,也是先验和似然。
概率是机器学习在不确定性下做决策的语言。本章将从计数与公理出发,一路讲到分布、贝叶斯推断与信息论,让你理解模型如何在噪声与缺失中做出预测、如何量化"我有多确信"。掌握概率,你才真正具备阅读现代 ML 论文和调试损失函数的底子。
概率论是机器学习的数学母语。现实世界的数据充满噪声、不完整和歧义,而概率论给了我们一套精确的工具来对这种不确定性建模——从描述单个事件发生的可能性,到刻画整个分布的形状。
在本章中你会看到三条主线。其一是概率的基本概念与分布:样本空间、条件概率、贝叶斯定理,以及伯努利、二项、泊松、高斯、指数、Beta、Dirichlet 等关键分布,它们既是噪声模型,也是先验和似然。其二是贝叶斯方法:如何把先验信念与观测数据结合成后验分布,从极大似然估计(MLE)到最大后验估计(MAP),再到完全贝叶斯推断和 MCMC 采样。其三是信息论:熵、交叉熵、KL 散度与互信息——它们不只是抽象的度量,更是几乎所有分类损失函数、变分自编码器(VAE)目标和数据压缩方案的理论基础。
前置知识:本章假定你已经学过第 1 至 4 章。第 1 章的线性代数(矩阵乘法、特征向量)会用在马尔可夫链的转移矩阵上;第 2-3 章的微积分(求导、积分、链式法则)会出现在 MLE 推导和微分熵中;第 4 章的随机变量、PMF、PDF、CDF、期望与方差等概念是本章分布内容的直接基础。
后续章节:本章为第 6 章机器学习打下地基——交叉熵损失、KL 散度正则化、最大似然与 MAP 都会在那里反复出现。第 7 章 NLP 则会把概率的链式法则用在语言模型上,把贝叶斯思想用在文本建模中。可以说,不读懂本章,就难以真正读懂任何一个现代 ML 模型的损失函数。