第 5 章 概率


文档摘要

第 5 章 概率 概率是机器学习在不确定性下做决策的语言。本章将从计数与公理出发,一路讲到分布、贝叶斯推断与信息论,让你理解模型如何在噪声与缺失中做出预测、如何量化"我有多确信"。掌握概率,你才真正具备阅读现代 ML 论文和调试损失函数的底子。 本章简介 概率论是机器学习的数学母语。现实世界的数据充满噪声、不完整和歧义,而概率论给了我们一套精确的工具来对这种不确定性建模——从描述单个事件发生的可能性,到刻画整个分布的形状。 在本章中你会看到三条主线。其一是概率的基本概念与分布:样本空间、条件概率、贝叶斯定理,以及伯努利、二项、泊松、高斯、指数、Beta、Dirichlet 等关键分布,它们既是噪声模型,也是先验和似然。

第 5 章 概率

概率是机器学习在不确定性下做决策的语言。本章将从计数与公理出发,一路讲到分布、贝叶斯推断与信息论,让你理解模型如何在噪声与缺失中做出预测、如何量化"我有多确信"。掌握概率,你才真正具备阅读现代 ML 论文和调试损失函数的底子。

本章简介

概率论是机器学习的数学母语。现实世界的数据充满噪声、不完整和歧义,而概率论给了我们一套精确的工具来对这种不确定性建模——从描述单个事件发生的可能性,到刻画整个分布的形状。

在本章中你会看到三条主线。其一是概率的基本概念与分布:样本空间、条件概率、贝叶斯定理,以及伯努利、二项、泊松、高斯、指数、Beta、Dirichlet 等关键分布,它们既是噪声模型,也是先验和似然。其二是贝叶斯方法:如何把先验信念与观测数据结合成后验分布,从极大似然估计(MLE)到最大后验估计(MAP),再到完全贝叶斯推断和 MCMC 采样。其三是信息论:熵、交叉熵、KL 散度与互信息——它们不只是抽象的度量,更是几乎所有分类损失函数、变分自编码器(VAE)目标和数据压缩方案的理论基础。

本章小节

  • 第 1 节 计数:乘法原理与加法原理、阶乘、排列、组合、二项式系数,以及容斥原理——计算概率之前必须先数清楚结果。
  • 第 2 节 概率的基本概念:样本空间、事件、概率公理、条件概率、独立性、贝叶斯定理,以及频率派与贝叶斯派两种诠释。
  • 第 3 节 概率分布:伯努利、二项、泊松、高斯、指数、Beta、Dirichlet 等离散与连续分布的公式、直觉与 ML 应用。
  • 第 4 节 贝叶斯方法与序列模型:先验、后验、似然、共轭先验、MLE 与 MAP、完全贝叶斯推断、MCMC,以及隐马尔可夫模型和 EM 算法。
  • 第 5 节 信息论:熵、自信息、交叉熵、KL 散度、互信息——损失函数与压缩的理论基石。

学习路径

前置知识:本章假定你已经学过第 1 至 4 章。第 1 章的线性代数(矩阵乘法、特征向量)会用在马尔可夫链的转移矩阵上;第 2-3 章的微积分(求导、积分、链式法则)会出现在 MLE 推导和微分熵中;第 4 章的随机变量、PMF、PDF、CDF、期望与方差等概念是本章分布内容的直接基础。

后续章节:本章为第 6 章机器学习打下地基——交叉熵损失、KL 散度正则化、最大似然与 MAP 都会在那里反复出现。第 7 章 NLP 则会把概率的链式法则用在语言模型上,把贝叶斯思想用在文本建模中。可以说,不读懂本章,就难以真正读懂任何一个现代 ML 模型的损失函数。

关键概念速览

  • 贝叶斯定理(Bayes' theorem)P(A|B) = \frac{P(B|A)P(A)}{P(B)},让你用新证据更新信念,是贝叶斯 ML 的核心。
  • 似然(likelihood) P(D|\theta):在参数 \theta 下观测到数据 D 的概率;MLE 找使它最大的 \theta
  • 共轭先验(conjugate prior):让后验与先验同属一个分布族(如 Beta 配伯努利),使贝叶斯更新有解析解。
  • 交叉熵(cross-entropy) H(p,q):用为 q 优化的编码编码 p 的平均比特数,是分类任务的标准损失。
  • KL 散度(KL divergence) D_{\text{KL}}(p\|q):衡量两个分布差异的非对称度量,恒非负,是变分推断和正则化的关键。
  • 熵(entropy) H(X):分布的不确定性或平均信息量,等概率时最大,也是压缩极限。

作者与出处
原作者: HenryNdubuaku
来源:HenryNdubuaku
许可证:Apache-2.0
整理: 灏天文库整理
由灏天文库结构化整理,提供目录导航、全文检索与在线阅读,便于系统化学习
发布者: 作者: HenryNdubuaku 转发
评论区 (0)
U