第 4 章 统计


文档摘要

第 4 章 统计 微积分告诉我们函数如何变化,而统计告诉我们如何从数据中学习。从描述一个数据集的中心与离散度,到判断模型 A 是不是真的比模型 B 好,再到估计参数并给出误差范围,统计为机器学习的评估、推断与决策提供了全套语言。本章把分布、抽样、假设检验与统计推断串成一条完整的线索。 本章简介 统计学在机器学习里扮演四个相互衔接的角色。第一,描述数据——用均值、方差、分位数和相关系数把杂乱的原始观测浓缩成几个有意义的数字,这是探索性数据分析与特征工程的第一步。第二,从样本推断总体——我们永远只能看到一部分数据,抽样分布、标准误和中心极限定理让我们能够量化这种「以偏概全」的不确定性。第三,假设检验——模型 A 的准确率比模型 B 高了 1 个百分点,这是真实差异还是随机噪声?

第 4 章 统计

微积分告诉我们函数如何变化,而统计告诉我们如何从数据中学习。从描述一个数据集的中心与离散度,到判断模型 A 是不是真的比模型 B 好,再到估计参数并给出误差范围,统计为机器学习的评估、推断与决策提供了全套语言。本章把分布、抽样、假设检验与统计推断串成一条完整的线索。

本章简介

统计学在机器学习里扮演四个相互衔接的角色。第一,描述数据——用均值、方差、分位数和相关系数把杂乱的原始观测浓缩成几个有意义的数字,这是探索性数据分析与特征工程的第一步。第二,从样本推断总体——我们永远只能看到一部分数据,抽样分布、标准误和中心极限定理让我们能够量化这种「以偏概全」的不确定性。第三,假设检验——模型 A 的准确率比模型 B 高了 1 个百分点,这是真实差异还是随机噪声?p 值、t 检验、ANOVA 给出了一套严谨的是/否判断框架,A/B 测试与模型比较都建立其上。第四,参数估计与模型评估——置信区间告诉我们估计有多精确,极大似然估计(MLE)则几乎是所有监督学习算法背后「拟合参数」的统计原理。本章会按这条线索展开:先从随机变量、分布与矩这些描述工具讲起,再到抽样方法与中心极限定理,最后落到假设检验与统计推断,把每一块都与 ML 中的真实场景对应起来。

本章小节

  • 统计基础:随机变量、分布、PMF/PDF/CDF、期望、矩、方差、偏度与峰度——理解「数据长什么样」的全部基本语言。
  • 统计度量:离散度、四分位数与 IQR、z 分数、皮尔逊与斯皮尔曼相关、几何平均与指数移动平均、离群点检测——探索性数据分析与特征缩放的工具箱。
  • 抽样:概率与非概率抽样方法、抽样分布、标准误、中心极限定理——决定数据质量、支撑训练/测试集划分的理论根基。
  • 假设检验:原假设与备择假设、p 值、显著性水平、z 检验与 t 检验、ANOVA、卡方检验、第一类/第二类错误——判断效应真伪的严谨框架。
  • 统计推断:置信区间、功效分析、蒙特卡洛方法、因子分析、实验设计——带着可量化的不确定性去估计参数与规划实验。

学习路径

  • 前置知识:第 1 章(向量)和第 2 章(矩阵)提供数据容器与运算——相关系数本质上是去均值向量的余弦相似度,因子分析与协方差矩阵的 SVD、特征值分解一脉相承。第 3 章(微积分)则是必要基础——期望与方差离不开求和与积分,PDF 的归一化、蒙特卡洛估计 \pi 都建立在积分之上。请先熟悉向量点积、矩阵分解、定积分与极限等概念。
  • 后续章节:本章是连接数学基础与机器学习之间的关键一环。中心极限定理、置信区间和假设检验会在第 6 章(机器学习)的模型评估与比较中反复出现;极大似然估计是线性回归、逻辑回归等模型训练的统计原理,并将在第 5 章(概率)里与贝叶斯视角的最大后验估计(MAP)合流;抽样方法与自助法是第 6 章交叉验证、集成方法的数据基础;蒙特卡洛方法则贯穿后续强化学习的策略梯度与贝叶斯深度学习的不确定性估计。

关键概念速览

  • 期望(expectation):随机变量取值的概率加权平均,是分布的「重心」;期望的线性性 E[aX+b]=aE[X]+b 是 ML 损失函数推导中反复用到的性质。
  • 方差与标准差(variance / standard deviation):方差是到均值的平均平方距离,标准差把它开方回原始单位;二者刻画数据围绕中心有多分散。
  • 中心极限定理(central limit theorem,CLT):无论原始总体是什么形状,样本均值的分布都随样本量增大而逼近正态——这是绝大多数推断性统计得以成立的根基。
  • p 值(p-value):在原假设为真的前提下观测到至少同样极端结果的概率;p 值越小,数据越难以用「纯属偶然」来解释。
  • 置信区间(confidence interval):给点估计包上一层误差范围,长期重复实验中约有设定比例的区间会包含真实参数,反映了估计的不确定性。
  • 极大似然估计(MLE):选择让已观测数据出现概率最大的参数值,是绝大多数监督学习模型「拟合参数」背后的统计原理。

发布者: 作者: HenryNdubuaku 转发
评论区 (0)
U