第 4 章 统计 微积分告诉我们函数如何变化,而统计告诉我们如何从数据中学习。从描述一个数据集的中心与离散度,到判断模型 A 是不是真的比模型 B 好,再到估计参数并给出误差范围,统计为机器学习的评估、推断与决策提供了全套语言。本章把分布、抽样、假设检验与统计推断串成一条完整的线索。 本章简介 统计学在机器学习里扮演四个相互衔接的角色。第一,描述数据——用均值、方差、分位数和相关系数把杂乱的原始观测浓缩成几个有意义的数字,这是探索性数据分析与特征工程的第一步。第二,从样本推断总体——我们永远只能看到一部分数据,抽样分布、标准误和中心极限定理让我们能够量化这种「以偏概全」的不确定性。第三,假设检验——模型 A 的准确率比模型 B 高了 1 个百分点,这是真实差异还是随机噪声?
微积分告诉我们函数如何变化,而统计告诉我们如何从数据中学习。从描述一个数据集的中心与离散度,到判断模型 A 是不是真的比模型 B 好,再到估计参数并给出误差范围,统计为机器学习的评估、推断与决策提供了全套语言。本章把分布、抽样、假设检验与统计推断串成一条完整的线索。
统计学在机器学习里扮演四个相互衔接的角色。第一,描述数据——用均值、方差、分位数和相关系数把杂乱的原始观测浓缩成几个有意义的数字,这是探索性数据分析与特征工程的第一步。第二,从样本推断总体——我们永远只能看到一部分数据,抽样分布、标准误和中心极限定理让我们能够量化这种「以偏概全」的不确定性。第三,假设检验——模型 A 的准确率比模型 B 高了 1 个百分点,这是真实差异还是随机噪声?p 值、t 检验、ANOVA 给出了一套严谨的是/否判断框架,A/B 测试与模型比较都建立其上。第四,参数估计与模型评估——置信区间告诉我们估计有多精确,极大似然估计(MLE)则几乎是所有监督学习算法背后「拟合参数」的统计原理。本章会按这条线索展开:先从随机变量、分布与矩这些描述工具讲起,再到抽样方法与中心极限定理,最后落到假设检验与统计推断,把每一块都与 ML 中的真实场景对应起来。