第 3 章 微积分 如果说线性代数提供了数据的容器,那微积分就提供了「学习」本身的语言。神经网络的每一次权重更新、每一次损失下降,背后都是导数、梯度和优化在起作用。本章从单变量的极限与导数讲起,一路走到偏导数、梯度、泰勒级数和梯度下降,让你真正理解「模型是怎么学起来的」。 本章简介 微积分在机器学习里扮演三个相互衔接的角色。第一,导数即学习——训练本质上就是沿着损失函数的导数方向调整参数,导数为零的地方往往就是模型收敛的终点。第二,梯度即优化方向——当参数从一维扩展到数百万维,偏导数组成的梯度向量就指明了「往哪走、走多远」,它是梯度下降、Adam 等所有优化器的指南针。
如果说线性代数提供了数据的容器,那微积分就提供了「学习」本身的语言。神经网络的每一次权重更新、每一次损失下降,背后都是导数、梯度和优化在起作用。本章从单变量的极限与导数讲起,一路走到偏导数、梯度、泰勒级数和梯度下降,让你真正理解「模型是怎么学起来的」。
微积分在机器学习里扮演三个相互衔接的角色。第一,导数即学习——训练本质上就是沿着损失函数的导数方向调整参数,导数为零的地方往往就是模型收敛的终点。第二,梯度即优化方向——当参数从一维扩展到数百万维,偏导数组成的梯度向量就指明了「往哪走、走多远」,它是梯度下降、Adam 等所有优化器的指南针。第三,积分即概率与连续建模——从概率密度的归一化、期望值的计算,到 ROC 曲线下面积,积分让我们能够处理连续型分布与累积量。本章会把这三条线索串起来:先用单变量微积分打好极限、导数与积分的地基,再推广到多元函数的梯度、雅可比与海森,最后用泰勒级数和牛顿法把这些工具收束到「如何逼近一个函数」「如何找到它的最小值」这两个机器学习的核心问题上。