第 3 章 微积分


文档摘要

第 3 章 微积分 如果说线性代数提供了数据的容器,那微积分就提供了「学习」本身的语言。神经网络的每一次权重更新、每一次损失下降,背后都是导数、梯度和优化在起作用。本章从单变量的极限与导数讲起,一路走到偏导数、梯度、泰勒级数和梯度下降,让你真正理解「模型是怎么学起来的」。 本章简介 微积分在机器学习里扮演三个相互衔接的角色。第一,导数即学习——训练本质上就是沿着损失函数的导数方向调整参数,导数为零的地方往往就是模型收敛的终点。第二,梯度即优化方向——当参数从一维扩展到数百万维,偏导数组成的梯度向量就指明了「往哪走、走多远」,它是梯度下降、Adam 等所有优化器的指南针。

第 3 章 微积分

如果说线性代数提供了数据的容器,那微积分就提供了「学习」本身的语言。神经网络的每一次权重更新、每一次损失下降,背后都是导数、梯度和优化在起作用。本章从单变量的极限与导数讲起,一路走到偏导数、梯度、泰勒级数和梯度下降,让你真正理解「模型是怎么学起来的」。

本章简介

微积分在机器学习里扮演三个相互衔接的角色。第一,导数即学习——训练本质上就是沿着损失函数的导数方向调整参数,导数为零的地方往往就是模型收敛的终点。第二,梯度即优化方向——当参数从一维扩展到数百万维,偏导数组成的梯度向量就指明了「往哪走、走多远」,它是梯度下降、Adam 等所有优化器的指南针。第三,积分即概率与连续建模——从概率密度的归一化、期望值的计算,到 ROC 曲线下面积,积分让我们能够处理连续型分布与累积量。本章会把这三条线索串起来:先用单变量微积分打好极限、导数与积分的地基,再推广到多元函数的梯度、雅可比与海森,最后用泰勒级数和牛顿法把这些工具收束到「如何逼近一个函数」「如何找到它的最小值」这两个机器学习的核心问题上。

本章小节

  • 微分:极限、导数、链式法则、求导法则、洛必达法则——理解「瞬时变化率」以及反向传播的数学根基。
  • 积分:定积分与不定积分、微积分基本定理、换元法、分部积分——把局部变化率累积回总量,是概率与期望的基础。
  • 多元微积分:偏导数、梯度、雅可比矩阵、海森矩阵、方向导数——把导数推广到数百万个参数的真实模型。
  • 函数逼近:泰勒级数、麦克劳林级数、傅里叶级数、多项式逼近——用简单函数替代复杂函数,也是万能逼近定理的理论舞台。
  • 优化:临界点、凸性、牛顿法、梯度下降、拉格朗日乘子、KKT 条件——模型训练的数学核心,找到让损失最小的参数。

学习路径

  • 前置知识:第 1 章(向量)和第 2 章(矩阵)是直接基础——梯度是向量,海森矩阵是矩阵,雅可比行列式刻画变换对空间的拉伸,这些都建立在线性代数之上。请先熟悉向量、点积、矩阵乘法、特征值与正定矩阵等概念。
  • 后续章节:本章是大量后续内容的支柱。梯度下降会在第 6 章(机器学习)里被大量使用,从线性回归、逻辑回归到深度网络的训练都离不开它;偏导数与链式法则是第 9 章(深度学习)反向传播的根基;泰勒展开与海森矩阵会在第 6 章的二阶优化方法中再次登场;积分则在第 6 章的概率模型和第 7 章的连续分布中反复出现。

关键概念速览

  • 导数(derivative):函数在某一点的瞬时变化率,几何上就是切线的斜率;导数为零处常常藏着极值。
  • 链式法则(chain rule):复合函数的导数等于各层导数的乘积,它是反向传播能在深度网络中逐层传播梯度的数学依据。
  • 梯度(gradient):由所有偏导数组成的向量,指向函数增长最快的方向;沿其反方向走就是梯度下降。
  • 海森矩阵(Hessian):二阶偏导数组成的方阵,刻画函数的曲率,用来判断临界点是极小、极大还是鞍点。
  • 泰勒级数(Taylor series):把函数在某点附近展开成多项式之和,阶数越高逼近越准,是牛顿法等二阶方法的基础。
  • 梯度下降(gradient descent):沿负梯度方向一步步更新参数以最小化损失,是 SGD、Adam 等现代优化器的共同祖先。
  • 拉格朗日乘子(Lagrange multiplier):处理带等式约束的优化问题,在最优点处目标函数与约束函数的梯度平行;KKT 条件是它对不等式约束的推广。

发布者: 作者: HenryNdubuaku 转发
评论区 (0)
U