第 2 章 矩阵


文档摘要

第 2 章 矩阵 如果说向量是机器学习的字母,那矩阵就是它的语法。从一次前向传播、一次梯度更新,到 PCA 降维、图像压缩、推荐系统,几乎所有运算都落在矩阵上。本章从矩阵最基本的性质讲起,一路走到线性变换与各种分解,让你真正理解「神经网络层到底在做什么」。 本章简介 矩阵之所以是线性代数的主角,是因为它同时承担两重身份:一方面,它是承载数据的容器——一行一个样本、一列一个特征,整个数据集就是一张表;另一方面,它又是变换的编码——一次矩阵乘法就是一次旋转、缩放、反射或投影。理解矩阵,就是把「数据」和「运算」这两种视角叠在一起:同一个矩阵既可以是你要处理的数据,也可以是你施加在数据上的动作。

第 2 章 矩阵

如果说向量是机器学习的字母,那矩阵就是它的语法。从一次前向传播、一次梯度更新,到 PCA 降维、图像压缩、推荐系统,几乎所有运算都落在矩阵上。本章从矩阵最基本的性质讲起,一路走到线性变换与各种分解,让你真正理解「神经网络层到底在做什么」。

本章简介

矩阵之所以是线性代数的主角,是因为它同时承担两重身份:一方面,它是承载数据的容器——一行一个样本、一列一个特征,整个数据集就是一张表;另一方面,它又是变换的编码——一次矩阵乘法就是一次旋转、缩放、反射或投影。理解矩阵,就是把「数据」和「运算」这两种视角叠在一起:同一个矩阵既可以是你要处理的数据,也可以是你施加在数据上的动作。本章会带你建立这套双重视角,并把它们与神经网络层(A\mathbf{x}+\mathbf{b})、SVD 压缩、PCA 降维等真实场景连接起来。

本章小节

  • 矩阵的性质:转置、迹、秩、行列式、逆、条件数、范数、正定性——刻画一个矩阵「做什么」的基本量。
  • 矩阵的类型:单位阵、对角阵、对称阵、正交阵、稀疏阵、Toeplitz、循环阵、Hermitian、置换阵——特殊结构带来计算捷径与数学保证。
  • 矩阵运算:矩阵乘法、Hadamard 积、外积、线性方程组、伪逆——每一次前向传播和梯度更新背后的引擎。
  • 线性变换:旋转、反射、缩放、剪切、仿射变换、齐次坐标——把矩阵看成几何动作,理解神经网络层如何重塑特征。
  • 矩阵分解:高斯消元、LU、Cholesky、特征值分解、QR、SVD、PCA、NMF——求解方程组、压缩数据、降维的算法基石。

学习路径

  • 前置知识:第 1 章(向量)是直接基础——矩阵是一摞向量,矩阵乘法是向量点积的批量版。请先熟悉向量、点积、线性无关与基。
  • 后续章节:本章是后续大量内容的支柱。矩阵运算与范数会在第 3 章(微积分、优化)中用于梯度与损失;特征值分解与 SVD 是第 6 章(机器学习)里 PCA、协方差分析的核心;线性变换与仿射变换是第 8 章(计算机视觉)卷积、几何变换的基础;稀疏与图矩阵会在第 12 章(图神经网络)再次登场。

关键概念速览

  • 矩阵乘法(matrix multiplication):把 A 的行与 B 的列做点积,是神经网络每一层的核心运算 A\mathbf{x}+\mathbf{b}
  • 行列式(determinant):单一标量,刻画矩阵对空间的缩放因子;为零意味着空间被压扁、信息丢失、矩阵不可逆。
  • 秩(rank):线性无关行(或列)的个数,衡量矩阵携带多少「有用信息」。
  • 特征值与特征向量(eigenvalue / eigenvector):变换中只被缩放、不旋转的特殊方向及其缩放因子,是 PCA 和稳定性分析的基础。
  • 奇异值分解(SVD):把任意矩阵拆成「旋转—缩放—旋转」,支持低秩近似与伪逆,是 ML 中最重要的分解。
  • 正定矩阵(positive definite matrix):满足 \mathbf{x}^T A \mathbf{x} > 0 的对称矩阵,保证优化问题有唯一最小值,协方差矩阵都属于此类。

发布者: 作者: HenryNdubuaku 转发
评论区 (0)
U