5.5常用梯度恒等式


文档摘要

5.5 常用梯度恒等式 下面,我们列出了一些在机器学习环境中常用的梯度恒等式(Petersen and Pedersen,2012)。其中 $\text{tr}(\cdot)$ 代表矩阵的迹(见定义4.4),$\text{det}(\cdot)$ 表示矩阵的行列式(见 4.1 节),$\boldsymbol{f}(\boldsymbol{X})^{-1}$ 表示 $\boldsymbol{f}(\boldsymbol{X})$ 的逆(假设其存在)。

5.5 常用梯度恒等式

下面,我们列出了一些在机器学习环境中常用的梯度恒等式(Petersen and Pedersen,2012)。其中 \text{tr}(\cdot) 代表矩阵的迹(见定义4.4),\text{det}(\cdot) 表示矩阵的行列式(见 4.1 节),\boldsymbol{f}(\boldsymbol{X})^{-1} 表示 \boldsymbol{f}(\boldsymbol{X}) 的逆(假设其存在)。

\begin{align} \frac{ \partial }{ \partial \boldsymbol{X} } \boldsymbol{f}(\boldsymbol{X})^{\top} &= \left( \frac{ \partial \boldsymbol{f}(\boldsymbol{X}) }{ \partial \boldsymbol{X} } \right)^{\top}, \tag{5.99}\\[0.2em] \frac{ \partial }{ \partial \boldsymbol{X} } \text{tr}\big[ \boldsymbol{f}(\boldsymbol{X}) \big] &= \text{tr}\left[ \frac{ \partial \boldsymbol{f}(\boldsymbol{X}) }{ \partial \boldsymbol{X} } \right], \tag{5.100}\\[0.2em] \frac{ \partial }{ \partial \boldsymbol{X} } \det \big[ \boldsymbol{f}(\boldsymbol{X}) \big] &= \det \big[ \boldsymbol{f}(\boldsymbol{X}) \big] \text{tr}\left[ \boldsymbol{f}(\boldsymbol{X})^{-1} \frac{ \partial \boldsymbol{f}(\boldsymbol{X}) }{ \partial \boldsymbol{X} } \right], \tag{5.101}\\[0.2em] \frac{ \partial }{ \partial \boldsymbol{X} } \boldsymbol{f}(\boldsymbol{X})^{-1} &= -\boldsymbol{f}(\boldsymbol{X})^{-1} \left[ \frac{ \partial \boldsymbol{f}(\boldsymbol{X}) }{ \partial \boldsymbol{X} } \right]\boldsymbol{f}(\boldsymbol{X})^{-1} \tag{5.102}\\[0.2em] \frac{ \partial \boldsymbol{a}^{\top}\boldsymbol{X}^{-1}\boldsymbol{b} }{ \partial \boldsymbol{X} } &= -(\boldsymbol{X}^{-1})^{\top}\boldsymbol{a}\boldsymbol{b}^{\top}(\boldsymbol{X}^{-1})^{\top}\tag{5.103}\\[0.2em] \frac{ \partial \boldsymbol{x}^{\top}\boldsymbol{a} }{ \partial \boldsymbol{x} } &= \boldsymbol{a}^{\top}\tag{5.104}\\[0.2em] \frac{ \partial \boldsymbol{a}^{\top}\boldsymbol{x} }{ \partial \boldsymbol{x} } &= \boldsymbol{a}^{\top}\tag{5.105}\\[0.2em] \frac{ \partial \boldsymbol{a}^{\top}\boldsymbol{X}\boldsymbol{b} }{ \partial \boldsymbol{X} } &= \boldsymbol{a}\boldsymbol{b}^{\top} \tag{5.106}\\[0.2em] \frac{ \partial \boldsymbol{x}^{\top}\boldsymbol{B}\boldsymbol{x} }{ \partial \boldsymbol{x} } &= \boldsymbol{x}^{\top}(\boldsymbol{B} + \boldsymbol{B}^{\top})\tag{5.107}\\[0.2em] \frac{ \partial }{ \partial \boldsymbol{s} } (\boldsymbol{x} - \boldsymbol{A}\boldsymbol{s})^{\top}\boldsymbol{W}(\boldsymbol{x} - \boldsymbol{A}\boldsymbol{s}) &= -2(\boldsymbol{x} - \boldsymbol{A}\boldsymbol{s})^{\top}\boldsymbol{W}\boldsymbol{A}, \tag{5.108}\\[0.2em] & \quad \quad \text{for symmetric }\boldsymbol{W} \end{align}

注:本书中我们仅讨论矩阵的迹和转置。然而,我们已看到求导的结果可能是高维张量,通常的迹和转置在其范畴中没有定义。在这些情况下,形状为 D×D×E×F 的张量的迹将是一个 E×F 形状的矩阵。这是 张量缩并(tensor contraction) 的一种特殊情况。类似地,当我们“转置”一个张量时,我们说的是交换前两个维度。具体而言,在(5.99)到(5.102)中,当我们计算多元函数 \boldsymbol{f}(\cdot) 对矩阵的导数时,我们需要张量相关的计算,而像在 5.4 节中那样将其拉直成向量。


作者与出处
原作者: Datawhale
来源:Datawhale
许可证:CC BY-SA 4.0
整理: 灏天文库整理
由灏天文库结构化整理,提供目录导航、全文检索与在线阅读,便于系统化学习
发布者: 作者: Datawhale 转发
评论区 (0)
U