正则化方法概述 参数范数正则化 正则化方法概述 数据集 训练集(Trainingset):用于模型拟合的数据样本 验证集(Validation set):是模型训练过程中单独留出的样本集,它可以用于调整模型的超参数和用于对模型的能力进行初步评估,例如SVM中参数c和核函数的选择,或者选择网络结构 测试集(Testset):用来评估模最终模型的泛化能力,但不能作为调参、选择特征等算法相关的选择的依据 过拟合 过拟合是指模型能很好地拟合训练样本,而无法很好地拟合测试样本的现象,从而导致泛化性能下降;为防止“过拟合”,可以选择减少参数、降低模型复杂度、正则化等。 欠拟合 欠拟合是指模型还没有很好地训练出数据的一般规律,模型拟合程度不高的现象;
训练集(Trainingset):用于模型拟合的数据样本
验证集(Validation set):是模型训练过程中单独留出的样本集,它可以用于调整模型的超参数和用于对模型的能力进行初步评估,例如SVM中参数c和核函数的选择,或者选择网络结构
测试集(Testset):用来评估模最终模型的泛化能力,但不能作为调参、选择特征等算法相关的选择的依据
过拟合是指模型能很好地拟合训练样本,而无法很好地拟合测试样本的现象,从而导致泛化性能下降;为防止“过拟合”,可以选择减少参数、降低模型复杂度、正则化等。
欠拟合是指模型还没有很好地训练出数据的一般规律,模型拟合程度不高的现象;为防止“欠拟合”,可以选择调整参数、增加迭代深度、换用更加复杂的模型等。
偏差(bias):反映了模型在样本上的期望输出与真实标记之间的差距,即模型本身的精准度,反映的是模型本身的拟合能力。
方差(variance):反映了模型在不同训练数据集下学得的函数的输出与期望输出之间的误差,即模型的稳定性,反应的是模型的波动情况。
泛化误差(Generalization Error):度量训练所得模型在总体数据上得到的预估值和标签值偏离程度的期望。
举例说明
深度学习一般步骤
下面我们引出正则化的概念,首先我们要明白什么是一个好的模型,基本要求就是在训练数据上表现好,但往往我们也希望它能在其他数据上也有很好的表现,也就是泛化性。
机器学习中,很多时候都需要衡量一个向量的大小,此时便需要用到范数的知识。
范数是将向量映射到非负值的函数,它满足三条性质:
L_p 范数是使用最为广泛的一种范数,定义为 \|\boldsymbol{x}\|_{\boldsymbol{p}}=(\sum_i |x_i|^p)^{1/p},当 p = 2 时该范数等价于向量和原点的欧几里得距离。有时候也需要衡量矩阵的大小,在深度学习中,最常见的做法便是使用Frobenius范数(F范数),即 \|\boldsymbol{x}\|_{\boldsymbol{F}} = \sqrt{\sum_{i, j} A_{i j}^{2}}.
通过简单地在损失函数 J() 后添加一个参数范数正则化项 \Omega(\theta),来限制模型的学习能力,正则化后的损失函数可表示为 \tilde{J}:
其中, \alpha 是正则项系数,它是一个超参,用来权衡惩罚项 Ω 对损失函数的贡献。若 α 为0,表示无正则化;α 越大,正则化惩罚越大。
我们希望正则化后的训练误差(第一项)最小,又希望模型尽量简单(第二项)。
当最小化正则化后的损失函数时候,同时降低原有损失函数 J()和正则化项 \Omega(\theta) 的值,一定程度减少了过拟合的程度。通俗来说,正则化就是让参数,如权重w多几个等于0,或 者接近于0,说明该节点影响很小,如果是神经网络相当于 在神经网络中删掉了一些节点,这样模型就变简单了。
L2正则化主要用于线性回归,又称为岭回归(Ridge Regression) 或权重衰减(Weight decay),添加的正则化项形式如下:
损失函数:
L2参数正则化分析(单步)
对于某一模型,假设要对其所有的参数进行参数正则化,则正则化后的整体损失函数 \tilde{J} 为 \tilde{J}(\boldsymbol{\theta} ; \mathbf{X}, \mathbf{y})=\mathrm{J}(\boldsymbol{\theta} ; \mathbf{X}, \mathbf{y})+ \frac{\alpha}{2}\|\mathbf{w}\|_{2}^{2}.
计算梯度得 \nabla_{\mathbf{w}} \tilde{J}(\boldsymbol{w} ; \boldsymbol{X}, \boldsymbol{y})=\nabla_{\mathbf{w}} J(\boldsymbol{w} ; \boldsymbol{X}, \boldsymbol{y})+\alpha w.
使用单步梯度下降更新权重:
在进行每步梯度更新前,先对参数 w 进行了缩放。因此,这也是权重衰减名称的来源。
L2参数正则化分析(整个训练过程)
我们先记未正则化的损失函数 $ 得到的最小损失权重向量为 \mathbf{w}^{}=\operatorname{argmin}_{\boldsymbol{w}} J(\boldsymbol{w}). 在 w^ 附近对损失函数做二次近似,近似的 \tilde{J}(w)$ 如下:
\nabla_{\mathbf{w}} \hat{J}(\boldsymbol{w})= \alpha
\tilde{w}+
\boldsymbol{H}\left(\tilde{\boldsymbol{w}}-\boldsymbol{w}^{*}\right)=0
\tilde{w} = (H + \alpha I)^{-1}Hw^*
\tilde{\mathbf{w}}=Q(\Lambda+\alpha I)^{-1} \Lambda Q^{T} \mathbf{w}^{*}
(\Lambda+\alpha I)^{-1} \Lambda=\left[\begin{array}{cccc}\frac{\lambda_{1}}{\lambda_{1}+\alpha} & 0 & \cdots & 0 \ 0 & \frac{\lambda_{2}}{\lambda_{2}+\alpha} & \cdots & 0 \ \vdots & \vdots & \ddots & \vdots \ 0 & 0 & \cdots & \frac{\lambda_{n}}{\lambda_{n}+\alpha}\end{array}\right]
\tilde{J}(\boldsymbol{\theta} ; \mathbf{X}, \mathbf{y})=\mathrm{J}(\boldsymbol{\theta} ; \mathbf{X}, \mathbf{y})+ \alpha |w|_1
\nabla_{\mathbf{w}} \tilde{J}(\boldsymbol{w} ; \boldsymbol{X}, \boldsymbol{y})=\nabla_{\mathbf{w}} J(\boldsymbol{w} ; \boldsymbol{X}, \boldsymbol{y})+\alpha \cdot \operatorname{sign}(\boldsymbol{w})
\mathbf{w}^{\star}=\operatorname{argmin}_{w} J(\boldsymbol{w})
\hat{J}(\mathbf{w})=J\left(\mathbf{w}^{}\right)+\frac{1}{2}\left(\mathbf{w}-\mathbf{w}^{}\right)^{T} \boldsymbol{H}\left(\mathbf{w}-\mathbf{w}^{*}\right)
\nabla_{\mathbf{w}} \hat{J}(\boldsymbol{w})=
\boldsymbol{H}\left(\boldsymbol{w}-\boldsymbol{w}^{*}\right)=0
\tilde{J}(\boldsymbol{w})=J\left(\boldsymbol{w}^{}\right)+\sum_{i}\left[\frac{1}{2} H_{i, i}\left(w_{i}-w_{i}^{}\right)^{2}+\alpha\left|w_{i}\right|\right]
\widetilde{w_{i}}=\operatorname{sign}\left(w_{i}^{}\right) \max \left{\left|w_{i}^{}\right|-\frac{\alpha}{H_{i, i}}, 0\right}
\begin{array}{l}\underset{\boldsymbol{w}}{\operatorname{argmax}} p(\boldsymbol{w} \mid X)=\underset{\boldsymbol{w}}{\operatorname{argmax}} \frac{p(X \mid \boldsymbol{w}) p(\boldsymbol{w})}{p(X)}=\underset{\boldsymbol{w}}{\operatorname{argmax}} p(X \mid \boldsymbol{w}) p(\boldsymbol{w}) =\underset{\boldsymbol{w}}{\operatorname{argmax}}\left(\prod_{i=1}^{n} p\left(x_{i} \mid \boldsymbol{w}\right)\right) p(\boldsymbol{w}) \ \operatorname{argmax}_{\boldsymbol{w}} L(\boldsymbol{w})=\prod_{i=1}^{n} \frac{1}{\sigma \sqrt{2 \pi}} \exp \left(\frac{\left(\boldsymbol{y}_{i}-\boldsymbol{w}^{T} \boldsymbol{x}_{i}\right)^{2}}{2 \sigma^{2}}\right) \prod_{j=1}^{d} \frac{1}{\tau \sqrt{2 \pi}} \exp \left(\frac{\left(\boldsymbol{w}_{j}\right)^{2}}{2 \tau^{2}}\right) \ \operatorname{argmax}_{\boldsymbol{w}} L^{\prime}(\boldsymbol{w})=\ln \prod_{i=1}^{n} \frac{1}{\sigma \sqrt{2 \pi}} \exp \left(-\frac{\left(\boldsymbol{y}_{i}-\boldsymbol{w}^{T} \boldsymbol{x}_{i}\right)^{2}}{2 \sigma^{2}}\right) \prod_{j=1}^{d} \frac{1}{\tau \sqrt{2 \pi}} \exp \left(-\frac{\left(\boldsymbol{w}_{j}\right)^{2}}{2 \tau^{2}}\right) \ =-\frac{1}{2 \sigma^{2}} \sum_{i=1}^{n}\left(\boldsymbol{y}_{i}-\boldsymbol{w}^{T} \boldsymbol{x}_{i}\right)^{2}-\frac{1}{2 \tau^{2}} \sum_{i=1}^{d}\left(\boldsymbol{w}_{j}\right)^{2}+\cdots\end{array}
\min {B, \alpha{i}} \sum_{i=1}^{m}\left|x_{i}-B \alpha_{i}\right|{2}^{2}+\lambda \sum{i=1}^{m}\left|\alpha_{i}\right|_{1}