什么是梯度裁剪

最新推荐文章于 2024-03-03 19:15:33 发布

鸾镜朱颜暗换

最新推荐文章于 2024-03-03 19:15:33 发布

阅读量1.6w

点赞数 24

分类专栏： python 文章标签：神经网络深度学习人工智能机器学习 python

原文链接：https://towardsdatascience.com/what-is-gradient-clipping-b8e815cdfb48

版权

python 专栏收录该内容

62 篇文章 11 订阅

订阅专栏

本文翻译自What is Gradient Clipping?，如有不妥私信联系删除。

文章目录

什么是梯度裁剪

什么是梯度裁剪

——解决梯度爆炸的一种简单高效的方法

循环神经网络（RNN）通过利用过去输入的隐藏状态（这些状态存储了数据的信息）得以在序贯数据上表现的非常好：t时刻隐藏状态的取值不仅取决于t时刻的输入，而和t时刻之前的取值相关。这种强大的架构在训练时却存在两个问题：梯度爆炸和梯度消失。本文将介绍梯度裁剪这一处理梯度爆炸问题的有效方法。

梯度爆炸和梯度消失背后的直观原因

梯度爆炸是指在模型训练过程中梯度会变得太大而使得模型不稳定的问题；与之相似，梯度消失指模型训练过程中梯度太小使得训练过程无法继续的现象。两者阻止了神经网络参数的更新，以致不能从训练数据中得到稳定的模型。下面将以不严谨然而充分的讨论来是我们得到梯度爆炸哦和梯度消失的直观原因。
通过bp训练一个RNN时，意味着我们通过在每个时间段（每一步）都复制一份网络来展开RNN网络，并将展开后的网络视为一个多层前馈神经网络，显然层数与时间步数相同。然后考虑到权重共享，我们在展开的网络上进行bp:

这里的W指递归（循环？）的的权重矩阵。可以看出损失函数的梯度由 $\mathbf{W}^T$ 的n个拷贝相乘构成，n指时间步数即该前馈神经网络的层数。而矩阵的多次相乘正是导致梯度爆炸/消失的罪魁祸首。
举一个简单的例子， $a\neq 1$ ， $a^n$ 指数变化。考虑 $n = 30$ ，则有 $1.1^n\approx 17.45$ 以及 $0.9^n\approx 0.042$ ，这里取n为30是考虑了实际情况：在NLP（自然语言处理）中，一个包含30个字词的句子是十分常见的，此外在许多分析中取30天的数据也十分常见。这个例子与 $(\mathbf{W}^T)^n$ 的情形是类似的——最容易理解的方式是考虑 $\mathbf{W}^T$ 是可对角化的，则将其对角化后做幂运算可以清晰看出与上述例子的一致性。
如果想查看严密的论证，推荐阅读文献[2]

梯度裁剪

梯度裁剪是解决梯度爆炸的一种技术，其出发点是非常简明的：如果梯度变得非常大，那么我们就调节它使其保持较小的状态。精确的说，如果 $\parallel{\mathbf{g}}\parallel \geq c$ ，则

$\mathbf{g}\leftarrow c \cdot \mathbf{g}/\parallel \mathbf{g}\parallel$

此处的c指超参数， $\mathbf{g}$ 指梯度， $\parallel{\mathbf{g}}\parallel$ 为梯度的范数， $\mathbf{g}/\parallel \mathbf{g}\parallel$ 必然是个单位矢量，因此在进行调节后新的梯度范数必然等于c，注意到如果 $\parallel{\mathbf{g}}\parallel \leq c$ 则不需要进行调节。
梯度裁剪确保了梯度矢量的最大范数（本文中规定为c）。即使在模型的损失函数不规则时，这一技巧也有助于梯度下降保持合理的行为。下面的图片展示了损失函数的陡崖。不采用裁剪，参数将会沿着梯度下降方向剧烈变化，导致其离开了最小值范围；而使用裁剪后参数变化将被限制在一个合理范围内，避免了上面的情况。
在这里插入图片描述