Batch 、Batch_Size、weight decay、momentum、normalization和正则化的一些理解和借鉴

最新推荐文章于 2024-06-24 15:01:40 发布

曉_寧

最新推荐文章于 2024-06-24 15:01:40 发布

阅读量2.8k

点赞数 2

分类专栏：卷积神经网络

本文链接：https://blog.csdn.net/wweiainn/article/details/83748774

版权

本文深入探讨了深度学习中Batch_Size的影响，指出全数据集训练与批梯度下降法的优缺点。增大Batch_Size可以提高效率但可能导致收敛速度变慢。此外，文章还讨论了weight decay、momentum和normalization的作用，以及L1和L2正则化在防止过拟合中的应用。通过对不同正则化方法的比较，如岭回归和Lasso回归，阐述了它们如何调整模型复杂度，提高模型的泛化能力。

摘要由CSDN通过智能技术生成

整理一下之前看过的内容，方便后面忘记时查询。

谈谈深度学习中的 Batch_Size

Batch_Size（批尺寸）是机器学习中一个重要参数，涉及诸多矛盾，下面逐一展开。

首先，为什么需要有 Batch_Size 这个参数？
Batch 的选择，首先决定的是下降的方向。如果数据集比较小，完全可以采用全数据集（Full Batch Learning ）的形式，这样做至少有 2 个好处：其一，由全数据集确定的方向能够更好地代表样本总体，从而更准确地朝向极值所在的方向。其二，由于不同权重的梯度值差别巨大，因此选取一个全局的学习率很困难。 Full Batch Learning 可以使用Rprop 只基于梯度符号并且针对性单独更新各权值。

对于更大的数据集，以上 2 个好处又变成了 2 个坏处：其一，随着数据集的海量增长和内存限制，一次性载入所有的数据进来变得越来越不可行。其二，以 Rprop 的方式迭代，会由于各个 Batch 之间的采样差异性，各次梯度修正值相互抵消，无法修正。这才有了后来RMSProp 的妥协方案。

既然 Full Batch Learning 并不适用大数据集，那么走向另一个极端怎么样？
所谓另一个极端，就是每次只训练一个样本，即 Batch_Size = 1。这就是在线学习（Online Learning）。线性神经元在均方误差代价函数的错误面是一个抛物面，横截面是椭圆。对于多层神经元、非线性网络，在局部依然近似是抛物面。使用在线学习，每次修正方向以各自样本的梯度方向修正，横冲直撞各自为政，难以达到收敛。

可不可以选择一个适中的 Batch_Size 值呢？
当然可以，这就是批梯度下降法（Mini-batches Learning）。因为如果数据集足够充分，那么用一半（甚至少得多）的数据训练算出来的梯度与用全部数据训练出来的梯度是几乎一样的。

批训练引入最大的好处是针对非凸损失函数（凸函数就是U型函数）来做的，毕竟非凸的情况下，全样本就算工程上的动，也会卡在局部最优上，批表示了全样本的部分抽样实现，相当于认为引入修正梯度上的采样噪声，使“一路不通找别路”更有可能的搜索最优值。

在合理范围内，增大 Batch_Size 有何好处？

内存利用率提高了，大矩阵乘法的并行化效率提高。
跑完一次 epoch（全数据集）所需的迭代次数减少，对于相同数据量的处理速度进一步加快。
在一定范围内，一般来说 Batch_Size 越大，其确定的下降方向越准，引起训练震荡越小。

盲目增大 Batch_Size 有何坏处？

内存利用率提高了，但是内存容量可能撑不住了。
跑完一次 epoch（全数据集）所需的迭代次数减少，要想达到相同的精度，其所花费的时间大大增加了，从而对参数的修正也就显得更加缓慢。
Batch_Size 增大到一定程度，其确定的下降方向已经基本不再变化。

训练：

若全集有502张图片，参数batch_size=30,则训练一次全集需要跑502/32=15次，epoch是训练全集的次数，epoch=100即训练100次全集。

调节 Batch_Size 对训练效果影响到底如何？
这里跑一个 LeNet 在 MNIST 数据集上的效果。MNIST 是一个手写体标准库，我使用的是 Theano 框架。这是一个 Python 的深度学习库。安装方便（几行命令而已），调试简单（自带 Profile），GPU / CPU 通吃，官方教程相当完备，支持模块十分丰富（除了 CNNs，更是支持 RBM / DBN / LSTM / RBM-RNN / SdA / MLPs）。在其上层有 Keras 封装，支持 GRU / JZS1, JZS2, JZS3 等较新结构，支持 Adagrad / Adadelta / RMSprop / Adam 等优化算法。

运行结果如上图所示，其中绝对时间做了标幺化处理。运行结果与上文分析相印证：

Batch_Size 太小，算法在 200 epoches 内不收敛。
随着 Batch_Size 增大，处理相同数据量的速度越快。
随着 Batch_Size 增大，达到相同精度所需要的 epoch 数量越来越多。
由于上述两种因素的矛盾， Batch_Size 增大到某个时候，达到时间上的最优。
由于最终收敛精度会陷入不同的局部极值，因此 Batch_Size 增大到某些时候，达到最终收敛精度上的最优。

深度神经网络的优化是个nonconvex problem.所以基于SGD的训练batch size不能取过大。过大的batchsize的结果是网络很容易收敛到一些不好的局部最优点。。同样太小的batch也存在一些问题，比如训练速度很慢，训练不容易收敛等。。具体的batch size的选取和训练集的样本数目相关。。举个例子，比如在3小时的语音识别库（大约108万个样本）训练DNN,通常batch 取128..而在300小时的库上会取1024.