理解神经网络中的Dropout

最新推荐文章于 2025-06-18 16:38:30 发布

SuPhoebe

最新推荐文章于 2025-06-18 16:38:30 发布

阅读量3.4w

点赞数 25

CC 4.0 BY-SA版权

分类专栏：机器学习 & 深度学习机器学习与数学模型文章标签：神经网络深度学习

本文链接：https://blog.csdn.net/u013007900/article/details/78120669

机器学习与数学模型同时被 2 个专栏收录

68 篇文章

订阅专栏

机器学习 & 深度学习

44 篇文章

订阅专栏

Dropout是一种有效的正则化方法，通过在训练过程中随机关闭神经网络的一部分来防止过拟合。它既可以视为减弱特征间协同作用的手段，也可以被视为多模型效果的平均。在训练时，每个神经元以50%的概率被丢弃，而在测试时，所有神经元的输出会被乘以保留概率以模拟多个模型的平均效果。尽管训练时间增加，但测试阶段不受影响。Dropout常与L2正则化结合使用，调整学习率以优化训练过程。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

dropout是指在深度学习网络的训练过程中，对于神经网络单元，按照一定的概率将其暂时从网络中丢弃。注意是暂时，对于随机梯度下降来说，由于是随机丢弃，故而每一个mini-batch都在训练不同的网络。

过拟合是深度神经网（DNN）中的一个常见问题：模型只学会在训练集上分类，这些年提出的许多过拟合问题的解决方案，其中dropout具有简单性而且效果也非常良好。

算法概述

我们知道如果要训练一个大型的网络，而训练数据很少的话，那么很容易引起过拟合，一般情况我们会想到用正则化、或者减小网络规模。然而Hinton在2012年文献：《Improving neural networks by preventing co-adaptation of feature detectors》提出了，在每次训练的时候，随机让一半的特征检测器停过工作，这样可以提高网络的泛化能力，Hinton又把它称之为dropout。

第一种理解方式是，在每次训练的时候使用dropout，每个神经元有百分之50的概率被移除，这样可以使得一个神经元的训练不依赖于另外一个神经元，同样也就使得特征之间的协同作用被减弱。Hinton认为，过拟合可以通过阻止某些特征的协同作用来缓解。

第二种理解方式是，我们可以把dropout当做一种多模型效果平均的方式。对于减少测试集中的错误，我们可以将多个不同神经网络的预测结果取平均，而因为dropout的随机性，我们每次dropout后，网络模型都可以看成是一个不同结构的神经网络，而此时要训练的参数数目却是不变的，这就解脱了训练多个独立的不同神经网络的时耗问题。在测试输出的时候，将输出权重除以二，从而达到类似平均的效果。

需要注意的是如果采用dropout，训练时间大大延长，但是对测试阶段没影响。