踩坑记----large batch_size cause low var_acc

最新推荐文章于 2024-01-18 08:15:00 发布

程序猿也可以很哲学

最新推荐文章于 2024-01-18 08:15:00 发布

阅读量953

点赞数 3

分类专栏：深度学习

本文链接：https://blog.csdn.net/qq_16564093/article/details/103563517

版权

深度学习专栏收录该内容

11 篇文章 3 订阅

订阅专栏

有时候，我们在训练模型前期，会出现很高的train_acc(训练准确率),但var_acc（验证准确率）却很低。这往往是因为我们模型在训练过程中已经进入局部最优，或者出现过拟合的现象。造成这种情况有多种原因，我只提出以下几点，有补充的可以在下面留言，我补充。

（1）.训练数据分布不均匀，可能你的训练数据某一类别占据了大多数，比如95%的数据为苹果，5%的数据为其他类别，那么模型为了拟合训练数据，则模型会偏袒于把识别结果归属于苹果，而验证集的数据是正常的，那么便会出现高train_acc，低val_acc。

（2）.训练数据没有shuffle，那么整个batch里面将会是同一个类别数据，比如都为苹果的图片，那么训练一个batch，那么模型输出将会往这一类别靠拢，会形成一个很高的acc的假象，但这个模型泛化能力却很低，因为这个模型都只会为了拟合这批同类的数据。

（3）.训练集跟验证集的预处理不一致，这个是细节问题，输入的图片分布不一致，那么必然会影响到验证结果。

（4）.模型过于复杂，造成过拟合现象，特别是在于训练数据集不多的情况下，更容易出现过拟合。

（5）.这个也是最难发现的，就是过大的batch_size，造成训练前期，模型还未收敛，出现很高的train_acc，却有很低的val_acc，亲测，在120个类别，参数只有七万的分类模型中，在batch-size等于64的情况下，在第二个epoch时，train_acc达到80%，val_acc却只有6%，train_loss跟val_loss也是相差很大，而在batch_size在等于8的情况下，在第二个epoch，train_acc跟val_acc皆能达到60%，且还有上升的趋势。至于为什么，个人认为，模型在大的batch_size的情况下，模型泛化能力下降，且更难拟合，每个epoch所包含的step也更少，且在adam的优化算法，前期的学习率较高，模型出现了振荡，一直在局部最优值徘徊，具体原因不知。

接下来分析下，batc_size对模型的影响：

large batch_size:

好处：训练的更快，每一step都包含更多的训练集，模型准确率会更高，不容易受到噪声的影响，稳定性更好。

small batch_size:

好处：不容易陷入局部最优，泛化能力更强。

总结：

（1）.large batch_size，虽然训练模型的训练误差会更低，但往往在execute的时候，效果却不尽人意。

（2）.在时间允许的情况下，建议batch_size在32或以下。