计算机视觉 | 面试题：03、BN层的深入理解

最新推荐文章于 2024-03-25 18:42:46 发布

Mrrunsen

最新推荐文章于 2024-03-25 18:42:46 发布

阅读量455

点赞数

分类专栏： CV面试题文章标签：深度学习神经网络机器学习

本文链接：https://blog.csdn.net/Mrrunsen/article/details/120190313

版权

CV面试题专栏收录该内容

61 篇文章 98 订阅 ¥9.90 ¥99.00

订阅专栏

超级会员免费看

本文详细探讨了BN层在深度学习中的作用，包括解决内部协变量转移问题，加速训练，防止梯度消失，并提高模型泛化能力。BN层通过标准化层内数据分布，利用可训练参数γ和β进行调整。在训练和推理时，BN的均值和方差计算有所不同，训练时基于批次数据，推理时使用训练过程中的滑动平均。BN层的实现和好处使其成为深度网络的常用组件。

摘要由CSDN通过智能技术生成

问题

BN在深度网络训练过程中是非常好用的trick，在笔试中也很常考，而之前只是大概知道它的作用，很多细节并不清楚，因此希望用这篇文章彻底解决揭开BN的面纱。

BN层的由来与概念

讲解BN之前，我们需要了解BN是怎么被提出的。在机器学习领域，数据分布是很重要的概念。如果训练集和测试集的分布很不相同，那么在训练集上训练好的模型，在测试集上应该不奏效（比如用ImageNet训练的分类网络去在灰度医学图像上finetune再测试，效果应该不好）。对于神经网络来说，如果每一层的数据分布都不一样，后一层的网络则需要去学习适应前一层的数据分布，这相当于去做了domain的adaptation，无疑增加了训练难度，尤其是网络越来越深的情况。

实际上，确实如此，不同层的输出的分布是有差异的。BN的那篇论文中指出，不同层的数据分布会往激活函数的上限或者下限偏移。论文称这种偏移为internal Covariate Shift，internal指的是网络内部。神经网络一旦训练起来，那么参数就要发生更新，除了输入层的数据外(因为输入层数据，我们已经人为的为每个样本归一化)，后面网络每一层的输入数据分布是一直在发生变化的，因为在训练的时候，前面层训练参数的更新将导致后面层输入数据分布的变化。以网络第二层为例：网络的第二层输入，是由第一层的参数和input计算得到的，而第一层的参数在整个训练过程中一直在变化，因此必然会引起后面每一层输入数据分布的改变, 第一层输出变化了，势必会引起第二层输入分布的改变，模型拟合的效果就会变差，也会影响模型收敛的速度（

了解本专栏

超级会员免费看

Mrrunsen

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
打赏
0
评论
计算机视觉 | 面试题：03、BN层的深入理解

问题BN在深度网络训练过程中是非常好用的trick，在笔试中也很常考，而之前只是大概知道它的作用，很多细节并不清楚，因此希望用这篇文章彻底解决揭开BN的面纱。BN层的由来与概念讲解BN之前，我们需要了解BN是怎么被提出的。在机器学习领域，数据分布是很重要的概念。如果训练集和测试集的分布很不相同，那么在训练集上训练好的模型，在测试集上应该不奏效（比如用ImageNet训练的分类网络去在灰度医学图像上finetune再测试，效果应该不好）。对于神经网络来说，如果每一层的数据分布都不一样，后一层的网络则需要
复制链接

扫一扫