深度学习之参数初始化策略

浅梦s

已于 2022-10-01 16:07:50 修改

阅读量1.6w

点赞数 12

分类专栏：深度学习 # 深度学习基础文章标签：深度学习机器学习人工智能

于 2017-10-13 22:09:43 首次发布

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/u012151283/article/details/78230891

版权

本文探讨了深度学习中参数初始化的重要性，分析了全零初始化的问题，并介绍了标准初始化、Xavier初始化和He初始化等策略。文章指出，合适的初始化能够防止激活值饱和，保持梯度不为0，从而加速训练过程。Xavier初始化适用于激活值对称且梯度为1的函数，而He初始化则更适合ReLU激活函数。

摘要由CSDN通过智能技术生成

为什么需要参数初始化策略

目的

为了让神经网络在训练过程中学习到有用的信息，需要参数更新时的梯度不为0。在一般的全连接网络中，参数更新的梯度和反向传播得到的状态梯度以及输入激活值有关。那么参数初始化应该满足以下两个条件：

初始化必要条件一：各层激活值不会出现饱和现象(对于sigmoid,tanh)；
初始化必要条件二：各层激活值不为0。

全零初始化存在的问题

全零初始化方法在前向传播过程中会使得隐层神经元的激活值均未0，在反向过程中根据BP公式，不同维度的参数会得到相同的更新。
需要破坏这种“对称性”。
这里写图片描述

激活函数输入值的方差

这里写图片描述

从上述推导可以看出，神经元输出的方差会随着神经元数量的增大而变多。

标准初始化

标准初始化方法通过对方差乘以一个系数确保每层神经元的输出具有相同的方差，提高训练收敛速度。

标准均匀初始化方法保证了激活函数的输入值的均值为0，方差为常量 $\frac{1}{3}$ ，和网络的层数和神经元的数量无关。对于sigmoid激活函数来说，可以确保自变量处于有梯度的范围内。
但是注意对于 $s i g m o i d$ 函数，其输出是大于零的，这违反了上面推导中关于 $E(x_i)=0$ 的假设。综上，标准初始化方法更适用于 $t anh$ 激活函数。

标准正态初始化方法保证激活函数的输入均值为，方差为1。

对于含有 $n_{in}$ 个输入和 $n_{out}$ 个输出的全连接层，

standard_normal
$W_{i,j}\sim N(0,\frac{1}{\sqrt{n_{in}}})$
standard_uniform
$W_{i,j}\sim U(-\frac{1}{\sqrt{n_{in}}},\frac{1}{\sqrt{n_{in}}})$

最低0.47元/天解锁文章

关注

12
点赞
踩
47

收藏

觉得还不错? 一键收藏
1
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

专栏目录

评论 1

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。