deeplearning.ai课程学习（3）

最新推荐文章于 2024-07-28 15:37:27 发布

dengjiyun1419

最新推荐文章于 2024-07-28 15:37:27 发布

阅读量165

点赞数

文章标签：人工智能数据结构与算法

原文链接：http://www.cnblogs.com/kamekin/p/10093670.html

版权

第三周：浅层神经网络(Shallow neural networks)

1、激活函数（Activation functions）

sigmoid函数和tanh函数两者共同的缺点是，在z

Relu和Leaky ReLu相对于Sigmoid和tanh函数的优点如下：

第一，在

第二，sigmoid和tanh函数的导数在正负饱和区的梯度都会接近于0，这会造成梯度弥散，而Relu和Leaky ReLu函数大于0部分都为常熟，不会产生梯度弥散现象。(同时应该注意到的是，Relu进入负半区的时候，梯度为0，神经元此时不会训练，产生所谓的稀疏性，而Leaky ReLu不会有这问题)

不同激活函数的过程和结论：

sigmoid激活函数：除了输出层是一个二分类问题基本不会用它。

tanh激活函数：tanh是非常优秀的，几乎适合所有场合。

ReLu激活函数：最常用的默认函数，如果不确定用哪个激活函数，就使用ReLu或者Leaky ReLu。

总结：如果不确定哪一个激活函数效果更好，可以把它们都试试，然后在验证集或者发展集上进行评价。

2、为什么需要非线性激活函数？（why need a nonlinear activation function?）

如果使用线性激活函数或者没有使用一个激活函数，那么无论你的神经网络有多少层一直在做的只是计算线性函数，所以不如直接去掉全部隐藏层。

3、随机初始化（Random+Initialization）

对于逻辑回归，把权重初始化为0当然也是可以的。但是对于一个神经网络，如果把权重或者参数都初始化为0，那么梯度下降将不会起作用。

如上图，假设有两个输入特征n⁰，两个隐藏单元n¹,初始化权重矩阵W¹为0,b¹=0。

前向传播时，a₁¹和a₁²总是会相等，两个激活单元就会相同。

因为两个隐含单元计算同样的函数，当你做反向传播计算时，这会导致d_z¹和d_z²，使得W²也将为0

转载于:https://www.cnblogs.com/kamekin/p/10093670.html

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
deeplearning.ai课程学习（3）

第三周：浅层神经网络(Shallow neural networks)1、激活函数（Activation functions）sigmoid函数和tanh函数两者共同的缺点是，在z特别大或者特别小的情况下，导数的梯度或者函数的斜率会变得特别小，最后就会接近于0，导致降低梯度下降的速度。Relu和Leaky ReLu相对于Sigmoid和tanh函数的优点如下：第一，在...
复制链接

扫一扫

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。