[动手学深度学习PyTorch笔记三]

一 过拟合、欠拟合及其解决方案

欠拟合(underfitting): 一类是模型无法得到较低的训练误差,我们将这一现象称作
过拟合(overfitting):模型的训练误差远小于它在测试数据集上的误差,我们称该现象为。
在实践中,我们要尽可能同时应对欠拟合和过拟合。两个主要影响因素:模型复杂度和训练数据集大小。模型复杂度过低会导致欠拟合,过高则导致过拟合,训练数据集过小容易发生过拟合。因此需选取适当的模型复杂度和计算能力范围内可以承受的较大训练数据集。

解决方案
1 权重衰减

权重衰减等价于 L 2 L_2 L2 范数正则化(regularization)。正则化通过为模型损失函数添加惩罚项使学出的模型参数值较小,是应对过拟合的常用手段。

2 丢弃法

隐藏层单元有一定的概率被丢弃,有正则化的作用,可以应对过拟合。

二 梯度消失、梯度爆炸

深度模型有关数值稳定性的典型问题是消失(vanishing)和爆炸(explosion)。
当神经网络的层数较多时,模型的数值稳定性容易变差,梯度的计算也容易出现消失或爆炸。
梯度消失会导致模型训练困难,对参数的优化步长过小,收效甚微,模型收敛十分缓慢。梯度爆炸会导致模型训练困难,对参数的优化步长过大,难以收敛。激活函数使用sigmoid或者tanh容易产生梯度消失。在训练模型时,我们应该采取适当的措施防止梯度消失和梯度爆炸的现象。

系统环境因素

协变量偏移: P ( x ) P(x) P(x)改变, P ( y ∣ x ) P(y|x) P(yx)不变。
标签偏移: P ( y ) P(y) P(y)改变, P ( y ∣ x ) P(y|x) P(yx)不变。
概念偏移: P ( y ∣ x ) P(y|x) P(yx)改变。

三 循环神经网络

循环神经网络引入一个隐藏变量 H H H,用 H t H_t Ht表示 H H H在时间步 t t t的值。

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值