pytorch训练出现nan是什么意思

1.背景

训练时忽然发现某几项loss变成了nan。


2.nan的含义

nan值在python往往可以直接与无穷大,无穷小等价。

常见根本来源:

  • a/0

  • log(0)

  • 空索引

第一个常见例子: l o s s / p o s n u m loss / posnum loss/posnum,希望根据正例个数平分loss,却忽视pos_num可能为0,也就是图片中没有正例,常见解决 l o s s / ( 0.0001 + n u m ) loss/(0.0001 + num) loss/(0.0001+num)或者if判断;
第二个常见例子:loss计算中带有log( p)时,p却为0,后果就是反传梯度无穷大
第三个常见例子:mask = gt>0, 然后索引 pos_p = pred[mask],却不知此时的pos_p为空;


3.解决

原因:上面第二条

debug
当出现nan后在模型forward函数上打断点,结果发现在第一步时就出现了nan,正常的x输入后出来就有nan值。

def forward(self, x):
    x = self.base_layer(x)
    ...

而self.base模块只是简单的卷积模块:

self.base_layer = nn.Sequential(
     nn.Conv2d(3,self.channels[0], kernel_size=7, stride=1,padding=3,bias=False),
     nn.BatchNorm2d(self.channels[0],momentum=0.1),
     nn.ReLU(inplace=True)
 )

再打印出它的学习参数:

for p in self.base_layer.parameters():
	print(p)

结果发现大部分参数已经是nan了,而这里只是整个模型第一层…
显然梯度爆炸了,自然检查去loss。

重新开始,在总的loss处debug:

if(torch.isnan(loss).sum()>0):
	print("here!")

当首次出现loss时在此处断点,结果发现,nan来源某一项loss,我这里是focal loss,显然是来自里面的log(p ),而p,也就是网络预测为0了,本该 p ∈ [ 0 , 1 ] p\in[0, 1] p[0,1],怎么会有0?

最后想起是Sigmoid函数:

z['hm'] = z['hm'].sigmoid() * out_branch

最后调整为:

z['hm'] = torch.clamp(z['hm'].sigmoid(),min=1e-4,max=1-1e-4) * out_branch
  • 9
    点赞
  • 30
    收藏
    觉得还不错? 一键收藏
  • 4
    评论
### 回答1: 在训练LSTM时出现结果全为NaN的问题通常是由于训练过程中出现了梯度爆炸或梯度消失的情况。 首先,梯度爆炸可能是由于网络层数较深,导致反向传播时梯度值呈指数级增长。解决这个问题的方法包括:使用梯度裁剪,即设置一个阈值,当梯度超过该阈值时进行裁剪;缩小学习率,降低梯度的更新幅度;权重正则化等方法。 其次,梯度消失可能是由于网络层数较深,反向传播时梯度值太小,使得权重更新几乎没有发生。解决这个问题的方法包括:初始化权重时使用较小的随机数,使得梯度不容易消失;使用ReLU、LSTM等激活函数,可以缓解梯度消失问题;使用Batch Normalization进行归一化等。 此外,还可以对输入数据进行预处理,包括归一化、标准化等,减少数据的变化范围,有助于提高网络的稳定性。 同时,监控损失函数的变化情况,如果损失函数在训练过程中出现不稳定或发散的情况,也可能导致结果为NaN。在这种情况下,可以考虑调整损失函数的权重或改变网络结构,以提高训练的稳定性。 总之,解决LSTM训练过程中结果全为NaN的问题需要综合考虑网络结构、权重初始化、梯度裁剪、学习率等因素,并根据具体情况采取相应的调整策略,以确保训练的稳定性和结果的有效性。 ### 回答2: 当在PyTorch训练LSTM模型时,结果全为NaN(Not a Number),通常是由于以下几个原因导致的。 1. 数据预处理问题:在训练LSTM模型之前,需要对数据进行预处理。检查是否有缺失数据或异常值。如果输入数据包含NaN值,LSTM模型将会返回NaN作为结果。确保数据集中不含NaN值,并对数据进行适当的归一化或标准化。 2. 学习率过高:使用的学习率可能过高,导致训练过程中发生梯度爆炸或梯度消失的情况。尝试减小学习率,可以通过调整优化器的参数来实现,如减小学习率衰减系数或使用较小的固定学习率。 3. 梯度裁剪不足:LSTM模型中存在梯度爆炸的问题,可以尝试增加梯度裁剪的阈值。通过限制梯度值的大小,可以防止梯度爆炸的问题。 4. 网络结构问题:LSTM模型的网络结构可能存在问题。检查网络结构的参数设置,例如隐藏层的大小,网络深度等。过大或过小的网络结构可能导致训练不稳定或结果出现NaN。 5. 默认参数问题:检查训练过程中使用的其他参数设置。例如,优化器的选择,损失函数的选择,迭代次数等。尝试更换不同的优化器和损失函数,适当调整迭代次数。 总结来说,当LSTM模型训练过程中出现结果全为NaN时,需要仔细检查数据预处理、学习率、梯度裁剪、网络结构和默认参数等方面的问题,并进行相应的调整和优化。

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论 4
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值