pytorch训练过程中出现nan的排查思路

最新推荐文章于 2023-12-26 22:54:51 发布

taoqick

最新推荐文章于 2023-12-26 22:54:51 发布

阅读量467

点赞数

文章标签： pytorch 人工智能 python

原文链接：https://blog.csdn.net/mch2869253130/article/details/111034068

版权

本文介绍了在深度学习中如何处理常见的除0或log0错误，以及如何通过检查loss和梯度是否为nan来判断问题所在，包括使用梯度裁剪防止梯度爆炸，调整学习速率和优化器选择等方法。

摘要由CSDN通过智能技术生成

最常见的就是出现了除0或者log0这种，看看代码中在这种操作的时候有没有加一个很小的数，但是这个数数量级要和运算的数的数量级要差很多。一般是1e-8。
在optim.step()之前裁剪梯度。

optim.zero_grad()
loss.backward()
nn.utils.clip_grad_norm(model.parameters, max_norm, norm_type=2)
optim.step()

max_norm一般是1，3，5。
3. 前面两条还不能解决nan的话，就按照下面的流程来判断。

...

loss = model(input)
# 1. 先看loss是不是nan,如果loss是nan,那么说明可能是在forward的过程中出现了第一条列举的除0或者log0的操作
assert torch.isnan(loss).sum() == 0, print(loss)

optim.zero_grad()
loss.backward()
# 2. 如果loss不是nan,那么说明forward过程没问题，可能是梯度爆炸，所以用梯度裁剪试试
nn.utils.clip_grad_norm(model.parameters, max_norm, norm_type=2)

# 3.1 在step之前，判断参数是不是nan, 如果不是判断step之后是不是nan
assert torch.isnan(model.mu).sum() == 0, print(model.mu)
optim.step()
# 3.2 在step之后判断，参数和其梯度是不是nan，如果3.1不是nan,而3.2是nan,
# 特别是梯度出现了Nan,考虑学习速率是否太大，调小学习速率或者换个优化器试试。
assert torch.isnan(model.mu).sum() == 0, print(model.mu)
assert torch.isnan(model.mu.grad).sum() == 0, print(model.mu.grad)

转载自： https://blog.csdn.net/mch2869253130/article/details/111034068

taoqick

关注

0
点赞
踩
3

收藏

觉得还不错? 一键收藏
0
评论
pytorch训练过程中出现nan的排查思路

转载自： https://blog.csdn.net/mch2869253130/article/details/111034068。3. 前面两条还不能解决nan的话，就按照下面的流程来判断。max_norm一般是1，3，5。
复制链接

扫一扫