PyTorch梯度裁剪避免训练loss nan的操作

最新推荐文章于 2024-08-25 11:00:00 发布

青松愉快

最新推荐文章于 2024-08-25 11:00:00 发布

阅读量2.2k

点赞数 1

分类专栏：推荐算法文章标签： pytorch

原文链接：https://www.jb51.net/article/213089.htm

版权

推荐算法专栏收录该内容

57 篇文章 2 订阅

订阅专栏

在训练深度学习模型时遇到loss为nan的问题，通过引入PyTorch的torch.nn.utils.clip_grad_norm_进行梯度裁剪解决了这一问题。在训练代码中，在损失函数反向传播后，对模型参数的梯度进行裁剪，限制最大范数为20，防止梯度爆炸。此外，检查除0、log0等操作，确保在优化器.step()前后正确处理梯度，以及适当调整学习率和优化器，都是排查nan损失的有效方法。

摘要由CSDN通过智能技术生成

近来在训练检测网络的时候会出现loss为nan的情况，需要中断重新训练，会很麻烦。因而选择使用PyTorch提供的梯度裁剪库来对模型训练过程中的梯度范围进行限制，修改之后，不再出现loss为nan的情况。

PyTorch中采用torch.nn.utils.clip_grad_norm_来实现梯度裁剪，链接如下：

torch.nn.utils.clip_grad — PyTorch 1.10 documentation

训练代码使用示例如下：

1

2

3

4

5

6

7

8

from torch.nn.utils import clip_grad_norm_

outputs = model(data)

loss= loss_fn(outputs, target)

optimizer.zero_grad()

loss.backward()

# clip the grad

clip_grad_norm_(model.parameters(), max_norm=20, norm_type=2)

optimizer.step()

其中，max_norm为梯度的最大范数，也是梯度裁剪时主要设置的参数。

备注：网上有同学提醒在（强化学习）使用了梯度裁剪之后训练时间会大大增加。目前在我的检测网络训练中暂时还没有碰到这个问题，以后遇到再来更新。

补充：pytorch训练过程中出现nan的排查思路

1、最常见的就是出现了除0或者log0这种

看看代码中在这种操作的时候有没有加一个很小的数，但是这个数数量级要和运算的数的数量级要差很多。一般是1e-8。

2、在optim.step()之前裁剪梯度

1

2

3

4

optim.zero_grad()

loss.backward()

nn.utils.clip_grad_norm(model.parameters, max_norm, norm_type=2)

optim.step()

max_norm一般是1，3，5。

3、前面两条还不能解决nan的话

就按照下面的流程来判断。

1

2

3

4

5

6

7

8

9

10

11

12

13

14

15

...

loss = model(input)

# 1. 先看loss是不是nan,如果loss是nan,那么说明可能是在forward的过程中出现了第一条列举的除0或者log0的操作

assert torch.isnan(loss).sum() == 0, print(loss)

optim.zero_grad()

loss.backward()

# 2. 如果loss不是nan,那么说明forward过程没问题，可能是梯度爆炸，所以用梯度裁剪试试

nn.utils.clip_grad_norm(model.parameters, max_norm, norm_type=2)

# 3.1 在step之前，判断参数是不是nan, 如果不是判断step之后是不是nan

assert torch.isnan(model.mu).sum() == 0, print(model.mu)

optim.step()

# 3.2 在step之后判断，参数和其梯度是不是nan，如果3.1不是nan,而3.2是nan,

# 特别是梯度出现了Nan,考虑学习速率是否太大，调小学习速率或者换个优化器试试。

assert torch.isnan(model.mu).sum() == 0, print(model.mu)

assert torch.isnan(model.mu.grad).sum() == 0, print(model.mu.grad)

关注

1
点赞
踩
8

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

专栏目录

青松愉快 CSDN认证博客专家 CSDN认证企业博客

码龄12年

14: 原创

13万+: 周排名

90万+: 总排名

34万+: 访问

: 等级

2164: 积分

71: 粉丝

125: 获赞

25: 评论

357: 收藏

私信

关注

热门文章

分类专栏

最新评论

Mac OS升级GCC版本
momomomomomomo_: 打扰大佬！我下载的是gcc-12，但是刷新完环境变量后，查看版本显示command not found: gcc-12’，请问是什么原因呀
Mac OS升级GCC版本
qq_54009009: 太可了！！感谢博主！！
GCN源代码注释的解释,源码,解读
Jully_xiaoman: 有帮助到点赞
C++ 值传递、指针传递、引用传递详解
小姜寻码记: 博主：请教下，你在解锁引用传递时说到：在引用传递过程中，被调函数的形式参数虽然也作为局部变量在栈中开辟了空间，想问下引用传递会开辟新的空间吗？
Tensorflow c++ 实践及各种坑
元气少女缘结神: 在输入张量中，一张图像应该像您说的{1, rows, cols, 1}这样设置，如果是一个batch应该是{batch, rows, cols, 1}，然后在预测完毕输出张量中应该也是batch个输出结果如https://blog.csdn.net/wd1603926823/article/details/99406974 中图像分类的确可以如此。但发现如果是图像分割中同样操作却错误，输出张量中却只有1幅图的结果，而非batch个图像的结果？？不知博主是否试过？我看https://github.com/tensorflow/tensorflow/issues/19909 也是同样的问题

大家在看

最新文章

目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。