Pytorch反向传播中的细节-计算梯度时的默认累加

最新推荐文章于 2024-05-24 17:43:30 发布

翻滚的小@强

最新推荐文章于 2024-05-24 17:43:30 发布

阅读量4.2k

点赞数 8

分类专栏： Pytorch学习笔记文章标签： pytorch的反向传播梯度自动累加机制 pytorch反向手动清零 pytorch线性回归

本文链接：https://blog.csdn.net/wuzhongqiang/article/details/102572324

版权

Pytorch学习笔记专栏收录该内容

24 篇文章 37 订阅 ¥19.90 ¥99.00

订阅专栏

超级会员免费看

本文通过线性回归的例子探讨PyTorch反向传播时默认的梯度累加机制。作者指出，如果不手动清零梯度，会导致loss值震荡不收敛，并提供了两种不同情况的实验结果对比。最后，文章提醒读者，若不希望梯度累积，可以在每次迭代时手动清零。

摘要由CSDN通过智能技术生成

今天学习pytorch实现简单的线性回归，发现了pytorch的反向传播时计算梯度采用的累加机制，于是百度来一下，好多博客都说了累加机制，但是好多都没有说明这个累加机制到底会有啥影响，所以我趁着自己练习的一个例子正好直观的看一下以及如何解决：

pytorch实现线性回归

先附上试验代码来感受一下：

torch.manual_seed(6)

lr = 0.01   # 学习率
result = []

# 创建训练数据
x = torch.rand(20, 1) * 10
y = 2 * x + (5 + torch.randn(20, 1)) 

# 构建线性回归函数
w = torch.randn((1), requires_grad=True)
b = torch.zeros((1), requires_grad=True)

# 这里是迭代过程，为了看pytorch的反向传播计算梯度的细节，我先迭代两次
for iteration in range(2):

    # 前向传播
    wx = torch.mul(w, x)
    y_pred = torch.add(wx, b)

    # 计算 MSE loss
    loss = (0.5 * (y - y_pred) ** 2).mean()
    
    # 反向传播
    loss.backward()
    
    # 这里看一下反向传