【已解决】RuntimeError: Trying to backward through the graph a second time (or directly access saved tens

鳗小鱼

已于 2023-12-12 09:43:56 修改

阅读量1.3w

点赞数 20

分类专栏： Bugs（程序报错）文章标签： python 深度学习 pytorch 人工智能机器学习 flask 数据结构

于 2023-11-30 18:09:39 首次发布

本文链接：https://blog.csdn.net/BetrayFree/article/details/134718630

版权

Bugs（程序报错）专栏收录该内容

144 篇文章 10 订阅

订阅专栏

问题描述

Traceback (most recent call last):
File "/home/sysu/qfy/project/GCL/GCL/Main.py", line 281, in <module>
main(args)
File "/home/sysu/qfy/project/GCL/GCL/Main.py", line 200, in main
loss, Matrix = train(encoder_model, args, data, optimizer, epoch)
File "/home/sysu/qfy/project/GCL/GCL/Main.py", line 153, in train
loss.backward()
File "/home/sysu/qfy/anaconda3/envs/gclv1/lib/python3.8/site-packages/torch/_tensor.py", line 487, in backward
torch.autograd.backward(
File "/home/sysu/qfy/anaconda3/envs/gclv1/lib/python3.8/site-packages/torch/autograd/__init__.py", line 200, in backward
Variable._execution_engine.run_backward( # Calls into the C++ engine to run the backward pass
RuntimeError: Trying to backward through the graph a second time (or directly access saved tensors after they have already been freed). Saved intermediate values of the graph are freed when you call .backward() or autograd.grad(). Specify retain_graph=True if you need to backward through the graph a second time or if you need to access saved tensors after calling backward.

解决办法

1、解决方法直出

为什么会报这个错，这个错翻译成白话文就是说：当我们第二次backward的时候，计算图的结构已经被破坏了（buffer的梯度被释放了），这也是pytorch动态图的机制，可以节省内存。

在pytorch的计算图中，其实只有两种元素：tensor和function，function就是加减乘除、开方、幂指对、三角函数等可求导运算，而tensor可细分为两类：叶子节点(leaf node)和非叶子节点。使用backward()函数反向传播计算tensor的梯度时，并不计算所有tensor的梯度，而是只计算满足这几个条件的tensor的梯度：1.类型为叶子节点、2.requires_grad=True、3.依赖该tensor的所有tensor的requires_grad=True。

而报这个错的原因很简单，就是在进行训练的时候，由于是在下一次循环的时候前一次的计算图已经被释放了，所以下次计算就会出现问题，那怎么办呢？就把计算图保留下来就可以了

.backward()
改为
.backward(retain_graph=True)

这个时候就不会再出错了

2、示例程序：在占用较少缓存情况下进行更新

def train(t0,t1,z0,z1,z2):
    for i in range(10):        #迭代10次
        sum = 0
        optimizer.zero_grad()     #梯度清零
        z1 = cal(t0,z0,t1,z1.data,z2)   #调用函数计算z1
        #z1 = relu(torch.mm(t0, z0) - torch.mm(torch.t(t1), relu(torch.mm(t1, z1.data)) - z2))
        loss=cri(out,z1)            #计算反向传播的loss
        sum+=loss.item()            #loss值计算
        print(loss)        
        loss.backward(torch.ones_like(out))    #反向传播，里面参数设置可以自行查阅
        optimizer.step()        #梯度更新
        print(t0.grad,t1.grad)    #打印需要更新的参数的梯度

————————————————
版权声明：本文为CSDN博主「toroxy」的原创文章，遵循CC 4.0 BY-SA版权协议，转载请附上原文出处链接及本声明。
原文链接：https://blog.csdn.net/toro12306/article/details/121094110

很明显可以看出来，再循环中是要对z1进行更新的

z1是通过 z1 = cal(t0,z0,t1,z1,z2) 得到的，这里z1是已经定义了的变量，但是经过这个公式又把z1更新覆盖了，虽然说这个错误可以在最后loss.backward()函数里加上retain_graph=Ture，即loss.backward(retain_graph=Ture)解决，但是这会增加显存的使用，明显当任务需要较大的计算量时，这是不合理的，所以这种方案并不是最优的。

而我的解决方案是对 z1 = cal(t0,z0,t1,z1,z2) 进行了简单的修改，只需要在我们需要更新的参数，这里是z1，后面加上 .data 即可，此时这句变为了 z1 = cal(t0,z0,t1,z1.data,z2)，这样不会报错，并且显存占用也很少，这样做的原因我觉得和with torch.no_grad()类似，这里进行计算的z1.data数据是不存在梯度的，在整个计算过程中也是不存在梯度的，而这里的z1本身又是中间变量，没有梯度，也不需要求梯度，所以此方法可行。

发现可以收敛，参数正常更新，也不会报错。