pytorch中tensor求导:y.sum().backward()为什么求导的时候要进行这个sum操作；

灰太狼家的小鸭子

已于 2023-02-08 20:41:23 修改

阅读量1.9k

点赞数 4

分类专栏：深度学习文章标签： pytorch 深度学习 python

于 2023-02-08 20:40:46 首次发布

本文链接：https://blog.csdn.net/JEREMY_GYJ/article/details/128942695

版权

深度学习专栏收录该内容

20 篇文章 1 订阅

订阅专栏

李沐深度学习中：对于反向传播求导的中sum（）函数的解释：

当y不是标量时，向量y关于向量x的导数的最自然解释是一个矩阵。对于高阶和高维的y和x，求导的结果可以是一个高阶张量。

然而，虽然这些更奇特的对象确实出现在高级机器学习中（包括深度学习中），但当调用向量的反向计算时，我们通常会试图计算一批训练样本中每个组成部分的损失函数的导数。这里，我们的目的不是计算微分矩阵，而是单独计算批量中每个样本的偏导数之和。

意思就是：对于y来说，不能是一个变量，必须是一个标量才能进行反向传播求导。（自己读了那段话也不是很明白）。自己打印出来代码结果就很容易明白了。

import torch
x=torch.arange(4.0,requires_grad=True)
print(x)

# x的第一个函数：
y= 2 * torch.dot(x,x) #点积和，先相乘再相加；是一个标量(一个数)
print("y1:",y) #y1: tensor(28., grad_fn=<MulBackward0>)
y.backward() #反向传播函数自动求导；
print(x.grad) #求x tensor([ 0.,  4.,  8., 12.])

x.grad== 4 * x

#第二个x 的函数
x.grad.zero_(); #梯度清零；
y=x.sum()   # y是一个标量 ，
print("y2:",y)   #y2: tensor(6., grad_fn=<SumBackward0>)
y.backward()
print(x.grad) #tensor([1., 1., 1., 1.])

# x的第三个函数：
x.grad.zero_()
y=x * x  #y是一个向量
print("y3:",y)#y3: tensor([0., 1., 4., 9.], grad_fn=<MulBackward0>)
y.sum().backward() #先求和再求导数;
print(x.grad) #tensor([0., 2., 4., 6.])