pytorch基础【4】梯度计算、链式法则、梯度清零

最新推荐文章于 2025-03-21 00:38:55 发布

九磅十五便士丶

最新推荐文章于 2025-03-21 00:38:55 发布

阅读量2.7k

点赞数 25

分类专栏： pytorch 文章标签： pytorch 人工智能 python

本文链接：https://blog.csdn.net/wahahaha116/article/details/139809919

版权

梯度计算

在PyTorch中，计算图和梯度求导是核心功能之一，特别是在深度学习模型的训练过程中。以下是对这两个概念的详细解释：

计算图（Computational Graph）

计算图是一种有向无环图（Directed Acyclic Graph, DAG），其中节点表示操作（operation）或变量（variable），边表示操作的输入输出关系。PyTorch 使用计算图来记录和管理变量之间的依赖关系，以便在反向传播时计算梯度。在这里插入图片描述

动态计算图（Dynamic Computational Graph）：PyTorch 采用动态计算图（Dynamic Computational Graph），即每次进行前向传播（forward pass）时，都会动态构建一个新的计算图。这样做的好处是可以更灵活地处理各种复杂的模型结构，尤其是那些在每个前向传播中都会变化的模型。

梯度求导（Gradient Computation）

梯度求导是深度学习中优化模型参数的关键步骤。梯度描述了损失函数对每个参数的变化率，用于指导参数的更新方向。

自动求导（Autograd）：PyTorch 提供了一个强大的自动求导库，称为 Autograd。通过 Autograd，PyTorch 可以自动计算标量值（通常是损失函数）的梯度。

函数与概念

torch.Tensor：
- Tensor 是 PyTorch 中存储数据和定义计算图的基础数据结构。默认情况下，所有的张量（Tensor）都不会自动追踪计算的历史。
- 如果要使张量参与计算图并能够进行自动求导，需要在创建张量时设置 requires_grad=True。
backward()：
- 调用张量的 backward() 方法，PyTorch 会自动计算该张量的所有依赖张量的梯度，并存储在各自的 .grad 属性中。
- backward() 只接受标量张量（一个数值），如果不是标量张量，通常会传递一个与张量形状匹配的梯度参数。
torch.no_grad()：
- 在评估模型或推理时，我们不需要计算梯度，可以使用 torch.no_grad() 以节省内存和计算资源。

示例代码

import torch

# 创建张量，并设置 requires_grad=True 以追踪其计算历史
x = torch.tensor(2.0, requires_grad=True)
y = x ** 2

# 计算图中 y 的梯度
y.backward()  # 计算 y 对 x 的梯度
print(x.grad)  # 输出 x 的梯度，dy/dx = 2*x => 4

# 在不需要梯度计算的情况下进行计算
with torch.no_grad():
    z = x * 2
    print(z)  # 输出：tensor(4.0)

梯度求导的过程

在PyTorch中，梯度求导的过程是通过自动微分（Autograd）机制实现的。以下是梯度求导过程的详细步骤：

梯度求导的基本步骤

定义计算图：
- 每当你对 torch.Tensor 进行操作时，PyTorch 会动态地创建一个计算图来记录操作。
- 如果 Tensor 的 requires_grad 属性设置为 True，那么该张量会开始追踪其上的所有操作，这样你就可以调用 backward() 来自动计算其梯度。
前向传播（Forward Pass）：
- 计算图的构建是在前向传播过程中完成的。在前向传播过程中，输入数据通过神经网络的各层进行计算，最终生成输出。
计算损失（Loss Calculation）：
- 通常情况下，在前向传播结束后会计算损失函数（Loss），这是一个标量值，用于评估模型的输出与目标之间的差距。
反向传播（Backward Pass）：
- 调用损失张量的 backward() 方法。反向传播通过链式法则计算损失函数相对于每个叶子节点（即，所有具有 requires_grad=True 的张量）的梯度。
更新参数（Parameter Update）：
- 使用优化器（如 SGD、Adam 等）通过梯度下降或其他优化算法更新模型的参数。

示例代码

以下是一个简单的示例代码，演示了梯度求导的过程：

import torch
import torch.nn as nn
import torch.optim as optim

# 定义一个简单的线性模型
class LinearModel(nn.Module):
    def __init__(self):
        super(LinearModel, self).__init__()
        self.linear = nn.Linear(1, 1)  # 输入维度为1，输出维度为1

    def forward(self, x):
        return self.linear(x)

# 创建模型实例
model = LinearModel()

# 定义损失函数和优化器
criterion = nn.MSELoss()  # 均方误差损失函数
optimizer = optim.SGD(model.parameters(), lr=0.01)  # 随机梯度下降优化器

# 创建输入数据和目标数据
inputs = torch.tensor([[1.0], [2.0], [3.0], [4.0]])
targets = torch.tensor([[2.0], [4.0], [6.0], [8.0]])

# 前向传播
outputs = model(inputs)
loss = criterion(outputs, targets)

# 反向传播
loss.backward()

# 查看梯度
for param in model.parameters():
    print(param.grad)

# 更新参数
optimizer.step()

步骤解析

创建模型和数据：
- 定义一个简单的线性回归模型，并创建输入数据和目标数据。
前向传播：
- 将输入数据传递给模型，计算输出。
- 使用损失函数计算输出与目标之间的损失。
反向传播：
- 调用 loss.backward() 计算损失相对于每个参数的梯度。PyTorch 会通过计算图自动进行反向传播，计算各个参数的梯度并存储在 param.grad 中。
更新参数：
- 使用优化器的 step() 方法更新参数。这一步通常在每个训练迭代中执行。

注意事项

梯度清零：在每次调用 backward() 之前，通常需要清零现有的梯度，以避免梯度累积。这可以通过 optimizer.zero_grad() 或 model.zero_grad() 来实现。
链式法则：反向传播过程中使用链式法则计算梯度，因此在计算图较深时，梯度的计算会逐层进行，直到计算到每个叶子节点。