【Python】学习率调整策略详解和示例

最新推荐文章于 2025-09-08 23:11:06 发布

原创

最新推荐文章于 2025-09-08 23:11:06 发布 · 1.6k 阅读

11 ·

CC 4.0 BY-SA版权

文章标签：

#python #学习 #开发语言 #计算机视觉 #人工智能 #opencv

本文探讨了学习率在深度学习中的重要性，介绍了无调整、动态调整（如SquareRootScheduler和MultiStepLR）、以及余弦调度器等策略对模型性能的影响。通过实例展示了不同调度器如何影响训练过程和泛化能力，强调了选择适当策略对优化效果的关键作用。

学习率调整得当将有助于算法快速收敛和获取全局最优，以获得更好的性能。本文对学习率调度器进行示例介绍。

学习率调整的意义
基础示例
结论

学习率调整的意义

首先，学习率的大小很重要。如果它太大，优化就会发散；如果它太小，训练就会需要过长时间，或者我们最终只能得到次优的结果（陷入局部最优）。我们之前看到问题的条件数很重要。直观地说，这是最不敏感与最敏感方向的变化量的比率。

其次，衰减速率同样很重要。如果学习率持续过高，我们可能最终会在最小值附近弹跳，从而无法达到最优解。简而言之，我们希望速率衰减，但要比慢，这样能成为解决凸问题的不错选择。

另一个同样重要的方面是初始化。这既涉及参数最初的设置方式，又关系到它们最初的演变方式。这被戏称为预热（warmup），即我们最初开始向着解决方案迈进的速度有多快。一开始的大步可能没有好处，特别是因为最初的参数集是随机的。最初的更新方向可能也是毫无意义的。

鉴于管理学习率需要很多细节，因此大多数深度学习框架都有自动应对这个问题的工具。本文将梳理不同的调度策略对准确性的影响，并展示如何通过学习率调度器（learning rate scheduler）来有效管理。

基础示例

我们从一个简单的问题开始，这个问题可以轻松计算，但足以说明要义。为此，我们选择了一个稍微现代化的LeNet版本（激活函数使用relu而不是sigmoid，汇聚层使用最大汇聚层而不是平均汇聚层），并应用于Fashion-MNIST数据集。此外，我们混合网络以提高性能。

无学习率调整方法

import math
import torch
from torch import nn
from torch.optim import lr_scheduler, SGD
from torchvision import datasets, transforms
from torch.utils.data import DataLoader
from torchvision.utils import make_grid
import matplotlib.pyplot as plt

def load_data_fashion_mnist(batch_size):
    # 定义数据预处理
    transform = transforms.Compose([
        transforms.ToTensor(),
        transforms.Normalize((0.5,), (0.5,))
    ])

    # 加载训练集和测试集
    train_dataset = datasets.FashionMNIST(root='./data', train=True, download=True, transform=transform)
    test_dataset = datasets.FashionMNIST(root='./data', train=False, download=True, transform=transform)

    # 创建数据加载器
    train_loader = DataLoader(train_dataset, batch_size=batch_size, shuffle=True)
    test_loader = DataLoader(test_dataset, batch_size=batch_size, shuffle=False)

    return train_loader, test_loader
def net_fn():
    model = nn.Sequential(
        nn.Conv2d(1, 6, kernel_size=5, padding=2), nn.ReLU(),
        nn.MaxPool2d(kernel_size=2, stride=2),
        nn.Conv2d(6, 16, kernel_size=5), nn.ReLU(),
        nn.MaxPool2d(kernel_size=2, stride