可插拔训练加速trick-Scaling PyTorch Model Training With Minimal Code Changes

余俊晖

已于 2023-08-16 21:11:47 修改

阅读量550

点赞数

分类专栏：算法自然语言处理文章标签： pytorch 人工智能深度学习

于 2023-08-16 20:53:28 首次发布

本文链接：https://blog.csdn.net/yjh_SE007/article/details/132327596

版权

自然语言处理同时被 2 个专栏收录

80 篇文章 3 订阅

订阅专栏

算法

9 篇文章 0 订阅

订阅专栏

依赖：

pip install lightning

插拔改动：

from lightning.fabric import Fabric

#...

# 实例化
fabric = Fabric(accelerator='cuda')  
# 混精度用这个，加速明显
#fabric = Fabric(accelerator="cuda", precision="bf16-mixed")
fabric.launch()

#...

# 插拔接入
model, optimizer = fabric.setup(model, optimizer) 
train_dataloader = fabric.setup_dataloaders(train_dataloader)

#...

def train(num_epochs, model, optimizer, train_loader, val_loader, fabric):
    for epoch in range(num_epochs):
        train_acc = torchmetrics.Accuracy(task="multiclass", num_classes=10).to(fabric.device)

        model.train()
        for batch_idx, (features, targets) in enumerate(train_loader):
            model.train()  
            logits = model(features)
            loss = F.cross_entropy(logits, targets)
            optimizer.zero_grad()
            fabric.backward(loss)  # 插拔接入，原反向传播：loss.backward()
            optimizer.step()
            #...