bitch_size 、epoch 的解释

ls_本性

于 2024-03-26 22:39:42 发布

阅读量385

点赞数 5

文章标签： pytorch 深度学习

本文链接：https://blog.csdn.net/m0_64133049/article/details/137060377

版权

本文详细解释了PyTorch中DataLoader函数的bitch_size（小批量大小）和shuffle（打乱顺序）参数，以及它们在epoch概念下的作用，强调了小批量训练在加快收敛速度上的优势。

摘要由CSDN通过智能技术生成

bitch_size 、epoch 的个人理解

在pytorch种经常会用到DataLoader函数，里面会出现参数bitch_size和shuffer。这里具体来说一下这俩个参数的原理

在深度学习中寻找局部最优参数时，最常用到的方法就是小批次随机梯度下降。

直观理解一下，小批次，就是指整体的一小部分，也就是bitch_size；随机就是在整体中任意取数（bitch_size=64,就是从整体中随机取64给数）。

shuffer 含义就是打乱，就是每取一次就会打乱一次。

epoch表示一整个遍历的流程。如何才是遍历一整个流程呢？

如果bitch_size=n(数据中所有的数)，那么在计算梯度时，就会一次性算完所有的梯度。此时就是算一个epoch

如果bitch_size != n ,而且shuffer=false 即不打乱时，那么我们每次都会根据某一次的bitch_size算出一个梯度，然后进行迭代，直到所有的数据都用到（最后一次用到的数据可以小于bitch_size），那么这就是算一次epoch。

采用bitch_size的优点

在学习率相同的情况下，如果不采用bitch_size,那么一个epoch内就只进行了一次梯度下降，需要很多个epoch才能找到极值点，但是如果设置了bitch_size，那么一个epoch中可以进行多次梯度下降，找到极值点，所需的epoch次数就不会太多。

#读取batch_size数据
def data_iter(batch_size, features, labels):
    num_examples = len(features)
    indices = list(range(num_examples))
    random.shuffle(indices)
    for i in range(0, num_examples, batch_size):
        batch_indices = torch.tensor(
            indices[i: min(i + batch_size, num_examples)])
        yield features[batch_indices], labels[batch_indices]
        
for epoch in range(num_epochs):
    for X, y in data_iter(batch_size, features, labels):
        l = loss(net(X, w, b), y)  # X和y的小批量损失
        # 因为l形状是(batch_size,1)，而不是一个标量。l中的所有元素被加到一起，
        # 并以此计算关于[w,b]的梯度
        l.sum().backward()
        sgd([w, b], lr, batch_size)  # 使用参数的梯度更新参数
    with torch.no_grad():
        train_l = loss(net(features, w, b), labels)
        print(f'epoch {epoch + 1}, loss {float(train_l.mean()):f}')

ls_本性

关注

5
点赞
踩
3

收藏

觉得还不错? 一键收藏
0
评论
bitch_size 、epoch 的解释

n ,而且shuffer=false 即不打乱时，那么我们每次都会根据某一次的bitch_size算出一个梯度，然后进行迭代，直到所有的数据都用到（最后一次用到的数据可以小于bitch_size），那么这就是算一次epoch。在学习率相同的情况下，如果不采用bitch_size,那么一个epoch内就只进行了一次梯度下降，需要很多个epoch才能找到极值点，但是如果设置了bitch_size，那么一个epoch中可以进行多次梯度下降，找到极值点，所需的epoch次数就不会太多。
复制链接

扫一扫