bitch_size 、epoch 的解释

bitch_size 、epoch 的个人理解

在pytorch种经常会用到DataLoader函数,里面会出现参数bitch_size和shuffer。这里具体来说一下这俩个参数的原理

在深度学习中寻找局部最优参数时,最常用到的方法就是小批次随机梯度下降。

直观理解一下,小批次,就是指整体的一小部分,也就是bitch_size;随机就是在整体中任意取数(bitch_size=64,就是从整体中随机取64给数)。

shuffer 含义就是打乱,就是每取一次就会打乱一次。

epoch表示一整个遍历的流程。 如何才是遍历一整个流程呢?

如果bitch_size=n(数据中所有的数),那么在计算梯度时,就会一次性算完所有的梯度。此时就是算一个epoch

如果bitch_size != n ,而且shuffer=false 即不打乱时,那么我们每次都会根据某一次的bitch_size算出一个梯度,然后进行迭代,直到所有的数据都用到(最后一次用到的数据可以小于bitch_size),那么这就是算一次epoch。

采用bitch_size的优点

在学习率相同的情况下,如果不采用bitch_size,那么一个epoch内就只进行了一次梯度下降,需要很多个epoch才能找到极值点,但是如果设置了bitch_size,那么一个epoch中可以进行多次梯度下降,找到极值点,所需的epoch次数就不会太多。

#读取batch_size数据
def data_iter(batch_size, features, labels):
    num_examples = len(features)
    indices = list(range(num_examples))
    random.shuffle(indices)
    for i in range(0, num_examples, batch_size):
        batch_indices = torch.tensor(
            indices[i: min(i + batch_size, num_examples)])
        yield features[batch_indices], labels[batch_indices]
        
for epoch in range(num_epochs):
    for X, y in data_iter(batch_size, features, labels):
        l = loss(net(X, w, b), y)  # X和y的小批量损失
        # 因为l形状是(batch_size,1),而不是一个标量。l中的所有元素被加到一起,
        # 并以此计算关于[w,b]的梯度
        l.sum().backward()
        sgd([w, b], lr, batch_size)  # 使用参数的梯度更新参数
    with torch.no_grad():
        train_l = loss(net(features, w, b), labels)
        print(f'epoch {epoch + 1}, loss {float(train_l.mean()):f}')
  • 5
    点赞
  • 3
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值