bitch_size 、epoch 的个人理解
在pytorch种经常会用到DataLoader函数,里面会出现参数bitch_size和shuffer。这里具体来说一下这俩个参数的原理
在深度学习中寻找局部最优参数时,最常用到的方法就是小批次随机梯度下降。
直观理解一下,小批次,就是指整体的一小部分,也就是bitch_size;随机就是在整体中任意取数(bitch_size=64,就是从整体中随机取64给数)。
shuffer 含义就是打乱,就是每取一次就会打乱一次。
epoch表示一整个遍历的流程。 如何才是遍历一整个流程呢?
如果bitch_size=n(数据中所有的数),那么在计算梯度时,就会一次性算完所有的梯度。此时就是算一个epoch
如果bitch_size != n ,而且shuffer=false 即不打乱时,那么我们每次都会根据某一次的bitch_size算出一个梯度,然后进行迭代,直到所有的数据都用到(最后一次用到的数据可以小于bitch_size),那么这就是算一次epoch。
采用bitch_size的优点
在学习率相同的情况下,如果不采用bitch_size,那么一个epoch内就只进行了一次梯度下降,需要很多个epoch才能找到极值点,但是如果设置了bitch_size,那么一个epoch中可以进行多次梯度下降,找到极值点,所需的epoch次数就不会太多。
#读取batch_size数据
def data_iter(batch_size, features, labels):
num_examples = len(features)
indices = list(range(num_examples))
random.shuffle(indices)
for i in range(0, num_examples, batch_size):
batch_indices = torch.tensor(
indices[i: min(i + batch_size, num_examples)])
yield features[batch_indices], labels[batch_indices]
for epoch in range(num_epochs):
for X, y in data_iter(batch_size, features, labels):
l = loss(net(X, w, b), y) # X和y的小批量损失
# 因为l形状是(batch_size,1),而不是一个标量。l中的所有元素被加到一起,
# 并以此计算关于[w,b]的梯度
l.sum().backward()
sgd([w, b], lr, batch_size) # 使用参数的梯度更新参数
with torch.no_grad():
train_l = loss(net(features, w, b), labels)
print(f'epoch {epoch + 1}, loss {float(train_l.mean()):f}')