通过MNIST理解batch_size的作用

王摇摆

于 2023-10-13 09:13:49 发布

阅读量161

点赞数

分类专栏：机器学习文章标签： batch 开发语言

本文链接：https://blog.csdn.net/weixin_44943389/article/details/133803364

版权

机器学习专栏收录该内容

112 篇文章 3 订阅

订阅专栏

batch_size 的选择在训练神经网络时是一个重要的超参数，它会影响训练的速度、模型的泛化能力以及内存的消耗。

以下是不同 batch_size 对训练过程的影响：

batch_size 太大：
- 优点：
  - 训练过程更快，因为可以充分利用硬件的并行计算能力。
- 缺点：
  - 内存需求更高，特别是对于大型模型和大规模数据集。
  - 每次更新所需的计算量增大，可能导致训练过程不稳定，容易陷入局部最优解。
batch_size 太小：
- 优点：
  - 内存消耗较小，适用于资源受限的情况。
  - 可以更频繁地更新模型参数，有助于平滑梯度，使训练过程更加稳定。
- 缺点：
  - 训练速度相对较慢，因为不能充分利用硬件的并行计算能力。
  - 容易受到噪声样本的影响，使得模型参数更新的方向不稳定。
适当选择：
- 一般来说，合适的 batch_size 取决于许多因素，包括模型的大小、硬件资源、数据集大小等。
- 常用的一些取值范围是 32、64、128 等。在实践中，你可能需要通过实验来找到最适合你的具体情况的 batch_size。

总的来说，合适的 batch_size 可以提高训练效率、稳定性，同时避免内存消耗过大。在实践中，通常需要通过实验和调参来选择最合适的 batch_size。

学习测试代码

# coding: utf-8
import sys, os
sys.path.append(os.pardir)  # 为了导入父目录的文件而进行的设定
import numpy as np
import pickle
from dataset.mnist import load_mnist
from common.functions import sigmoid, softmax


def get_data():
    (x_train, t_train), (x_test, t_test) = load_mnist(normalize=True, flatten=True, one_hot_label=False)
    return x_test, t_test


def init_network():
    with open("sample_weight.pkl", 'rb') as f:
        network = pickle.load(f)
    return network


def predict(network, x):
    w1, w2, w3 = network['W1'], network['W2'], network['W3']
    b1, b2, b3 = network['b1'], network['b2'], network['b3']

    a1 = np.dot(x, w1) + b1
    z1 = sigmoid(a1)
    a2 = np.dot(z1, w2) + b2
    z2 = sigmoid(a2)
    a3 = np.dot(z2, w3) + b3
    y = softmax(a3)

    return y


x, t = get_data()
network = init_network()

batch_size = 10 # 批数量
accuracy_cnt = 0

for i in range(0, len(x), batch_size):
    x_batch = x[i:i+batch_size]
    y_batch = predict(network, x_batch)

    p = np.argmax(y_batch, axis=1) # 将预测结果组合成为数组
    accuracy_cnt += np.sum(p == t[i:i+batch_size])

print("Accuracy:" + str(float(accuracy_cnt) / len(x)))