【深度学习】【PaddlePaddle】DAY 4 - 图像分类问题：手写数字识别案例（一）

最新推荐文章于 2025-03-13 15:26:45 发布

Venistar

最新推荐文章于 2025-03-13 15:26:45 发布

阅读量1.9k

点赞数

分类专栏：深度学习 paddlepaddle 文章标签：神经网络深度学习

本文链接：https://blog.csdn.net/weixin_47074246/article/details/107974584

版权

本文介绍了使用PaddlePaddle进行手写数字识别的案例，基于MNIST数据集，涵盖了数据处理、模型设计、训练配置和模型测试。通过模型测试发现，简单的模型在手写数字识别任务上表现不佳，需要进一步优化。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

深度学习课程 DAY 4 - 图像分类问题：手写数字识别案例（一）

Chapter 3 图像分类问题

Chapter 3 图像分类问题

3.1 手写数字识别任务

（1）数字识别概述

数字识别是计算机从纸质文档、照片或其他来源接收、理解并识别可读的数字的能力，目前比较受关注的是手写数字识别。手写数字识别是一个典型的图像分类问题，已经被广泛应用于汇款单号识别、手写邮政编码识别等领域，大大缩短了业务处理时间，提升了工作效率和质量。
任务示意图：
在这里插入图片描述

手写邮政编码→进行简单图像分类，使用基于MNIST数据集的手写数字识别模型→判断结构，输出数据
MNIST是深度学习领域标准、易用的成熟数据集，包含60000条训练样本和10000条测试样本。

（2）MNIST数据集

MNIST数据集是从NIST的Special Database 3（SD-3）和Special Database 1（SD-1）构建而来。Yann LeCun等人从SD-1和SD-3中各取一半数据作为MNIST训练集和测试集，其中训练集来自250位不同的标注员，且训练集和测试集的标注员完全不同。

MNIST数据集的发布，吸引了大量科学家训练模型。1998年，LeCun分别用单层线性分类器、多层感知器（Multilayer Perceptron, MLP）和多层卷积神经网络LeNet进行实验，使得测试集的误差不断下降（从12%下降到0.7%）。在研究过程中，LeCun提出了卷积神经网络（Convolutional Neural Network，CNN），大幅度地提高了手写字符的识别能力，也因此成为了深度学习领域的奠基人之一。

如今在深度学习领域，卷积神经网络占据了至关重要的地位，从最早LeCun提出的简单LeNet，到如今ImageNet大赛上的优胜模型VGGNet、GoogLeNet、ResNet等，人们在图像分类领域，利用卷积神经网络得到了一系列惊人的结果。

3.2 构建手写数字识别任务的神经网络模型

同样，构建模型的三要素：模型假设、评价函数和优化算法的流程与房价预测模型任务一致。模型的构建和训练可分为五个步骤：数据处理、模型设计、训练配置、训练过程和模型保存。
在这里插入图片描述
从代码结构看，模型均为数据处理、定义网络结构和训练过程三个部分。
纵向概要介绍模型的基本代码结构和实现方案，横向探讨构建模型的每个环节中的更优但相对复杂的实现方案。

下面先用房价预测任务的架构进行方案的初步构建，先采用飞桨封装的API进行学习：

前提条件：载入相关类库

#加载飞桨和相关类库
import paddle
import paddle.fluid as fluid
from paddle.fluid.dygraph.nn import Linear
import numpy as np
import os
from PIL import Image

（1）数据处理

通过paddle.dataset.mnist.train()函数设置数据读取器，batch_size设置为8，即一个批次有8张图片和8个标签，代码如下所示。

# 如果～/.cache/paddle/dataset/mnist/目录下没有MNIST数据，API会自动将MINST数据下载到该文件夹下
# 设置数据读取器，读取MNIST数据训练集
trainset = paddle.dataset.mnist.train()
# 包装数据读取器，每次读取的数据数量设置为batch_size=8
train_reader = paddle.batch(trainset, batch_size=8)

输出

Cache file /home/aistudio/.cache/paddle/dataset/mnist/train-images-idx3-ubyte.gz not found, downloading https://dataset.bj.bcebos.com/mnist/train-images-idx3-ubyte.gz 
Begin to download

Download finished
Cache file /home/aistudio/.cache/paddle/dataset/mnist/train-labels-idx1-ubyte.gz not found, downloading https://dataset.bj.bcebos.com/mnist/train-labels-idx1-ubyte.gz 
Begin to download
........
Download finished

paddle.batch函数将MNIST数据集拆分成多个批次，通过如下代码读取第一个批次的数据内容，观察打印结果。

# 以迭代的形式读取数据
for batch_id, data in enumerate(train_reader()):
    # 获得图像数据，并转为float32类型的数组
    img_data = np.array([x[0] for x in data]).astype('float32')
    # 获得图像标签数据，并转为float32类型的数组
    label_data = np.array([x[1] for x in data]).astype('float32')
    # 打印数据形状
    print("图像数据形状和对应数据为:", img_data.shape, img_data[0])
    print("图像标签形状和对应数据为:", label_data.shape, label_data[0])
    break

print("\n打印第一个batch的第一个图像，对应标签数字为{}".format(label_data[0]))

# 反归一化，显示第一batch的第一个图像
import matplotlib.pyplot as plt
img = np.array(img_data[0]+1)*127.5
img = np.reshape(img, [28,

最低0.47元/天解锁文章