零基础入门CV赛事—街景字符编码识别—task3字符识别模型

最新推荐文章于 2020-06-03 00:43:06 发布

Libaididi

最新推荐文章于 2020-06-03 00:43:06 发布

阅读量245

点赞数

分类专栏： CNN

本文链接：https://blog.csdn.net/Libaididi/article/details/106321327

版权

本文介绍了卷积神经网络（CNN）的基础知识，包括CNN的结构和优势，以及其在字符识别中的应用。通过LeNet-5等经典模型的历史发展，展示了深度学习在计算机视觉领域的进步。接着，使用PyTorch构建了一个简单的CNN模型，用于字符识别任务的训练和测试。

摘要由CSDN通过智能技术生成

字符识别模型

本次将会学习卷积神经网络（Convolutional Neural Network, CNN）的常见层，并从头搭建一个字符识别模型。

CNN

卷积神经网络（简称CNN）是一类特殊的人工神经网络，是深度学习中重要的一个分支。CNN在很多领域都表现优异，精度和速度比传统计算学习算法高很多。特别是在计算机视觉领域，CNN是解决图像分类、图像检索、物体检测和语义分割的主流模型。
CNN每一层由众多的卷积核组成，每个卷积核对输入的像素进行卷积操作，得到下一次的输入。随着网络层的增加卷积核会逐渐扩大感受野，并缩减图像的尺寸。
在这里插入图片描述
CNN是一种层次模型，输入的是原始的像素数据。CNN通过卷积（convolution）、池化（pooling）、非线性激活函数（non-linear activation function）和全连接层（fully connected layer）构成。
如下图所示为LeNet网络结构，是非常经典的字符识别模型。两个卷积层，两个池化层，两个全连接层组成。卷积核都是5×5，stride=1，池化层使用最大池化。
在这里插入图片描述
通过多次卷积和池化，CNN的最后一层将输入的图像像素映射为具体的输出。如在分类任务中会转换为不同类别的概率输出，然后计算真实标签与CNN模型的预测结果的差异，并通过反向传播更新每层的参数，并在更新完成后再次前向传播，如此反复直到训练完成。
与全连接神经网络相比，卷积神经网络实现了权值共享，每个卷积核都在整个图片上共享参数，减少了深度模型的参数数量，训练时节约了训练时间。
与传统机器学习模型相比，CNN具有一种端到端（End to End）的思路。在CNN训练的过程中是直接从图像像素到最终的输出，并不涉及到具体的特征提取和构建模型的过程，也不需要人工的参与。

CNN发展

随着网络结构的发展，研究人员最初发现网络模型结构越深、网络参数越多模型的精度更优。比较典型的是AlexNet、VGG、InceptionV3和ResNet的发展脉络。
在这里插入图片描述

LeNet-5(1998)

在这里插入图片描述

AlexNet(2012)

在这里插入图片描述

VGG-16(2014)

在这里插入图片描述

Inception-v1 (2014)

在这里插入图片描述

ResNet-50 (2015)

在这里插入图片描述

Pytorch构建CNN模型

在上一章节我们学习了如何使用Pytorch来读取赛题数据集，这次我们使用本章学习到的知识构件一个简单的CNN模型，完成字符识别功能。

在Pytorch中构建CNN模型非常简单，只需要定义好模型的参数和正向传播即可，Pytorch会根据正向传播自动计算反向传播。
在本章我们会学习构建一个非常简单的CNN，然后进行训练。这个CNN模型包括两个卷积层，最后并联6个全连接层进行分类。

import torch
torch.manual_seed(0)
torch.backends.cudnn.deterministic = False
torch.backends.cudnn.benchmark = True

import torchvision.models as models
import torchvision.transforms as transforms
import torchvision.datasets as datasets
import torch.nn as nn
import torch.nn.functional as F
import torch.optim as optim
from torch.autograd import Variable
from torch.utils.data.dataset import Dataset

# 定义模型
class SVHN_Model1(nn.Module):
    def