数据读取
学习目标
1、学习Python和Pytorch中进行图像读取
2、学会扩增方法和Pytorch读取题目数据
图像读取
因为题目的数据是图像数据,而任务是识别图像中的字符。因此首先需要对数据进行读取。
Pillow
Pillow是Python图像处理函式库(PIL)的一个分支。Pillow提供了常见的图像读取和处理的操作,而且可以与i python notebook无缝集成,是应用比较广泛的库。
Open CV
Open CV是一个跨平台的计算机视觉库,最早由Intel开源。Open CV发展的非常早,拥有众多的计算机视觉、数字图像处理和机器视觉等功能。其在功能上比Pillow更加强大很多,学习成本也高很多。
OpenCV包含了众多的图像处理的功能,此外OpenCV还内置了很多的图像特征处理算法,如关键点检测、边缘检测和直线检测等。
数据扩增
在题目中我们需要对图像进行字符识别,因此需要完成数据的读取操作,同时也需要完成数据扩增(Data Augmentation)操作。
数据扩增介绍
在深度学习中,数据扩增的方法非常重要。数据扩增可以增加训练集的样本,同时也可以有效缓解模型过拟合的情况,也可以给模型带来更强的泛化能力。
数据扩增方法
数据扩增的方法有很多:从颜色空间、尺度空间到样本空间,同时根据不同任务,数据扩增都有相应的区别。
对于图像分类,数据扩增一般不会改变标签;对于物体检测,数据扩增会改变物体坐标位置;对于图像分割,数据扩增会改变像素标签。
在常见的数据扩增方法中,一般会从图像颜色、尺寸、形态、空间和像素等角度进行变换。当然不同的数据扩增方法可以自由进行组合,得到更加丰富的数据扩增方法。
常用的数据扩增库
1、torchvision
链接: https://github.com/pytorch/vision.
pytorch官方提供的数据扩增库,提供了基本的数据数据扩增方法,可以无缝与torch进行集成;但数据扩增方法种类较少,且速度中等;
2、imgaug
链接: https://github.com/aleju/imgaug.
imgaug是常用的第三方数据扩增库,提供了多样的数据扩增方法,且组合起来非常方便,速度较快;
3、albumentations
链接: https://albumentations.readthedocs.io.
是常用的第三方数据扩增库,提供了多样的数据扩增方法,对图像分类、语义分割、物体检测和关键点的检测都支持,而且速度较快。
Pytorch读取数据
在Pytorch中数据是通过Dataset进行封装,并通过DataLoder进行并行读取。所以我们只需要重载一下数据读取的逻辑就可以完成数据的读取。
// import os, sys, glob, shutil, json
import cv2
from PIL import Image
import numpy as np
import torch
from torch.utils.data.dataset import Dataset
import torchvision.transforms as transforms
class SVHNDataset(Dataset):
def __init__(self, img_path, img_label, transform=None):
self.img_path = img_path
self.img_label = img_label
if transform is not None:
self.transform = transform
else:
self.transform = None
def __getitem__(self, index):
img = Image.open(self.img_path[index])