昇思25天学习打卡营第4天 |数据变换 Transforms-CSDN博客

本文链接：https://blog.csdn.net/qq_42001096/article/details/139889304

1. 数据变换（Transforms）概述

在深度学习中，原始数据通常需要经过预处理才能用于训练神经网络。MindSpore提供了多种数据变换操作，这些操作可以通过map方法应用到数据集上，以实现数据预处理。

2. Common Transforms

Compose

Compose是一个容器，它可以接收一系列数据增强操作，并将它们组合成一个单一的数据增强操作。例如，在Mnist数据集上，可以使用Compose来组合Rescale、Normalize和HWC2CHW变换。

3. Vision Transforms

mindspore.dataset.vision模块提供了针对图像数据的变换操作：

Rescale：调整图像像素值的大小，接受缩放因子和偏移量作为参数。
Normalize：对图像进行归一化处理，需要指定每个通道的均值和标准差。
HWC2CHW：转换图像格式，将(height, width, channel)格式转换为(channel, height, width)格式。

4. Text Transforms

mindspore.dataset.text模块提供了针对文本数据的变换操作：

PythonTokenizer：分词操作，允许用户自定义分词策略。
Lookup：词表映射变换，将Token转换为Index。使用前需要构建词表。

5. Lambda Transforms

Lambda变换允许用户加载任意定义的Lambda函数来进行数据变换。Lambda函数是一种匿名函数，由一个单独表达式组成，提供高度的灵活性。

示例代码

以下是一些示例代码，展示了如何使用这些变换：

下载和加载数据：

import numpy as np
from mindspore.dataset import MnistDataset

url = "https://mindspore-website.obs.cn-north-4.myhuaweicloud.com/notebook/datasets/MNIST_Data.zip"
path = download(url, "./", kind="zip", replace=True)
train_dataset = MnistDataset('MNIST_Data/train')

使用Compose组合变换：

from mindspore.dataset import transforms, vision

composed = transforms.Compose([
    vision.Rescale(1.0 / 255.0, 0),
    vision.Normalize(mean=(0.1307,), std=(0.3081,)),
    vision.HWC2CHW()
])
train_dataset = train_dataset.map(composed, 'image')

文本数据的变换：

from mindspore.dataset import text, GeneratorDataset

texts = ['Welcome to Beijing']
test_dataset = GeneratorDataset(texts, 'text')
test_dataset = test_dataset.map(text.PythonTokenizer(my_tokenizer))
vocab = text.Vocab.from_dataset(test_dataset)
test_dataset = test_dataset.map(text.Lookup(vocab))

Lambda变换：

test_dataset = GeneratorDataset([1, 2, 3], 'data', shuffle=False)
test_dataset = test_dataset.map(lambda x: x * 2)

这些变换操作使得MindSpore能够灵活地处理不同类型的数据，以适应各种深度学习任务的需求。如果您需要进一步的帮助或有特定的问题，请随时提问。