pytorch 中数据操作和预处理

最新推荐文章于 2023-06-14 18:04:31 发布

Sanada Hiroyuki

最新推荐文章于 2023-06-14 18:04:31 发布

阅读量997

点赞数

分类专栏： pytorch 文章标签： pytorch 深度学习机器学习

本文链接：https://blog.csdn.net/m0_66579939/article/details/122654819

版权

本文介绍了 PyTorch 中如何利用 torch.utils.data 模块进行数据预处理，包括高维数组、图像和文本数据的处理。对于高维数组，强调了数据读取和转换的重要性；图像数据部分提到了 torchvision.datasets 和 transforms 模块的应用；文本数据则提到使用 torchtext 进行预处理。这些预处理步骤是将数据适配到深度学习模型的关键。

摘要由CSDN通过智能技术生成

在 pytorch 中 torch.utils.data 模块包含着一些常用的数据预处理的操作，主要用于数据的读取、切分、准备等。

类	功能
torch.utils.data.TensorDataset()	将数据处理为张量
torch.utils.data.ConcatDataset()	连接多个数据集
torch.utils.data.Subset()	根据索引获取数据集的子集
torch.utils.data.DataLoader()	数据加载器
torch.utils.data.random_split()	随机将数据集拆分为给定长度的非重叠新数据集

使用这些类能够对高维数组、图像等各种类型的数据进行预处理，以便深度学习模型的使用。针对文本数据的处理可以使用 torchtext 库进行相关的数据准备操作。

高维数组
在很多情况下，我们需要从文本（如 csv 文件）中读取高维数组数据，这类数据的特征是每个样本都有很多个预测变量（特征）和一个被预测变量（目标标签），特征通常是数值变量或者离散变量，被预测变量如果是连续的数值，则对应着回归问题的预测，如果是离散变量，则对应着分类问题。在使用 pytorch 建立模型对数据进行学习时，通常要对数据进行预处理，并将它们转化为网络需要的数据形式。
图像数据
torchvision 中的 datasets 模块包含多种常用的分类数据集下载及导入函数，可以很方便地导入数据以及验证所建立的模型效果。data