数据处理-padding，DataLoader中collate_fn使用

最新推荐文章于 2024-06-19 09:12:04 发布

ai-ai360

最新推荐文章于 2024-06-19 09:12:04 发布

阅读量1.6k

点赞数

分类专栏： python 文章标签： pytorch

本文链接：https://blog.csdn.net/q_xiami123/article/details/116706928

版权

DataLoader可通过collate_fn参数，对Dataset生成的mini-batch的可迭代数据进行后处理，如数据填充。
collate_fn应当是一个可调用对象，常见的可以是外部定义的函数或者lambda函数。

其接受DataLoader。在不设置collate_fn参数时，DataLoader的mini-batch样本序列样式取决于对应dataset参数的设置。而dataset只要是覆写了__init__、__getitem__和__len__方法的Dataset子类即可，所以其输出形式可以很多样化。而collate_fn对于上述的输出进行进一步的加工，可通过定义采样、切片、组合和数学操作等一系列操作，生成最终的训练数据。

下面的代码如果对x，y处设置调试断点，则第一步跳转就是执行MyDataset的gittiem获取一个mini-batch数据，然后跳转到unify_fn后处理函数处理一个批次数据，所以DataLoader的mini-batch输出是经过unify处理后的输出。

import torch
from torch.utils.data import Dataset, DataLoader

A = torch.randn(8, 3)   # 待拼接的张量A
B = torch.randn(8, 2)   # 待拼接的张量B
C = torch.randn(8, 2)   #　labels张量

# 1. 利用Dataset封装数据集
class MyDataset(Dataset):
    def __init__(self, x1, x2, y):
        assert x1.size(0)==x2.size(0)==y.size(0)
        self.x1, self.x2, self.y = x1, x2, y
        
    def __getitem__(self, idx):
        return (self.x1[idx], self.x2[idx], self.y[idx])

最低0.47元/天解锁文章

ai-ai360

关注

0
点赞
踩
2

收藏

觉得还不错? 一键收藏
0
评论
数据处理-padding，DataLoader中collate_fn使用

DataLoader可通过collate_fn参数，对Dataset生成的mini-batch的可迭代数据进行后处理，如数据填充。collate_fn应当是一个可调用对象，常见的可以是外部定义的函数或者lambda函数。其接受DataLoader。在不设置collate_fn参数时，DataLoader的mini-batch样本序列样式取决于对应dataset参数的设置。而dataset只要是覆写了__init__、__getitem__和__len__方法的Dataset子类即可，所以其输出形式可以很
复制链接

扫一扫

专栏目录