猫狗图像分类-划分数据集

knighthood2001

已于 2024-07-06 09:42:29 修改

阅读量247

点赞数 3

分类专栏：图像分类 Pytorch 文章标签：分类人工智能数据挖掘

于 2024-07-06 08:43:29 首次发布

本文链接：https://blog.csdn.net/knighthood2001/article/details/140223430

版权

Pytorch 同时被 2 个专栏收录

21 篇文章 3 订阅

订阅专栏

图像分类

2 篇文章 0 订阅

订阅专栏

📚博客主页：knighthood2001
✨公众号：认知up吧（目前正在带领大家一起提升认知，感兴趣可以来围观一下）
🎃知识星球：【认知up吧|成长|副业】介绍
❤️如遇文章付费，可先看看我公众号中是否发布免费文章❤️
🙏笔者水平有限，欢迎各位大佬指点，相互学习进步！

首先，我们的数据如下，猫和狗的图片在里面，但是没有划分过训练集和测试集。
在这里插入图片描述

运行下面这个代码，就能把数据划分。

import os
from shutil import copy
import random

def mkdir(directory):
    if not os.path.exists(directory):
        os.makedirs(directory)


# TODO 获取data文件夹下所有文件夹名（即需要分类的类名）
file_path = 'data_cat_dog'
flower_class = [cla for cla in os.listdir(file_path)]

# 创建 训练集train 文件夹，并由类名在其目录下创建5个子目录
mkdir('data/train')
for cla in flower_class:
    mkdir('data/train/' + cla)

# 创建 测试集文件夹，并由类名在其目录下创建子目录
mkdir('data/test')
for cla in flower_class:
    mkdir('data/test/' + cla)

# 划分比例，训练集 : 测试集 = 9 : 1
split_rate = 0.1

# 遍历所有类别的全部图像并按比例分成训练集和验证集
for cla in flower_class:
    cla_path = file_path + '/' + cla + '/'  # 某一类别的子目录
    images = os.listdir(cla_path)  # iamges 列表存储了该目录下所有图像的名称
    num = len(images)
    eval_index = random.sample(images, k=int(num * split_rate))  # 从images列表中随机抽取 k 个图像名称
    for index, image in enumerate(images):
        # eval_index 中保存验证集val的图像名称
        if image in eval_index:
            image_path = cla_path + image
            new_path = 'data/test/' + cla
            copy(image_path, new_path)  # 将选中的图像复制到新路径

        # 其余的图像保存在训练集train中
        else:
            image_path = cla_path + image
            new_path = 'data/train/' + cla
            copy(image_path, new_path)
        print("\r[{}] processing [{}/{}]".format(cla, index + 1, num), end="")  # processing bar
    print()

print("processing done!")