sklearn中的KFold、StratifiedKFold k折交叉切分的区别

最新推荐文章于 2023-04-25 08:00:00 发布

看穿数据之美

最新推荐文章于 2023-04-25 08:00:00 发布

阅读量5.4k

点赞数 1

分类专栏： python 深度学习/机器学习

深度学习/机器学习同时被 2 个专栏收录

157 篇文章 3 订阅

订阅专栏

python

63 篇文章 2 订阅

订阅专栏

sklearn中的Kfold和StratifiedKFold都是k折交叉切分。

但是StratifiedKFold是分层采样，确保训练集，测试集中各类别样本的比例与原始数据集中相同。

例子：

import numpy as np 
from sklearn.model_selection import KFold,StratifiedKFold

X=np.array([
    [1,2,3,4],
    [11,12,13,14],
    [21,22,23,24],
    [31,32,33,34],
    [41,42,43,44],
    [51,52,53,54],
    [61,62,63,64],
    [71,72,73,74]
])

y=np.array([1,1,0,0,1,1,0,0])
#n_folds这个参数没有，引入的包不同，
floder = KFold(n_splits=4,random_state=0,shuffle=False)
sfolder = StratifiedKFold(n_splits=4,random_state=0,shuffle=False)

for train, test in sfolder.split(X,y):
    print('Train: %s | test: %s' % (train, test))
    print(" ")

for train, test in floder.split(X,y):
    print('Train: %s | test: %s' % (train, test))
    print(" ")

结果：

1.
Train: [1 3 4 5 6 7] | test: [0 2]

Train: [0 2 4 5 6 7] | test: [1 3]

Train: [0 1 2 3 5 7] | test: [4 6]

Train: [0 1 2 3 4 6] | test: [5 7]

2.
Train: [2 3 4 5 6 7] | test: [0 1]

Train: [0 1 4 5 6 7] | test: [2 3]

Train: [0 1 2 3 6 7] | test: [4 5]

Train: [0 1 2 3 4 5] | test: [6 7]

分析：可以看到StratifiedKFold 分层采样交叉切分，确保训练集，测试集中各类别样本的比例与原始数据集中相同。

看穿数据之美

关注

1
点赞
踩
5

收藏

觉得还不错? 一键收藏
0
评论
sklearn中的KFold、StratifiedKFold k折交叉切分的区别

sklearn中的Kfold和StratifiedKFold都是k折交叉切分。但是StratifiedKFold是分层采样，确保训练集，测试集中各类别样本的比例与原始数据集中相同。例子：import numpy as npfrom sklearn.model_selection import KFold,StratifiedKFoldX=np.array([ [1,2...
复制链接

扫一扫