随机森林调参_随机森林在乳腺癌数据上的调参

最新推荐文章于 2022-05-01 17:19:03 发布

weixin_39833687

最新推荐文章于 2022-05-01 17:19:03 发布

阅读量215

点赞数

文章标签：随机森林调参

本文链接：https://blog.csdn.net/weixin_39833687/article/details/111390917

版权

本文通过乳腺癌数据集演示随机森林调参过程，包括n_estimators、max_depth、max_features、min_samples_leaf和min_samples_split等参数的调整。调参方法基于方差和偏差，通过学习曲线和网格搜索确定最佳参数，最终得出模型的预测上限。

摘要由CSDN通过智能技术生成

这篇文章中，使用基于方差和偏差的调参方法，在乳腺癌数据上进行一次随机森林的调参。乳腺癌数据是sklearn自带的分类数据之一。

案例中，往往使用真实数据，为什么我们要使用sklearn自带的数据呢？因为真实数据在随机森林下的调参过程，往往非常缓慢。真实数据量大，维度高，在使用随机森林之前需要一系列的处理，因此不太适合用来做直播中的案例演示。原本，我为大家准备了kaggle上下载的辨别手写数字的数据，有4W多条记录700多个左右的特征，随机森林在这个辨别手写数字的数据上有非常好的表现，其调参案例也是非常经典，但是由于数据的维度太高，太过复杂，运行一次完整的网格搜索需要四五个小时，因此不太可能拿来给大家进行演示。经典的泰坦尼克号数据，用来调参的话也是需要很长时间，因此我才选择sklearn当中自带的，结构相对清晰简单的数据来为大家做这个案例。大家感兴趣的话，也可以直接到kaggle上进行下载，数据集名称是Digit Recognizer（https://www.kaggle.com/c/digit-recognizer）。

那我们接下来，就用乳腺癌数据，来看看我们的调参代码。

1. 导入需要的库

from sklearn.datasets import load_breast_cancer
from sklearn.ensemble import RandomForestClassifier
from sklearn.model_selection import GridSearchCV
from sklearn.model_selection import cross_val_score
import matplotlib.pyplot as plt
import pandas as pd
import numpy as np

2. 导入数据集，探索数据

data = load_breast_cancer()

data

data.data.shape

data.target

可以看到，乳腺癌数据集有569条记录，30个特征，单看维度虽然不算太高，但是样本量非常少。过拟合的情况可能存在。

3. 简单建模

进行一次简单的建模，看看模型本身在数据集上的效果

rfc = RandomForestClassifier(n_estimators=100,random_state=90)
score_pre = cross_val_score(rfc,data.data,data.target,cv=10).mean()
score_pre

这里可以看到，随机森林在乳腺癌数据上的表现本就还不错，在现实数据集上，基本上不可能什么都不调就看到95%以上的准确率。

4. 调参第一步：无论如何先来调n_estimators

在这里我们选择学习曲线，可以使用网格搜索吗？可以，但是只有学习曲线，才能看见趋势我个人的倾向是，要看见n_esti

最低0.47元/天解锁文章

weixin_39833687

关注

0
点赞
踩
7

收藏

觉得还不错? 一键收藏
0
评论
随机森林调参_随机森林在乳腺癌数据上的调参

这篇文章中，使用基于方差和偏差的调参方法，在乳腺癌数据上进行一次随机森林的调参。乳腺癌数据是sklearn自带的分类数据之一。案例中，往往使用真实数据，为什么我们要使用sklearn自带的数据呢？因为真实数据在随机森林下的调参过程，往往非常缓慢。真实数据量大，维度高，在使用随机森林之前需要一系列的处理，因此不太适合用来做直播中的案例演示。原本，我为大家准备了kaggle上下载的辨别手写数字的数据...
复制链接

扫一扫