【scikit-learn】网格搜索来进行高效的参数调优

最新推荐文章于 2024-03-22 07:58:05 发布

VIP文章 JasonDing1354

最新推荐文章于 2024-03-22 07:58:05 发布

阅读量4.6w

点赞数 10

分类专栏：【ML Experiments】机器学习实验文章标签： scikit-learn

本文链接：https://blog.csdn.net/jasonding1354/article/details/50562522

版权

内容概要¶

如何使用K折交叉验证来搜索最优调节参数
如何让搜索参数的流程更加高效
如何一次性的搜索多个调节参数
在进行真正的预测之前，如何对调节参数进行处理
如何削减该过程的计算代价

1. K折交叉验证回顾¶

交叉验证的过程

选择K的值（一般是10），将数据集分成K等份
使用其中的K-1份数据作为训练数据，另外一份数据作为测试数据，进行模型的训练
使用一种度量测度来衡量模型的预测性能

交叉验证的优点

交叉验证通过降低模型在一次数据分割中性能表现上的方差来保证模型性能的稳定性
交叉验证可以用于选择调节参数、比较模型性能差别、选择特征

交叉验证的缺点

交叉验证带来一定的计算代价，尤其是当数据集很大的时候，导致计算过程会变得很慢

2. 使用GridSearchCV进行高效调参¶

GridSearchCV根据你给定的模型自动进行交叉验证，通过调节每一个参数来跟踪评分结果，实际上，该过程代替了进行参数搜索时的for循环过程。

In [1]:

from sklearn.datasets import load_iris
from sklearn.neighbors import KNeighborsClassifier
import matplotlib.pyplot as plt
%matplotlib inline

from sklearn.grid_search import GridSearchCV

In [2]:

# read in the iris data
iris = load_iris()

# create X (features) and y (response)
X = iris.data
y = iris.target

In [3]:

# define the parameter values that should be searched
k_range = range(1, 31)
print k_range

[1, 2, 3, 4, 5, 6, 7, 8, 9, 10, 11, 12, 13, 14, 15, 16, 17, 18, 19, 20, 21, 22, 23, 24, 25, 26, 27, 28, 29, 30]

In [4]:

# create a parameter grid: map the parameter names to the values that should be searched
# 下面是构建parameter grid，其结构是key为参数名称，value是待搜索的数值列表的一个字典结构
param_grid = dict(n_neighbors=k_range)
print param_grid

{'n_neighbors': [1, 2, 3, 4, 5, 6, 7, 8, 9, 10, 11, 12, 13, 14, 15, 16, 17, 18, 19, 20, 21, 22, 23, 24, 25, 26, 27, 28, 29, 30]}

In [5]:

knn = KNeighborsClassifier(n_neighbors=5)
# instantiate the grid
# 这里GridSearchCV的参数形式和cross_val_score的形式差不多，其中param_grid是parameter grid所对应的参数
# GridSearchCV中的n_jobs设置为-1时，可以实现并行计算（如果你的电脑支持的情况下）
grid = GridSearchCV(knn, param_grid, cv=10, scoring='accuracy')

我们可以知道，这里的grid search针对每个参数进行了10次交叉验证，并且一共对30个参数进行相同过程的交叉验证

In [6]:

grid.fit(X, y)

Out[6]:

GridSearchCV(cv=10, error_score='raise',
       estimator=KNeighborsClassifier(algorithm='auto', leaf_size=30, metric='minkowski',
           metric_params=None, n_neighbors=5, p=2, weights='uniform'),
       fit_params={}, iid=True, loss_func=None, n_jobs=1,
       param_grid={'n_neighbors': [1, 2, 3, 4, 5, 6, 7, 8, 9, 10, 11, 12, 13, 14, 15, 16, 17, 18, 19, 20, 21, 22, 23, 24, 25, 26, 27, 28, 29, 30]},
       pre_dispatch='2*n_jobs

最低0.47元/天解锁文章

JasonDing1354

关注

10
点赞
踩
65

收藏

觉得还不错? 一键收藏
7
评论
【scikit-learn】网格搜索来进行高效的参数调优

内容概要¶如何使用K折交叉验证来搜索最优调节参数如何让搜索参数的流程更加高效如何一次性的搜索多个调节参数在进行真正的预测之前，如何对调节参数进行处理如何削减该过程的计算代价1. K折交叉验证回顾¶交叉验证的过程选择K的值（一般是10），将数据集分成K等份使用其中的K-1份数据作为训练数据，另外一份数据作为测试数据，进行模型的训练使用一种度量测度来衡量
复制链接

扫一扫