特征重要性排序--Permutation Importance

最新推荐文章于 2025-02-19 10:43:18 发布

大饼博士_cqqian

最新推荐文章于 2025-02-19 10:43:18 发布

阅读量1.3w

点赞数 5

分类专栏： Kaggle笔记文章标签：机器学习

本文链接：https://blog.csdn.net/qian_chun_qiang/article/details/115323852

版权

Kaggle笔记专栏收录该内容

1 篇文章

订阅专栏

特征重要性排序–Permutation Importance

参考：Permutation Importance | Kaggle

相比于其他衡量特征重要性的方法，Permutation Importance的优点：

计算量低
广泛使用和容易理解
与我们要测量特征重要性的属性一致

Permutation Importance的计算是在模型训练完成后进行的，即，模型参数不再改变。如果我们将验证集中的单独一列的数据进行打乱，并保持其他列和目标值不变，那么，预测打乱后的验证集的结果会怎么变化？
在这里插入图片描述

上图示例是将第二列的数据进行shaffle，如果模型预测对该列特征的依赖性很大，那么打乱后，预测精度会受到很大的影响。

具体实施流程：

训练模型
打乱其中一列的数据，用该数据集进行预测，评估预测精度下降来提现该特征变量的重要性
将验证数据集还原，并重复第二步，分析其他特征变量

代码示例：

import numpy as np
import pandas as pd
from sklearn.model_selection import train_test_split
from sklearn.ensemble import RandomForestClassifier

data = pd.read_csv('../input/fifa-2018-match-statistics/FIFA 2018 Statistics.csv')
y = (data['Man of the Match'] == "Yes")  # Convert from string "Yes"/"No" to binary
feature_names = [i for i in data.columns if data[i].dtype in [np.int64]]
X = data[feature_names]
train_X, val_X, train_y, val_y = train_test_split(X, y, random_state=1)
my_model = RandomForestClassifier(n_estimators=100,
                                  random_state=0).fit(train_X, train_y)

import eli5
from eli5.sklearn import PermutationImportance

perm = PermutationImportance(my_model, random_state=1).fit(val_X, val_y)
eli5.show_weights(perm, feature_names = val_X.columns.tolist())