机器学习模型特征选择方法汇总线性，随机森林，

最新推荐文章于 2024-07-22 10:38:09 发布

SamWang_333

最新推荐文章于 2024-07-22 10:38:09 发布

阅读量1.5k

点赞数 1

分类专栏：机器学习 dataprepare

本文链接：https://blog.csdn.net/qq_38844711/article/details/103526375

版权

特征选择是机器学习中的关键步骤，旨在减少过拟合，提高模型准确性和运行效率。本文介绍了三种特征选择方法：过滤法（如Pearson相关系数、卡方检验、互信息和方差选择法）、包装法（如递归特征消除）和嵌入法（如L1正则化的模型选择）。每种方法都有其优缺点和适用场景，选择合适的特征选择策略对于提升模型性能至关重要。

摘要由CSDN通过智能技术生成

特征选择是特征工程里的一个重要问题，其目标是寻找最优特征子集。特征选择能剔除不相关(irrelevant)或冗余(redundant )的特征，从而达到减少特征个数，提高模型精确度，减少运行时间的目的。另一方面，选取出真正相关的特征简化模型，协助理解数据产生的过程。并且常能听到“数据和特征决定了机器学习的上限，而模型和算法只是逼近这个上限而已”，由此可见其重要性。但是它几乎很少出现于机器学习书本里面的某一章。然而在机器学习方面的成功很大程度上在于如果使用特征工程。

之所以要考虑特征选择，是因为机器学习经常面临过拟合的问题。过拟合的表现是模型参数太贴合训练集数据，模型在训练集上效果很好而在测试集上表现不好，也就是在高方差。简言之模型的泛化能力差。过拟合的原因是模型对于训练集数据来说太复杂，要解决过拟合问题，一般考虑如下方法：

收集更多数据
通过正则化引入对复杂度的惩罚
选择更少参数的简单模型
对数据降维（降维有两种方式：特征选择和特征抽取）
其中第1条一般是很难做到的，一般主要采用第2和第4点

一般流程
特征选择的一般过程：

生成子集：搜索特征子集，为评价函数提供特征子集
评价函数：评价特征子集的好坏
停止准则：与评价函数相关，一般是阈值，评价函数达到一定标准后就可停止搜索
验证过程：在验证数据集上验证选出来的特征子集的有效性
但是，当特征数量很大的时候，这个搜索空间会很大，如何找最优特征还是需要一些经验结论。

三大类方法
根据特征选择的形式，可分为三大类：

Filter(过滤法)：按照发散性或相关性对各个特征进行评分，设定阈值或者待选择特征的个数进行筛选
Wrapper(包装法)：根据目标函数（往往是预测效果评分），每次选择若干特征，或者排除若干特征
Embedded(嵌入法)：先使用某些机器学习的模型进行训练，得到各个特征的权值系数，根据系数从大到小选择特征（类似于Filter，只不过系数是通过训练得来的）
过滤法
基本想法是：分别对每个特征 x_i ，计算 x_i 相对于类别标签 y 的信息量 S(i) ，得到 n 个结果。然后将 n 个 S(i) 按照从大到小排序，输出前 k 个特征。显然，这样复杂度大大降低。那么关键的问题就是使用什么样的方法来度量 S(i) ，我们的目标是选取与 y 关联最密切的一些特征x_i 。

Pearson相关系数
卡方验证
互信息和最大信息系数
距离相关系数
方差选择法
Pearson相关系数
皮尔森相关系数是一种最简单的，能帮助理解特征和响应变量之间关系的方法，衡量的是变量之间的线性相关性，结果的取值区间为[-1,1] ， -1 表示完全的负相关(这个变量下降，那个就会上升)， +1 表示完全的正相关， 0 表示没有线性相关性。Pearson Correlation速度快、易于计算，经常在拿到数据(经过清洗和特征提取之后的)之后第一时间就执行。Scipy的pearsonr方法能够同时计算相关系数和p-value

import numpy as np
from scipy.stats import pearsonr

np.random.seed(0)
size = 300
x = np.random.normal(0, 1, size)
print(“Lower noise：”, pearsonr(x, x + np.random.normal(0, 1, size)))
print(“Higher noise：”, pearsonr(x,