数据预处理-相关性过滤（F检验和互信息法）

最新推荐文章于 2024-02-29 00:14:14 发布

Justin_stf

最新推荐文章于 2024-02-29 00:14:14 发布

阅读量7.5k

点赞数 1

分类专栏：机器学习

本文链接：https://blog.csdn.net/weixin_41798592/article/details/101355584

版权

本文介绍了数据预处理中的特征选择方法——F检验和互信息法。F检验用于捕捉特征与标签间的线性关系，适用于正态分布数据，而互信息法能找出线性及非线性关系，更为强大。两者都与SelectKBest类结合使用，通过统计量选择相关特征。

摘要由CSDN通过智能技术生成

F检验

     F检验，又称ANOVA，方差齐性检验，是用来捕捉每个特征与标签之间的线性关系的过滤方法。它即可以做回归也可以做分类，因此包含feature_selection.f_classif（F检验分类） 和 feature_selection.f_regression（F检验回归）两个类。其中F检验分类用于标签是离散型变量的数据，而F检验回归用于标签是连续型变量的数据。
     和卡方检验一样，这两个类需要和类SelectKBest连用，并且我们也可以直接通过输出的统计量来判断我们到底要设置一个什么样的K。需要注意的是，F检验在数据服从正态分布时效果会非常稳定，因此如果使用F检验过滤，我们会先将数据转换成服从正态分布的方式。
     F检验的本质是寻找两组数据之间的线性关系，其原假设是”数据不存在显著的线性关系“。它返回F值和p值两个统计量。和卡方过滤一样，我们希望选取p值小于0.05或0.01的特征，这些特征与标签时显著线性相关的，而p值大于0.05或0.01的特征则被我们认为是和标签没有显著线性关系的特征，应该被删除。以F检验的分类为例，我们继续在数字数据集上来进行特征选择.
在这里插入图片描述