数据挖掘实践（资金流入流出预测）—5.特征工程

最新推荐文章于 2023-03-06 21:53:20 发布

棠糖䉎

最新推荐文章于 2023-03-06 21:53:20 发布

阅读量278

点赞数

分类专栏：数据挖掘

本文链接：https://blog.csdn.net/m0_46228848/article/details/108190396

版权

本文介绍了数据挖掘中的特征工程，强调其在决定模型上限中的重要性。内容涵盖特征选择的三个方面：Filter方法，包括方差选择法、相关系数法和卡方检验。通过sk-learn库的函数，展示了如何运用这些方法筛选有意义的特征，以提升机器学习模型的性能。

摘要由CSDN通过智能技术生成

引言
在数据预处理之前，我们先来了解下特征工程。
特征工程指的是在原始数据之中提取，构造，选择数据特征的过程。
有句话是：“数据和特征工程决定了你能到达的上限，机器学习模型决定了你能多么逼近这个上限”。特征工程是数据挖掘过程中一步十分重要的步骤，也是建模步骤的基础和准备。

一、特征选择

当数据预处理完成后，我们需要选择有意义的特征输入机器学习的算法和模型进行训练。通常来说，从两个方面考虑来选择特征：

特征是否发散：如果一个特征不发散，例如方差接近于0，也就是说样本在这个特征上基本上没有差异，这个特征对于样本的区分并没有什么用。

特征与目标的相关性：这点比较显见，与目标相关性高的特征，应当优选选择。除方差法外，本文介绍的其他方法均从相关性考虑。

根据特征选择的形式又可以将特征选择方法分为3种：

Filter：过滤法，按照发散性或者相关性对各个特征进行评分，设定阈值或者待选择阈值的个数，选择特征。

Wrapper：包装法，根据目标函数（通常是预测效果评分），每次选择若干特征，或者排除若干特征。

Embedded：嵌入法，先使用某些机器学习的算法和模型进行训练，得到各个特征的权值系数，根据系数从大到小选择特征。类似于Filter方法，但是是通过训练来确定特征的优劣。

我们接下来使用sk-learn中的feature_selection库来进行特征选择。

最低0.47元/天解锁文章

棠糖䉎

关注

0
点赞
踩
1

收藏

觉得还不错? 一键收藏
0
评论
数据挖掘实践（资金流入流出预测）—5.特征工程

数据挖掘实践（资金流入流出预测）—5.特征工程一、特征选择1.1 Filter1.1.1 方差选择法1.1.2 相关系数法1.1.3 卡方检验引言在数据预处理之前，我们先来了解下特征工程。特征工程指的是在原始数据之中提取，构造，选择数据特征的过程。有句话是：“数据和特征工程决定了你能到达的上限，机器学习模型决定了你能多么逼近这个上限”。特征工程是数据挖掘过程中一步十分重要的步骤，也是建模步骤的基础和准备。一、特征选择当数据预处理完成后，我们需要选择有意义的特征输入机器学习的算法和模型进行训练。通
复制链接

扫一扫

专栏目录