07特征选择与降维

最新推荐文章于 2023-12-27 17:59:08 发布

水果翻炒数据

最新推荐文章于 2023-12-27 17:59:08 发布

阅读量315

点赞数 1

分类专栏：机器学习文本分析文章标签：特征选择机器学习文本挖掘

本文链接：https://blog.csdn.net/qq_38630608/article/details/88087873

版权

本文探讨了特征选择的重要性，介绍了过滤法、包裹法和嵌入法等特征选择策略，并通过代码示例展示了方差选择法和相关系数法。同时，文章还阐述了特征选择与降维的区别，帮助理解如何在数据预处理中有效地挑选特征。

摘要由CSDN通过智能技术生成

一、特征选择

当数据预处理完成后，我们需要选择有意义的特征输入机器学习的算法和模型进行训练。通常来说，从两个方面考虑来选择特征：

特征是否发散：如果一个特征不发散，例如方差接近于0，也就是说样本在这个特征上基本上没有差异，这个特征对于样本的区分并没有什么用。  
特征与目标的相关性：这点比较显见，与目标相关性高的特征，应当优选选择。除方差法外，本文介绍的其他方法均从相关性考虑。

根据特征选择的形式又可以将特征选择方法分为3种：

Filter：过滤法，按照发散性或者相关性对各个特征进行评分，设定阈值或者待选择阈值的个数，选择特征。  
Wrapper：包装法，根据目标函数（通常是预测效果评分），每次选择若干特征，或者排除若干特征。  
Embedded：嵌入法，先使用某些机器学习的算法和模型进行训练，得到各个特征的权值系数，根据系数从大到小选择特征。类似于Filter方法，但是是通过训练来确定特征的优劣。

二、特征选择代码用法

一）Filter

1、方差选择法

使用方差选择法，先要计算各个特征的方差，然后根据阈值，选择方差大于阈值的特征。

看案例

import pandas as pd
from sklearn.externals import joblib
corpus=list(pd.read_table('words.txt').iloc[:,0])
corpus=corpus[10:20]
from sklearn.feature_extraction.text import TfidfVectorizer
#读取tfidf模型
vectorizer= joblib.load('tfidf_model2.m')
X=vectorizer.fit_transform(corpus

最低0.47元/天解锁文章

水果翻炒数据

关注

1
点赞
踩
1

收藏

觉得还不错? 一键收藏
0
评论
07特征选择与降维

一、特征选择当数据预处理完成后，我们需要选择有意义的特征输入机器学习的算法和模型进行训练。通常来说，从两个方面考虑来选择特征：特征是否发散：如果一个特征不发散，例如方差接近于0，也就是说样本在这个特征上基本上没有差异，这个特征对于样本的区分并没有什么用。特征与目标的相关性：这点比较显见，与目标相关性高的特征，应当优选选择。除方差法外，本文介绍的其他方法均从相关性考虑。根据特征选择...
复制链接

扫一扫

专栏目录