机器学习特征选择之卡方检验与互信息

本文转载于:https://blog.csdn.net/yihucha166/article/details/50646615

 

特征选择的主要目的有两点:

1.      减少特征数量提高训练速度,这点对于一些复杂模型来说尤其重要

2.      减少noisefeature以提高模型在测试集上的准确性。一些噪音特征会导致模型出现错误的泛化(generalization),从而在测试集中表现较差。另外从模型复杂度的角度来看,特征越多模型的复杂度越高,也就越容易发生overfitting。

 

 

互信息(Mutual information)和卡方检验(chisquare)是两种比较常用的特征选择方法:

互信息

互信息是用来评价一个事件的出现对于另一个事件的出现所贡献的信息量,具体的计算公式为:

其中U、C代表两个事件,e的取值可以为0或者1,1代表出现这个事件,0代表不出现。

把上述公式拆解为统计形式为:

 

其中N11是表示全部数据中两个事件同时出现的概率,N表示全部事件出现的次数,而N0.则表示N01+N00。

 

 

实际做单特征选择的时候,我们把某个特征是否出现和分类是否正确这两个事件放在一起计算。把得分较高的特征进行保留。

需要注意的是计算时会遇到四种情况也就是,10,11,01,00,对于其中的某一种情况,当计算得到的值是0时,代表了两者没有关联,当计算出的值是正值时,表示两者共同出现的概率比较高,当值为负时,表示两者是负相关。例如:00情况是负值是,表示两者互相排斥,出现A时,B出现的概率就比较小,这个时候往往01情况和10情况的值为正(check)

 

 

卡方检验

 

在统计学中,卡方检验用来评价是两个事件是否独立,也就是P(AB) = P(A)*P(B) 

 

其中E代表当两者独立时期望的数量,例如E11代表两个事件独立时,共同出现的期望值。

具体的计算公式为:

 

相关数据实例:

 

查询卡方分布在自由度为1时的显著性阈值:

 

284远远超过了10.83,所以二者并不独立,存在相关性。

 

卡方检验和互信息的区别

卡方检验对于出现次数较少的特征更容易给出高分。例如某一个特征就出现过一次在分类正确的数据中,则该特征会得到相对高的分数,而互信息则给分较低。其主要原因还是由于互信息在外部乘上了一个该类型出现的概率值,从而打压了出现较少特征的分数。

实验结果:

如果export只出现一次,且poultry为1

则在MI中的r11中log里面结果是774106/27652,但是外部的P11非常小只有1/N

 

在卡方检验中,E11的值为N*1/N*(27652/774106), 也就是27652/774106

(1 -27652/774106)^2/27652/774106

没有再计算N11的比例,相对来说值会大一些

 

刚开始时,卡方检验会选择一些小众特征,覆盖率不好,噪音较大,所以效果不如互信息方法,但是从100开始会选择到一些较好的特征,整体效果有所上升。

 

 

这两种方法都属于贪心方法,没有考虑到已选择特征和待选特征之间的相关性,并不能得到最优的情况。但是速度方面会非常快。

 

其他需要考虑的地方:是否特征选择的时候,计算概率,通过统计的方法对于一些小众特征偏差较大,通过增加先验概率的方法进行平滑可以优化结果。

  • 1
    点赞
  • 3
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
机器学习是一种人工智能(AI)的子领域,致力于研究如何利用数据和算法让计算机系统具备学习能力,从而能够自动地完成特定任务或者改进自身性能。机器学习的核心思想是让计算机系统通过学习数据中的模式和规律来实现目标,而不需要显式地编程。 机器学习应用非常广泛,包括但不限于以下领域: 图像识别和计算机视觉: 机器学习在图像识别、目标检测、人脸识别、图像分割等方面有着广泛的应用。例如,通过深度学习技术,可以训练神经网络来识别图像中的对象、人脸或者场景,用于智能监控、自动驾驶、医学影像分析等领域。 自然语言处理: 机器学习在自然语言处理领域有着重要的应用,包括文本分类、情感分析、机器翻译、语音识别等。例如,通过深度学习模型,可以训练神经网络来理解和生成自然语言,用于智能客服、智能助手、机器翻译等场景。 推荐系统: 推荐系统利用机器学习算法分析用户的行为和偏好,为用户推荐个性化的产品或服务。例如,电商网站可以利用机器学习算法分析用户的购买历史和浏览行为,向用户推荐感兴趣的商品。 预测和预测分析: 机器学习可以用于预测未来事件的发生概率或者趋势。例如,金融领域可以利用机器学习算法进行股票价格预测、信用评分、欺诈检测等。 医疗诊断和生物信息学: 机器学习在医疗诊断、药物研发、基因组学等领域有着重要的应用。例如,可以利用机器学习算法分析医学影像数据进行疾病诊断,或者利用机器学习算法分析基因数据进行疾病风险预测。 智能交通和物联网: 机器学习可以应用于智能交通系统、智能城市管理和物联网等领域。例如,可以利用机器学习算法分析交通数据优化交通流量,或者利用机器学习算法分析传感器数据监测设备状态。 以上仅是机器学习应用的一部分,随着机器学习技术的不断发展和应用场景的不断拓展,机器学习在各个领域都有着重要的应用价值,并且正在改变我们的生活和工作方式。

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值