SDU项目实训记录2.3——特征选择(7.8)

一、基础

在评分卡中,特征选择是非常重要的工作。

1、特征选择的必要性

  • 变量间可能存在共线性、线性相关性,会造成信息冗余,并且造成信息冗余
  • 会加剧后期验证部署的负担
  • 业务上含义不充分

2、特征信息度的计算和意义

变量挑选依据:

  • 使用随机森林计算变量特征重要性
  • 基于AIC逐步回归
  • 特征信息度IV

二、方法

1、单变量分析

根据变量属性,从初选名单筛选出合适的变量
需要分析的变量属性:

  • 变量显著性(高IV值)
  • 单一区间占比不应该太高

在本项目中,我们选用IV(information Value) 进行单变量分析,是衡量特征包含预测变量浓度的一种指标。
在这里插入图片描述
计算方法如下:
在这里插入图片描述
根据IV值进行特征选择:

  • 非负指标 - 高IV值的变量表示该变量与目标变量关联度高 - 目标标量只能是二分类
  • 过高的IV可能存在风险
  • 特征分箱越细,IV越高

在这里插入图片描述
(1)在上篇博客中,我们已经完成了各分箱IV值的计算,各特征值的IV值如下:
在这里插入图片描述
(2)对应特征区间,我们可以得到:
在这里插入图片描述
(3)按降序绘制各特征的IV值分布如下:

2、多变量分析

变量两两相关性
当相关性过高的,只能选择一个:

  • 可以选择IV值高的变量
  • 可以选择分箱均衡的

(1)计算相关性矩阵:
在这里插入图片描述
在这里插入图片描述
(2)生成热力图:
在这里插入图片描述
因为根据对角线对称,所以为了便于查看可以只取下对角矩阵,并用暖色调代表正相关,冷色调代表负相关:
在这里插入图片描述
对有明显相关的’NumberOfTime30-59DaysPastDueNotWorse’,‘NumberOfTime60-89DaysPastDueNotWorse’,'NumberOfTimes90DaysLate’三个特征绘制与各特征的相关性柱状图:在这里插入图片描述

3、特征删除

由单变量分析可知: RevolvingUtilizationOfUnsecuredLines 价值过高,很可疑,删除;
由多变量分析可知: 多少天逾期之间相关性极高,去2留1,我去除的是同样价值过高的前两名’NumberOfTimes90DaysLate和 ‘NumberRealEstateLoansOrLines’。

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 打赏
    打赏
  • 1
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论 1
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

宅女不减肥

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值