SDU项目实训记录2.3——特征选择
一、基础
在评分卡中,特征选择是非常重要的工作。
1、特征选择的必要性
- 变量间可能存在共线性、线性相关性,会造成信息冗余,并且造成信息冗余
- 会加剧后期验证部署的负担
- 业务上含义不充分
2、特征信息度的计算和意义
变量挑选依据:
- 使用随机森林计算变量特征重要性
- 基于AIC逐步回归
- 特征信息度IV
二、方法
1、单变量分析
根据变量属性,从初选名单筛选出合适的变量
需要分析的变量属性:
- 变量显著性(高IV值)
- 单一区间占比不应该太高
在本项目中,我们选用IV(information Value) 进行单变量分析,是衡量特征包含预测变量浓度的一种指标。
计算方法如下:
根据IV值进行特征选择:
- 非负指标 - 高IV值的变量表示该变量与目标变量关联度高 - 目标标量只能是二分类
- 过高的IV可能存在风险
- 特征分箱越细,IV越高
(1)在上篇博客中,我们已经完成了各分箱IV值的计算,各特征值的IV值如下:
(2)对应特征区间,我们可以得到:
(3)按降序绘制各特征的IV值分布如下:
2、多变量分析
变量两两相关性
当相关性过高的,只能选择一个:
- 可以选择IV值高的变量
- 可以选择分箱均衡的
(1)计算相关性矩阵:
(2)生成热力图:
因为根据对角线对称,所以为了便于查看可以只取下对角矩阵,并用暖色调代表正相关,冷色调代表负相关:
对有明显相关的’NumberOfTime30-59DaysPastDueNotWorse’,‘NumberOfTime60-89DaysPastDueNotWorse’,'NumberOfTimes90DaysLate’三个特征绘制与各特征的相关性柱状图:
3、特征删除
由单变量分析可知: RevolvingUtilizationOfUnsecuredLines 价值过高,很可疑,删除;
由多变量分析可知: 多少天逾期之间相关性极高,去2留1,我去除的是同样价值过高的前两名’NumberOfTimes90DaysLate和 ‘NumberRealEstateLoansOrLines’。