前言:
当一张评分卡构建完成时,筛选出一组特征生成了分数,我们会想要知道这个分数是否靠谱,即是否可以依赖这个分数将好坏客户区分开来,这个时候就需要评判评分卡有效性的指标。
测量评分卡好坏区分能力的指标有许多,本文就为大家介绍几个常用的定量指标:
- 散度(分数为连续函数)与信息比率(IV);
- KS值
在这篇文章当中,花了极大的笔墨从数学的角度证明了KS值的存在性和函数性质问题:
- 为什么F(s|B)为凹函数、F(s|G)为凸函数?
- 为什么F(s|B)-F(s|G)存在极大值(最大值)?
- 为什么F(s|B)曲线在F(s|G)曲线之上?
3. ROC曲线、AUROC值与GINI系数。
----------------------------------------------------------------------------------------------
一、 散度与IV值
1.1 散度
散度为信息比率的连续版本。而评分卡分数是基于有限样本计算出的分数分布,并不一定是完全连续函数,所以就衍生出了离散版本的散度----信息比率IV。
【定义1】给定评分卡分数s,令f(s|B)、f(s|G)分别为好客户与坏客户的分数概率密度函数,定义散度为
。
下面,考虑3个极端情况去理解散度的实际应用:
- 坏客户的分数始终大于好客户的分数:if
, so. 这时,模型对好坏客户完全没有区分度。
- 坏客户的分数始终大于好客户的分数:if
, so. 这时,模型对好坏客户仍完全没有区分度。
- 坏客户的分数始终小于好客户的分数:if
, so. 如果每个分数档,好客户与坏客户分差越大,散度D就越大,那么模型对好坏客户的区分度就越好。
1.2 信息比率IV
上文也说过,信息比率IV是散度的离散版本,即将连续性函数s离散化就能得到信息比率:将一组分数分成细小的分数区间,在每个区间上对函数进行求和,代替连续函数的积分。
【定义2】 假设存在n个区间,i=1,2,...,n,每个区间的好坏客户数量为
,且整体样本的好坏客户