ks 曲线_一文读懂评分卡的IV、KS、AUC、GINI指标

最新推荐文章于 2021-05-31 09:55:33 发布

Alin John

最新推荐文章于 2021-05-31 09:55:33 发布

阅读量3.2k

点赞数 1

文章标签： ks 曲线

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/weixin_30982943/article/details/112469117

版权

本文介绍了评价评分卡有效性的常用指标，包括散度（IV）、KS值、AUC和GINI系数。通过数学解析探讨了KS值的凹凸性、极大值存在性及F(s|B)曲线为何总在F(s|G)之上。同时，阐述了ROC曲线和AUROC值的概念，以及它们在模型区分能力评估中的应用。GINI系数作为AUC的另一种表达形式，用于量化模型的区分能力。

摘要由CSDN通过智能技术生成

前言：

当一张评分卡构建完成时，筛选出一组特征生成了分数，我们会想要知道这个分数是否靠谱，即是否可以依赖这个分数将好坏客户区分开来，这个时候就需要评判评分卡有效性的指标。

测量评分卡好坏区分能力的指标有许多，本文就为大家介绍几个常用的定量指标：

散度（分数为连续函数）与信息比率（IV);
KS值

在这篇文章当中，花了极大的笔墨从数学的角度证明了KS值的存在性和函数性质问题：

KS分布

为什么F(s|B)为凹函数、F(s|G)为凸函数？
为什么F(s|B)-F(s|G)存在极大值（最大值）？
为什么F(s|B)曲线在F(s|G)曲线之上？

3. ROC曲线、AUROC值与GINI系数。

----------------------------------------------------------------------------------------------

一、散度与IV值

1.1 散度

散度为信息比率的连续版本。而评分卡分数是基于有限样本计算出的分数分布，并不一定是完全连续函数，所以就衍生出了离散版本的散度----信息比率IV。

【定义1】给定评分卡分数s，令f(s|B)、f(s|G)分别为好客户与坏客户的分数概率密度函数，定义散度为

。

下面，考虑3个极端情况去理解散度的实际应用：

坏客户的分数始终大于好客户的分数：if
, so

. 这时，模型对好坏客户完全没有区分度。
坏客户的分数始终大于好客户的分数：if
, so

. 这时，模型对好坏客户仍完全没有区分度。
坏客户的分数始终小于好客户的分数：if
, so

. 如果每个分数档，好客户与坏客户分差越大，散度D就越大，那么模型对好坏客户的区分度就越好。

1.2 信息比率IV

上文也说过，信息比率IV是散度的离散版本，即将连续性函数s离散化就能得到信息比率：将一组分数分成细小的分数区间，在每个区间上对函数进行求和，代替连续函数的积分。

【定义2】假设存在n个区间，i=1,2,...,n，每个区间的好坏客户数量为

,且整体样本的好坏客户

最低0.47元/天解锁文章

关注

1
点赞
踩
7

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。