详解scikit-learn计算ROC/AUC曲线

最新推荐文章于 2024-07-13 12:42:14 发布

Never-Giveup

最新推荐文章于 2024-07-13 12:42:14 发布

阅读量6.8k

点赞数 6

分类专栏：机器学习文章标签：机器学习 scikit_learn ROCqu'xian AUC

本文链接：https://blog.csdn.net/qq_36653505/article/details/86693148

版权

本文详细介绍了ROC曲线和AUC的概念，包括ROC全称受试者工作特征曲线，AUC为曲线下面积，用于评估二分类模型性能。文章通过解释关键概念如TPR、FPR和截断点，展示了使用scikit-learn计算ROC曲线的步骤，并通过实例分析了计算过程。最后，讨论了如何从ROC曲线中获取AUC值。

摘要由CSDN通过智能技术生成

ROC全称是“受试者工作特征”（Receiver Operating Characteristic）。ROC曲线的面积就是AUC（Area Under the Curve）。AUC用于衡量“二分类问题”机器学习算法性能（泛化能力）。

Python中sklearn直接提供了用于计算ROC的函数，下面就把函数背后的计算过程详细讲一下。

首先，解释几个二分类问题中常用的概念：True Positive, False Positive, True Negative, False Negative。它们是根据真实类别与预测类别的组合来区分的。

假设有一批test样本，这些样本只有两种类别：正例和反例。机器学习算法预测类别如下图（左半部分预测类别为正例，右半部分预测类别为反例），而样本中真实的正例类别在上半部分，下半部分为真实的反例。

在这里插入图片描述

样本中的真实正例类别总数即TP+FN。TPR即True Positive Rate，TPR = TP/(TP+FN)。
同理，样本中的真实反例类别总数为FP+TN。FPR即False Positive Rate，FPR=FP/(TN+FP)。

还有一个概念叫”截断点”。机器学习算法对test样本进行预测后，可以输出各test样本对某个类别的相似度概率。比如t1是P类别的概率为0.3，一般我们认为概率低于0.5，t1就属于类别N。这里的0.5，就是”截断点”。
总结一下，对于计算ROC，最重要的三个概念就是TPR, FPR, 截断点。

截断点取不同的值，TPR和FPR的计算结果也不同。将截断点不同取值下对应的TPR和FPR结果画于二维坐标系中得到的曲线，就是ROC曲线。横轴用FPR表示。

sklearn官方给出了一个计算ROC的例子：

from sklearn import metrics
y = np.array([1, 1, 2, 2]

关注

专栏目录