数据挖掘初学Day02

最新推荐文章于 2022-02-18 15:18:09 发布

跳出温水的蛙

最新推荐文章于 2022-02-18 15:18:09 发布

阅读量179

点赞数

分类专栏：数据挖掘

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/weixin_40804755/article/details/85620120

版权

数据挖掘专栏收录该内容

3 篇文章 0 订阅

订阅专栏

1.将数据集分为测试集和训练集。训练集用来产生模型，测试集用来检验模型。

2.混淆矩阵 Confusion Matrix

一共四种情况。红色是预测对的，紫色是预测错误的。

3.ROC曲线

阈值太大或者太小都不好，比如常见的阈值就是0.5，大于0.5的认为是正样本，小于0.5的认为是负样本。如果增大这个阈值，预测错误（针对正样本而言，即指预测是正样本但是预测错误，下同）的概率就会降低但是随之而来的就是预测正确的概率也降低；如果减小这个阈值，那么预测正确的概率会升高但是同时预测错误的概率也会升高。

对角线称为Random Guess。即随机猜测的概率值。

显然，ROC曲线的横纵坐标都在[0,1]之间，自然ROC曲线的面积不大于1。现在我们来分析几个特殊情况，从而更好地掌握ROC曲线的性质：

(0,0)：假阳率和真阳率都为0，即分类器全部预测成负样本
(0,1)：假阳率为0，真阳率为1，全部完美预测正确，happy
(1,0)：假阳率为1，真阳率为0，全部完美预测错误，悲剧
(1,1)：假阳率和真阳率都为1，即分类器全部预测成正样本
TPR＝FPR，斜对角线，预测为正样本的结果一半是对的，一半是错的，代表随机分类器的预测效果

于是，我们可以得到基本的结论：ROC曲线在斜对角线以下，则表示该分类器效果差于随机分类器，反之，效果好于随机分类器，当然，我们希望ROC曲线尽量除于斜对角线以上，也就是向左上角（0,1）凸。

AUC实际上就是ROC曲线下的面积。AUC直观地反映了ROC曲线表达的分类能力。

AUC ＝ 1，代表完美分类器
0.5 < AUC < 1，优于随机分类器
0 < AUC < 0.5，差于随机分类器

4.提升度：用模型后预测成功的概率/不用模型时成功的概率

部分参考文章https://segmentfault.com/a/1190000010410634?utm_source=tag-newest

跳出温水的蛙

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。