异常检测：基于统计学的方法

最新推荐文章于 2024-04-01 00:44:51 发布

Monster�Siberia

最新推荐文章于 2024-04-01 00:44:51 发布

阅读量231

点赞数

分类专栏：异常检测文章标签： python

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/Monsters2019/article/details/112689604

版权

本文介绍了基于统计学的异常检测方法，包括参数方法和非参数方法。参数方法利用正态分布进行一元和多元异常点检测，考虑特征间的独立性和相关性。非参数方法如HBOS，通过构建直方图进行异常评分。统计学方法为异常检测提供了一种统计上合理的框架，但在应对局部异常和数据依赖时有一定限制。

摘要由CSDN通过智能技术生成

文章目录

一、概述
二、参数方法
三、非参数方法
四、HBOS
五、总结

一、概述

统计学方法对数据的正常性做出假定。它们假定正常的数据对象由一个统计模型产生，而不遵守该模型的数据是异常点。统计学方法的有效性高度依赖于对给定数据所做的统计模型假定是否成立。

异常检测的统计学方法的一般思想是：学习一个拟合给定数据集的生成模型，然后识别该模型低概率区域中的对象，把它们作为异常点。

即利用统计学方法建立一个模型，然后考虑对象有多大可能符合该模型。

参数方法假定正常的数据对象被一个以 $\Theta$ 为参数的参数分布产生。该参数分布的概率密度函数 $f(x,\Theta)$ 给出对象 $x$ 被该分布产生的概率。该值越小， $x$ 越可能是异常点。
非参数方法并不假定先验统计模型，而是试图从输入数据确定模型。非参数方法通常假定参数的个数和性质都是灵活的，不预先确定（所以非参数方法并不是说模型是完全无参的，完全无参的情况下从数据学习模型是不可能的）。

二、参数方法

基于正态分布的一元异常点检测

仅涉及一个属性或变量的数据称为一元数据。我们假定数据由正态分布产生，然后可以由输入数据学习正态分布的参数，并把低概率的点识别为异常点。

假定输入数据集为 ${x^{(1)}, x^{(2)}, ..., x^{(m)}}$ ，数据集中的样本服从正态分布，即 $x^{(i)}\sim N(\mu, \sigma^2)$ ，我们可以根据样本求出参数 $\mu$ 和 $\sigma$ 。

$\mu=\frac 1m\sum_{i=1}^m x^{(i)}$

$\sigma^2=\frac 1m\sum_{i=1}^m (x^{(i)}-\mu)^2$

求出参数之后，我们就可以根据概率密度函数计算数据点服从该分布的概率。正态分布的概率密度函数为

$p(x)=\frac 1{\sqrt{2\pi}\sigma}exp(-\frac{(x-\mu)^2}{2\sigma^2})$

最低0.47元/天解锁文章

Monster�Siberia

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。