异常检测——基于统计学的方法（学习blog））

最新推荐文章于 2023-05-01 06:00:00 发布

Dikuw-0705

最新推荐文章于 2023-05-01 06:00:00 发布

阅读量136

点赞数

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/T_RNA75/article/details/112630219

版权

本文介绍了基于统计学的异常检测方法，包括一元异常点检测、多元异常点检测和非参数方法如HBOS。异常检测通过学习数据的生成模型，识别低概率区域的对象作为异常点。例如，一元数据可假设服从正态分布，计算概率并设定阈值判断异常；多元数据考虑相关性和多元高斯分布；非参数方法如HBOS则通过对每个特征构建直方图来估计密度，识别异常得分高的对象。

摘要由CSDN通过智能技术生成

异常检测——基于统计学方法

感谢DataWhale

概述

统计学方法对数据的正常性做出假定。**它们假定正常的数据对象由一个统计模型产生，而不遵守该模型的数据是异常点。**统计学方法的有效性高度依赖于对给定数据所做的统计模型假定是否成立。

异常检测的统计学方法的一般思想是：学习一个拟合给定数据集的生成模型，然后识别该模型低概率区域中的对象，把它们作为异常点。

即利用统计学方法建立一个模型，然后考虑对象有多大可能符合该模型。

根据如何指定和学习模型，异常检测的统计学方法可以划分为两个主要类型：参数方法和非参数方法。

参数方法假定正常的数据对象被一个以 $\Theta$ 为参数的参数分布产生。该参数分布的概率密度函数 $f(x,\Theta)$ 给出对象 $x$ 被该分布产生的概率。该值越小， $x$ 越可能是异常点。

非参数方法并不假定先验统计模型，而是试图从输入数据确定模型。非参数方法通常假定参数的个数和性质都是灵活的，不预先确定（所以非参数方法并不是说模型是完全无参的，完全无参的情况下从数据学习模型是不可能的）。

检测方法

基于正态分布的一元异常点检测

仅涉及一个属性或变量的数据称为一元数据。我们假定数据由正态分布产生，然后可以由输入数据学习正态分布的参数，并把低概率的点识别为异常点。

假定输入数据集为 ${x^{(1)}, x^{(2)}, ..., x^{(m)}}$ ，数据集中的样本服从正态分布，即 $x^{(i)}\sim N(\mu, \sigma^2)$ ，我们可以根据样本求出参数 $\mu$ 和 $\sigma$ 。

$\mu=\frac 1m\sum_{i=1}^m x^{(i)}$

$\sigma^2=\frac 1m\sum_{i=1}^m (x^{(i)}-\mu)^2$

求出参数之后，我们就可以根据概率密度函数计算数据点服从该分布的概率。正态分布的概率密度函数为

$p(x)=\frac 1{\sqrt{2\pi}\sigma}exp(-\frac{(x-\mu)^2}{2\sigma^2})$

最低0.47元/天解锁文章

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。