异常检测-基于统计学方法

异常检测-基于统计学方法

1、概念
假定正常的数据对象由一个统计模型产生,而不遵守该模型的数据是异常点。即,利用统计学方法对数据集建立一个模型,然后考虑数据点有多大概率符合这个模型,低概率区域中的数据点,更可能为异常点。
2、方法
参数方法:假定数据对象是由一个以 θ 为参数的参数分布产生(即产生的数据符合以 θ为参数的分布)该参数分布的概率密度给出f(x,θ),将数据点x带入到概率密度公式,得出该数据点符合该分布的概率,概率越小,越不符合该分布,是异常点的可能性就越大。
非参数方法:不像参数方法那样对数据的分布进行假设。非参数方法通常假定参数的个数和性质都是灵活的,不预先确定(所以非参数方法并不是说模型是完全无参的,完全无参的情况下从数据学习模型是不可能的)。非参数方法直接对输入的数据进行学习,最常用的是直方图,利用直方图模拟数据的分布情况,能够知道每个部分的密度情况。
2.1 基于正态分布的一元异常点检测
一元异常点:只涉及一个特征
例:假定输入数据集为{x(1),x(2),…,x(m)}由正态分布产生,数据集中的样本服从正态分布,x(i)-N(u,σ2),然后可以由输入数据学习正态分布的参数u,σ2.
μ=m1​i=1∑m​x(i) σ2=m1​i=1∑m​(x(i)−μ)2
求出参数之后,我们就可以根据概率密度函数计算数据点服从该分布的概率。正态分布的概率密度函数为
p(x)=1/2π σ1​exp(−2σ2(x−μ)2​)

如果计算出来的概率低于阈值,就可以认为该数据点为异常点。
阈值是个经验值,可以选择在验证集上使得评估指标值最大(也就是效果最好)的阈值取值作为最终阈值。
可视化:

import numpy as np
import seaborn as sns
import matplotlib.pyplot as plt
data = np.random.randn(30000) * 20 + 20
sns.boxplot(data=data)

在这里插入图片描述

2.2多元异常点检测
涉及两个或多个属性或变量的数据称为多元数据。许多一元异常点检测方法都可以扩充,用来处理多元数据。其核心思想是把多元异常点检测任务转换成一元异常点检测问题。例如基于正态分布的一元异常点检测扩充到多元情形时,可以求出每一维度的均值和标准差。对于第维:
μj​=m1​∑i=1m​xj(i)​
σj2​=m1​∑i=1m​(xj(i)​−μj​)2
计算概率时的概率密度函数为:
p(x)=∏j=1n​p(xj​;μj​,σj2​)=∏j=1n​/2π * ​σj​1​exp(−2σj2​(xj​−μj​)2​)
这是在各个维度的特征之间相互独立的情况下。如果特征之间有相关性,就要用到多元高斯分布了
2.3 混合参数分布
在许多情况下假定数据是由正态分布产生的。当实际数据很复杂时,这种假定过于简单,可以假定数据是被混合参数分布产生的。
3、非参数方法
在异常检测的非参数方法中,“正常数据”的模型从输入数据学习,而不是假定一个先验。通常,非参数方法对数据做较少假定,因而在更多情况下都可以使用。
例:使用直方图检测异常点。
直方图是一种频繁使用的非参数统计模型,可以用来检测异常点。该过程包括如下两步:
步骤1:构造直方图。使用输入数据(训练数据)构造一个直方图。该直方图可以是一元的,或者多元的(如果输入数据是多维的)。
尽管非参数方法并不假定任何先验统计模型,但是通常确实要求用户提供参数,以便由数据学习。例如,用户必须指定直方图的类型(等宽的或等深的)和其他参数(直方图中的箱数或每个箱的大小等)。与参数方法不同,这些参数并不指定数据 分布的类型。
步骤2:检测异常点。为了确定一个对象是否是异常点,可以对照直方图检查它。在最简单的方法中,如果该对象落入直方图的一个箱中,则该对象被看作正常的,否则被认为是异常点。
对于更复杂的方法,可以使用直方图赋予每个对象一个异常点得分。例如令对象的异常点得分为该对象落入的箱的容积的倒数。
使用直方图作为异常点检测的非参数模型的一个缺点是,很难选择一个合适的箱尺寸。一方面,如果箱尺寸太小,则许多正常对象都会落入空的或稀疏的箱中,因而被误识别为异常点。另一方面,如果箱尺寸太大,则异常点对象可能渗入某些频繁的箱中,因而“假扮”成正常的。
4、总结
异常检测的统计学方法由数据学习模型,以区别正常的数据对象和异常点。使用统计学方法的一个优点是,异常检测可以是统计上无可非议的。当然,仅当对数据所做的统计假定满足实际约束时才为真。
from: Datawhale 一起学习

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值