异常检测---task 05 高维数据异常检测

最新推荐文章于 2024-01-22 19:29:13 发布

hlzzszzj

最新推荐文章于 2024-01-22 19:29:13 发布

阅读量286

点赞数

文章标签：数据挖掘

本文链接：https://blog.csdn.net/hlzzszzj/article/details/117092703

版权

异常检测—task 05 高维数据异常检测

在实际场景中，很多数据集都是高维度的，随着维度的增加，数据空间的大小(体积)会以指数级别增长，使数据变得稀疏，这便是维数诅咒的难题。维数诅咒不止给异常检测带来了挑战，对距离的计算、聚类等都带来了难题。例如基于邻近度的方法是在所有维度使用距离函数来定义局部性。但是，在高维空间中，所有点对的距离几乎都是相等的(距离集中)，这使得一些基于距离的方法失效。在高维场景下，一个常用的方法是子空间法。
集成是子空间思想中最常用的方式之一，可以有效地提高数据挖掘算法精度。集成方法将多个算法或者多个基学习器的输出结合起来。其基本思想是一些算法在某些子集上表现很好，然后集成起来使得输出更加鲁棒。集成方法与基于子空间方法有着天然的相似性，子空间与不同的点集相关，而集成方法使用基学习器来探索不同维度的子集，将这些基学习器集合起来。

Feature Bagging

Feature Bagging,其基本思想与Bagging相似，只不过对象是Feature。Feature bagging属于集成方法的一种。集成方法的涉及有以下两个主要步骤：
(1) 选择基学习器：这些基学习器可以彼此不同，或者不同的参数设置，或使用不同采样的子数据集。Feature bagging常用LOF算法为基算法。下面是Feature Bagging的通用算法：

给定数据集 $S\{{(x_{1},y_{1}),...,{(x_{m},y_{m})}}\}$ ， $x_{i} \in X^d$ ，其中标签 $y\in Y=\{C,NC \}$ ，其中 $C$ 为异常点， $N C$ 为正常点
对数据集进行正规化处理
For t = 1:T
(I) 从均匀分布 $U(\lfloor{d/2}\rfloor,d-1 )$ 种随机抽样以选取特征子集 $N_{t}$ 的大小
(II) 随机选择 $N_{t}$ 个特征来创建特征子集 $F_{t}$
(III) 对特征子集 $F_{t}$ 施加异常检测算法 $O_{t}$
(iV) 异常检测算法 $O_{t}$ 的异常检测分数是 $AS_{t}$
结合异常检测分数向量 $AS_{t}$ 和输出一个最终的异常检测分数 $AS_{final}$ ：
$AS_{final}=COMBINE(AS_{t}),t=1,...,T$

(2) 分数标准化和组合方法：不同检测器可能在不同的尺度上产生分数，例如：(a) K近邻检测器输出原始距离分数，而LOF算法会输出归一化值。另外，尽管一般情况是输出较大的异常值分数，但有些检测器会输出较小的异常值分数。因此，需要将来自各种检测器的分数转换为有意义的组合的归一化值。分数标准化之后，还要选择一个组合函数将不同基检测器的得分进行组合，最常见的选择包括平均和最大化组合含函数。下图是两个Feature bagging的组合分数方法：

- 方法一(广度优先)：
- 给定得分向量 $AS_{t},t=1,...,T$ ，以及数据集的尺寸 $m$
- 对所有异常分数向量 $AS_{t}$ 进行排序得到 $SAS_{t}$ 以及排序之后的indices $Ind_{t}$ ，也就是说 $SAS_{t}(1)$ 有最大的得分,而最大得分对应的数据Index是 $Ind_{t}(1)$
- 取两个空向量 $AS_{Final}$ 和 $Ind_{Final}$
- For i=1:m (对于m个数据进行迭代)
  For t = 1:T （每个数据迭代T次）
  若index $Ind_{t}(i)$ 是第t个算法对第i个数据进行检测时排在第i个位置且异常得分 $AS_{t}(i)$ 并不存在于向量 $Ind_{Final}$ 中
  在向量 $Ind_{Final}$ 末端插入 $Ind_{t}(i)$
  在向量 $AS_{Final}$ 中插入向量 $AS_{t}(i)$
返回 $Ind_{Final}$ 以及 $AS_{Final}$
- 方法二(累计求和);
- 给定得分向量 $AS_{t},t=1,...,T$ ，以及数据集的尺寸 $m$
- 对T轮迭代种所有的异常得分 $AS_{t}$ 进行求和：
  $AS_{Final}(i) = \sum_{t=1}^TAS_{t}(i)$
- 返回 $AS_{Final}(i)$
  
  基学习器的涉及其组合方法取决于特定集成方法的特定目标。很多时候，我们无法得到数据的原始分布，只能通过部分数据去学习。除此以外，算法本身也可能存在一定问题使得其无法学习到数据的完整信息。这些问题造成的误差分为偏差和方差两种。
方差：是指算法输出结果与算法输出期望之间的五擦汗，描述模型的离散程度，数据波动性
偏差：是指预测值和真实值之间的差距，即使在离群点检测中没有可用的基本真值

孤立森林

孤立森林算法是周志华教授等人于2008年提出的异常检测算法，事机器学习中少见的专门针对异常检测设计的算法之一。该算法因为算法时间效率高，能有效处理高维数据和海量数据，而无需标注样本，在工业界应用广泛。
孤立森林属于非参数和无监督的算法，既不需要定义数学模型也不需要训练数据有标签。孤立森林查找孤立点的策略非常高效。假定我们用一个随机超平面来切割数据空间，切一次可以生辰不过两个子空间。然后我们继续用随机超平面来切割每个子空间并循环，直到每个子空间只有一个数据点为止。直观上来讲，那些具有高密度的簇需要被切分许多次才将其分离，而那些低密度的点很快就会被单独分配到一个子空间中。孤立森林认为这些很快被孤立的点就是异常点。
如何来切这个数据空间是孤立森林的核心思想，因为切割是随机的，为了保证结果的随机性，要用集成的方法来得到一个收敛值，即反复从头开始切，平均每次切的结果。孤立森林由 $t$ 棵孤立的树组成，每棵树都是一个随机二叉树，也就是说对于树中的每个节点，要么有两个孩子节点，要么一个孩子节点都没有。树的构造方法和随机森林中的构造方法有些类似，流程如下：
(a) 从训练集中随机选取一个样本子集，放入树的根节点
(b) 随机指定一个属性，随机产生一个切割点 $V$ ，即属性 $A$ 的最大值和最小值之间的某个数
© 根据属性 $A$ 对每个样本进行分类，把 $A$ 中小于 $V$ 的样本放在当前节点的左孩子中，大于等于 $V$ 的样本放在右孩子中，这就形成了两个子空间
(d) 在孩子节点中递归步骤2和3，不断地构造左孩子和右孩子，直到孩子节点中只有一个数据，或树地高度达到了限定高度
获得 $t$ 棵树之后，孤立森林地训练就此结束，就可以用生成地孤立森林来评估测试数据
孤立森林异常检测地假设是：异常点一般都是非常稀有的，在树种会很快划分到叶子节点，因此可以用叶子节点到根节点的路径长度来判断一条记录是否是异常的。和随机森林类似，孤立森林也是用构造好的所有树的平均结果形成最终结果的。在训练时，每棵树的训练样本是随机抽样的。从孤立森林的树的构造过程来看，它不需要知道样本的标签，而是通过阈值来哦按段样本是否异常，因为异常点的路径比较短，正常点的路径比较长，孤立森林根据路径的长度来估算每个样本识点的异常程度。其中路径长度的计算方法如下：
在这里插入图片描述
孤立森林也是一种基于子空间的方法，不同的分支对应于数据的不同局部子空间区域，较小的路径对应于孤立子空间种的低维

总结

feature bagging可以降低方差
孤立森林不适用于超高维数据，因为孤立森林每次都是随机选取维度，如果维度过高，则会存在过多噪音

hlzzszzj

关注

0
点赞
踩
1

收藏

觉得还不错? 一键收藏
0
评论
异常检测---task 05 高维数据异常检测

异常检测—task 05 高维数据异常检测在实际场景中，很多数据集都是高维度的，随着维度的增加，数据空间的大小(体积)会以指数级别增长，使数据变得稀疏，这便是维数诅咒的难题。维数诅咒不止给异常检测带来了挑战，对距离的计算、聚类等都带来了难题。例如基于邻近度的方法是在所有维度使用距离函数来定义局部性。但是，在高维空间中，所有点对的距离几乎都是相等的(距离集中)，这使得一些基于距离的方法失效。在高维场景下，一个常用的方法是子空间法。集成是子空间思想中最常用的方式之一，可以有效地提高数据挖掘算法精度。集成
复制链接

扫一扫