异常检测（5）—高维数据的异常检测_多维数据检测故障的异常特征-CSDN博客

本文链接：https://blog.csdn.net/qq_38936560/article/details/113094249

在高维数据中，数据集是多维的（这里的维度是特征），对于距离、聚类的计算都是一个难题，基于邻近度的计算方法是对每一个维度进行距离计算，但是点对的距离相对集中(（ $x_{m}^{i},y^{i}$ ）在第m维上距离近)，这使得基于距离的计算方法失效，对于高维数据的处理，采用子空间的方法，集成方法是子空间思想中常用的一种。

集成方法：将多个算法或多个基检测器的输出结合起来。其基本思想是一些算法在某些子集上表现很好，一些算法在其他子集上表现很好，然后集成起来使得输出更加鲁棒。集成方法与基于子空间方法有着天然的相似性，子空间与不同的点集相关，而集成方法使用基检测器来探索不同维度的子集，将这些基学习器集合起来。

一点理解：在某些维度上某些异常检测方法表现良好，能够检测到在该维度上的异常；在其他维度上另外一些异常检测算法表现良好；将这两种在不同维度上的算法结合起来，使得结果表现更优

两种集成方法：Feature Bagging、Isolation Forests

1.Feature Bagging

Feature Bagging，基本思想与bagging相似，只是对象是feature。

选择基检测器。这些基本检测器可以彼此完全不同，或不同的参数设置，或使用不同采样的子数据集。Feature bagging常用lof算法为基算法。

理解:

给定数据集 $S\{(x_{1},y_{1}),(x_{2},y_{2}),...,(x_{m},y_{m})\},x_{i} \in \mathbf{X}^{\mathrm{d}}$ ，标签 $y_{i}\in Y\in\{C,NC\}$ ， $C$ 对应异常类， $N C$ 对应正常类， $d$ 对应向量 $\mathbf{X}$ 的维度——特征数量；
标准化数据集 $S$ ;
循环（1~T：特征子集/基检测器个数——一个特征子集应用在一个基检测器上）:随机的选择特征子集 $N_{t}$ ，特征是从一半特征到所有特征中随机抽样；使用 $N_{t}$ 个特征创建特征子集 $F_{t}$ ；将异常检测算法 $O_{t}$ 应用到特征子集 $F_{t}$ 上；输出异常得分向量 $AS_{t}$ ；
结合异常得分向量 $AS_{t}$ 输出最终的异常分数 $AS_{FINAL}$ 。每一个数据样本得一个分数？？？

分数标准化和组合方法：不同的基检测器的输出不同，如：平均k近邻检测器会输出原始距离分数，而LOF算法会输出归一化值。因此，需要将来自各种检测器的分数转换成可以有意义的组合的归一化值。分数标准化之后，还要选择一个组合函数将不同基本检测器的得分进行组合，最常见的选择包括平均和最大化组合函数。
两种组合方式：广度优先、累计求和
广度优先：

理解：

给定异常得分向量 $AS_{t}$ ， $m$ 是数据集 $S$ 和每个 $AS_{t}$ 的样本数量；
对 $AS_{t}$ 进行排序为 $SAS_{t}$ ，返回排序后向量的索引 $Ind_{t}$ 。如： $SAS_{t}(1)$ 表示拥有最高的 $AS_{t}$ 异常检测得分， $Ind_{t}(1)$ 是在数据集 $S$ 的索引——即： $SAS_{t}(1)$ 的索引。
设置 $AS_{FINAL}$ 和 $Ind_{FINAL}$ 为空；
循环遍历数据集：循环每一个特征子集：如果 $Ind_{t}(i)$ 和异常检测得分 $AS_{t}(i)$ 不在 $Ind_{FINAL}$ 和 $AS_{FINAL}$ 中；那么，将 $Ind_{t}(i)$ 插入到 $Ind_{FINAL}$ 中，将异常检测得分 $AS_{t}(i)$ 插入到 $AS_{FINAL}$ 中；
返回 $Ind_{FINAL}$ 和 $AS_{FINAL}$
累计求和：

理解：

已知 $AS_{t},t=1,...,T$ ，和 $AS_{t}$ 的大小 $m$
对T次迭代求和
遍历数据集：对每个特征子集加和
得到 $AS_{FINAL}(i)$ ：所求的第 $i$ 个样本的特征子集的异常检测得分的和

基检测器的设计及其组合方法都取决于特定集成方法的特定目标。很多时候，我们无法得知数据的原始分布，只能通过部分数据去学习。除此以外，算法本身也可能存在一定问题使得其无法学习到数据完整的信息。这些问题造成的误差通常分为偏差和方差两种。
方差：是指算法输出结果与算法输出期望之间的误差，描述模型的离散程度，数据波动性。
偏差：是指预测值与真实值之间的差距。即使在离群点检测问题中没有可用的基本真值

2.Isolation Forests

孤立森林（Isolation Forest）算法是周志华教授等人于2008年提出的异常检测算法，是机器学习中少见的专门针对异常检测设计的算法之一，方法因为该算法时间效率高，能有效处理高维数据和海量数据，无须标注样本，在工业界应用广泛。

假设我们用一个随机超平面来切割数据空间，切一次可以生成两个子空间。然
后我们继续用随机超平面来切割每个子空间并循环，直到每个子空间只有一个数据点为止。直观上来讲，那些具有高密度的簇需要被切很多次才会将其分离，而那些低密度的点很快就被单独分配到一个子空间了。孤立森林认为这些很快被孤立的点就是异常点。
用四个样本做简单直观的理解，d是最早被孤立出来的，所以d最有可能是异常。
在这里插入图片描述
孤立森林构造过程：

从训练数据中随机选择一个样本子集，放入树的根节点；
随机指定一个属性，随机产生一个切割点V，即属性A的最大值和最小值之间的某个数；
根据属性A对每个样本分类，把A小于V的样本放在当前节点的左孩子中，大于等于V的样本放在右孩子中，这样就形成了2个子空间；
在孩子节点中递归步骤2和3，不断地构造左孩子和右孩子，直到孩子节点中只有一个数据，或树的高度达到了限定高度。

孤立森林检测异常的假设：异常点一般都是非常稀有的，在树中会很快被划分到叶子节点，因此可以用叶子节点到根节点的路径长度来判断一条记录是否是异常的。和随机森林类似，孤立森林也是采用构造好的所有树的平均结果形成最终结果的。在训练时，每棵树的训练样本是随机抽样的。从孤立森林的树的构造过程看，它不需要知道样本的标签，而是通过阈值来判断样本是否异常。因为异常点的路径比较短，正常点的路径比较长，孤立森林根据路径长度来估计每个样本点的异常程度。
路径的计算方法：
在这里插入图片描述

孤立森林也是一种基于子空间的方法，不同的分支对应于数据的不同局部子空间区域，较小的路径对应于孤立子空间的低维

3.总结

feature bagging可以降低方差
孤立森林的优势在于：

计算成本相比基于距离或基于密度的算法更小。
具有线性的时间复杂度。
在处理大数据集上有优势。

孤立森林不适用于超高维数据，因为孤立森林每次都是随机选取维度，如果维度过高，则会存在过多噪音。

4.练习

使用Pyod库生成toy example并调用feature bagging

from pyod.models.feature_bagging import FeatureBagging
from pyod.utils.data import generate_data,evaluate_print
from pyod.utils.example import visualize
contamination = 0.1  # percentage of outliers
n_train = 200  # number of training points
n_test = 100  # number of testing points
X_train, y_train, X_test, y_test = generate_data(n_train=n_train, n_test=n_test, contamination=contamination)
clf_name = 'FeatureBagging'
clf = FeatureBagging()
clf.fit(X_train)
# get the prediction labels and outlier scores of the training data
y_train_pred = clf.labels_  # binary labels (0: inliers, 1: outliers)
y_train_scores = clf.decision_scores_  # raw outlier scores
# get the prediction on the test data
y_test_pred = clf.predict(X_test)  # outlier labels (0 or 1)
y_test_scores = clf.decision_function(X_test)  # outlier scores
# evaluate and print the results
print("\nFeatureBagging On Training Data:")
evaluate_print(clf_name, y_train, y_train_scores)
print("\nFeatureBagging On Test Data:")
evaluate_print(clf_name, y_test, y_test_scores)

#FeatureBagging On Training Data:
#FeatureBagging ROC:0.9681, precision @ rank n:0.9

#FeatureBagging On Test Data:
#FeatureBagging ROC:0.9989, precision @ rank n:0.9

在这里插入图片描述
使用Pyod库生成toy example并调用Isolation Forests

from pyod.models.iforest import IForest
from pyod.utils.data import generate_data,evaluate_print
from pyod.utils.example import visualize
contamination = 0.1  # percentage of outliers
n_train = 200  # number of training points
n_test = 100  # number of testing points
X_train, y_train, X_test, y_test = generate_data(n_train=n_train, n_test=n_test, contamination=contamination)

clf_name = 'IForest'
clf = IForest()
clf.fit(X_train)

# get the prediction labels and outlier scores of the training data
y_train_pred = clf.labels_  # binary labels (0: inliers, 1: outliers)
y_train_scores = clf.decision_scores_  # raw outlier scores
 
# get the prediction on the test data
y_test_pred = clf.predict(X_test)  # outlier labels (0 or 1)
y_test_scores = clf.decision_function(X_test)  # outlier scores

# evaluate and print the results
print("\nIForest On Training Data:")
evaluate_print(clf_name, y_train, y_train_scores)
print("\nIForest On Test Data:")
evaluate_print(clf_name, y_test, y_test_scores)

#IForest On Training Data:
#IForest ROC:0.9897, precision @ rank n:0.95
#IForest On Test Data:
#IForest ROC:1.0, precision @ rank n:1.0
#可视化所有示例
visualize(clf_name, X_train, y_train, X_test, y_test, y_train_pred,
          y_test_pred, show_figure=True, save_figure=False)