OD学习2-调用PyOD运行HBOS算法

最新推荐文章于 2023-07-20 14:22:39 发布

joyceying小洲

最新推荐文章于 2023-07-20 14:22:39 发布

阅读量562

点赞数

分类专栏： outlier detection 文章标签： python 算法机器学习大数据

本文链接：https://blog.csdn.net/Joyceying1007/article/details/112688879

版权

outlier detection 专栏收录该内容

4 篇文章 1 订阅

订阅专栏

HBOS

是一种单变量方法的组合，不能对特征之间的依赖关系进行建模，但是计算速度较快，对大数据集友好。HBOS的基本假设是数据集的每个维度相互独立。对每个维度进行区间划分，区间的密度越高，异常评分越低。

HBOS算法流程

为每个数据维度做出数据直方图。对分类数据统计每个值的频数并计算相对频率。
对每个维度都计算了一个独立的直方图，其中每个箱子的高度表示密度的估计。然后为了使得最大高度为1（确保每个特征与异常值得分的权重相等），对直方图进行归一化处理。
参考代码：

from __future__ import division
from __future__ import print_function

import os
import sys

# temporary solution for relative imports in case pyod is not installed
# if pyod is installed, no need to use the following line
#sys.path.append(
#    os.path.abspath(os.path.join(os.path.dirname("__file__"), '..')))

from pyod.models.hbos import HBOS
from pyod.utils.data import generate_data
from pyod.utils.data import evaluate_print
from pyod.utils.example import visualize

if __name__ == "__main__":
    contamination = 0.1  # percentage of outliers
    n_train = 200  # number of training points
    n_test = 100  # number of testing points

    # Generate sample data
    X_train, y_train, X_test, y_test = \
        generate_data(n_train=n_train,
                      n_test=n_test,
                      n_features=2,
                      contamination=contamination,
                      random_state=42)

    # train HBOS detector
    clf_name = 'HBOS'
    clf = HBOS()
    clf.fit(X_train)

    # get the prediction labels and outlier scores of the training data
    y_train_pred = clf.labels_  # binary labels (0: inliers, 1: outliers)
    y_train_scores = clf.decision_scores_  # raw outlier scores

    # get the prediction on the test data
    y_test_pred = clf.predict(X_test)  # outlier labels (0 or 1)
    y_test_scores = clf.decision_function(X_test)  # outlier scores

    # evaluate and print the results
    print("\nOn Training Data:")
    evaluate_print(clf_name, y_train, y_train_scores)
    print("\nOn Test Data:")
    evaluate_print(clf_name, y_test, y_test_scores)

    # visualize the results
    visualize(clf_name, X_train, y_train, X_test, y_test, y_train_pred,
              y_test_pred, show_figure=True, save_figure=False)

结果如下

On Training Data:
HBOS ROC:0.9947, precision @ rank n:0.8

On Test Data:
HBOS ROC:0.9744, precision @ rank n:0.6

在这里插入图片描述

joyceying小洲

关注

0
点赞
踩
1

收藏

觉得还不错? 一键收藏
0
评论
OD学习2-调用PyOD运行HBOS算法

HBOS是一种单变量方法的组合，不能对特征之间的依赖关系进行建模，但是计算速度较快，对大数据集友好。HBOS的基本假设是数据集的每个维度相互独立。对每个维度进行区间划分，区间的密度越高，异常评分越低。HBOS算法流程为每个数据维度做出数据直方图。对分类数据统计每个值的频数并计算相对频率。对每个维度都计算了一个独立的直方图，其中每个箱子的高度表示密度的估计。然后为了使得最大高度为1（确保每个特征与异常值得分的权重相等），对直方图进行归一化处理。参考代码：from __future__ impo
复制链接

扫一扫

专栏目录