DBSCAN密度聚类

最新推荐文章于 2024-06-24 16:07:16 发布

小刘要努力。

最新推荐文章于 2024-06-24 16:07:16 发布

阅读量1.4k

点赞数

分类专栏：原力计算

liurunsen

本文链接：https://blog.csdn.net/weixin_44510615/article/details/90581264

版权

原力计算专栏收录该内容

214 篇文章 5 订阅

订阅专栏

DBSCAN算法是一种基于密度的聚类算法：

聚类的时候不需要预先指定簇的个数
最终的簇的个数不定

DBSCAN算法将数据点分为三类：

核心点：在半径Eps内含有超过MinPts数目的点
边界点：在半径Eps内点的数量小于MinPts，但是落在核心点的邻域内
噪音点：既不是核心点也不是边界点的点

DBSCAN算法流程：

将所有点标记为核心点、边界点或噪声点；
删除噪声点；
为距离在Eps之内的所有核心点之间赋予一条边；
每组连通的核心点形成一个簇；
将每个边界点指派到一个与之关联的核心点的簇中（哪一个核心点的半径范围之内）。

DBSCAN密度聚类

在这里插入图片描述

应用实例

案列来源

https://www.icourse163.org/course/BIT-1001872001

现有大学校园网的日志数据，290条大学生的校园网使用情况数据，数据包括用户ID，设备的MAC地址，IP地址，开始上网时间，停止上网时间，上网时长，校园网套餐等。利用已有数据，分析学生上网的模式

通过DBSCAN聚类，分析学生上网时间和上网时长的模式。

在这里插入图片描述

对数变换

在这里插入图片描述

import numpy as np
from sklearn.cluster import DBSCAN

from sklearn import metrics
import matplotlib.pyplot as plt
 
 
mac2id=dict()
onlinetimes=[]
f=open('学生月上网时间分布-TestData.txt',encoding='utf-8')
for line in f:
    mac=line.split(',')[2]
    onlinetime=int(line.split(',')[6])
    starttime=int(line.split(',')[4].split(' ')[1].split(':')[0])
    if mac not in mac2id:
        mac2id[mac]=len(onlinetimes)
        onlinetimes.append((starttime,onlinetime))
    else:
        onlinetimes[mac2id[mac]]=[(starttime,onlinetime)]
real_X=np.array(onlinetimes).reshape((-1,2))
 
X=real_X[:,0:1]
 
db=DBSCAN(eps=0.01,min_samples=20).fit(X)
labels = db.labels_
 
print('Labels:')
print(labels)
raito=len(labels[labels[:] == -1]) / len(labels)
print('Noise raito:',format(raito, '.2%'))
 
n_clusters_ = len(set(labels)) - (1 if -1 in labels else 0)
 
print('Estimated number of clusters: %d' % n_clusters_)
print("Silhouette Coefficient: %0.3f"% metrics.silhouette_score(X, labels))
 
for i in range(n_clusters_):
    print('Cluster ',i,':')
    print(list(X[labels == i].flatten()))
     
plt.hist(X,24)

X = np.log(1+ real_X [:,1:])
db = DBSCAN(eps=0.14,min_samples=10).fit(X)
labels = db.labels_
print('Lables:')
print(labels)
raito=len(labels[labels[:]== -1])/len(labels)
print('Noise ratio:',format(raito, '.2%' ))
n_clusters_ = len(set(labels)) - (1 if -1 in labels else 0 )
print('Estimated numbre of clusters : %d'% n_clusters_)
print('Silhouette Coefficent : %0.3f'% metrics.silhouette_score(X,labels))
for i in range(n_clusters_):
    print('Cluster',i)
    count = len(X[labels==i])
    mean = np.mean(real_X[labels ==i][:,1])
    std = np.std(real_X[labels ==i][:,1])
    print('\t number of sample :',count)
    print('\t mean of sample :',format(mean,'.1f'))
    print('\t std of sample :',format(std,'.1f'))