python聚类分析如何确定分类个数_确定聚类分析中的类别个数的方法

最新推荐文章于 2024-05-22 21:33:28 发布

weixin_39634052

最新推荐文章于 2024-05-22 21:33:28 发布

阅读量8.3k

点赞数 3

文章标签： python聚类分析如何确定分类个数

本文链接：https://blog.csdn.net/weixin_39634052/article/details/111811258

版权

1、gap statistic

以k-means聚类为例，对于一个聚类个数k，首先利用k-means聚类将样本聚成k类，然后计算k类中各类内各点与类中心的距离加和W(ki)，进而计算k类的距离加和W(k)=sum(W(k1),…,W(ki),…,W(kk))；根据原始数据的特点产生B个均匀分布的参考数据集，对于每个数据集都计算W(sk)，计算B个数据集的平均E.W(k)=mean(W(1k),…,W(sk),…,W(bk))；

那么对于每个k就有：gap(k)=log(E.W(k))-log(W(k))；然后选取最小的k，使得gap(k)为局部最大值，并且超出了其邻居1个标准差，即gap(k)-gap(k+1)>0.25*sd(W(s(k+1)))

参考文献：Single-cell messenger RNA sequencing reveals rare intestinal celltypes. Nature 2015

这里需要注意的是，gap statistic适用于可以直接设定聚类个数的聚类方法，如k均值和层次聚类，而类似密度聚类和PhenoGraph聚类方法，这两者是用参数(半径，resolution)来划分样本，无法直接设定类别个数。[谨慎!!!可以先调整参数使得得出的聚类个数和该方法得出的结果相同!!!]

2、Silhouette Coefficient(轮廓系数)

轮廓系数，是聚类效果好坏的一种评价方式。最早由 Peter J. Rousseeuw 在 1986 提出。它结合内聚度和分离度两种因素。可以用来在相同原始数据的基础上评价不同算法、或者算法不同运行方式对聚类结果所产生的影响。

方法:

1.计算样本i到同簇其他样本的平均距离ai。ai 越小，说明样本i越应该被聚类到该簇。将ai 称为样本i的簇内不相似度。簇C中所有样本的a i 均值称为簇C的簇不相似度。

2.计算样本i到其他某簇Cj 的所有样本的平均距离bij，称为样本i与簇Cj 的不相似度。定义为样本i的簇间不相似度：bi =min{bi1, bi2, ..., bik}。bi越大，说明样本i越不属于其他簇。

3.根据样本i的簇内不相似度ai和簇间不相似度bi，定义样本i的轮廓系数：

最低0.47元/天解锁文章

weixin_39634052

关注

3
点赞
踩
22

收藏

觉得还不错? 一键收藏
0
评论
python聚类分析如何确定分类个数_确定聚类分析中的类别个数的方法

1、gap statistic以k-means聚类为例，对于一个聚类个数k，首先利用k-means聚类将样本聚成k类，然后计算k类中各类内各点与类中心的距离加和W(ki)，进而计算k类的距离加和W(k)=sum(W(k1),…,W(ki),…,W(kk))；根据原始数据的特点产生B个均匀分布的参考数据集，对于每个数据集都计算W(sk)，计算B个数据集的平均E.W(k)=mean(W(1k),…,W...
复制链接

扫一扫