聚类时的轮廓系数评价和inertia_

最新推荐文章于 2023-02-23 21:07:09 发布

weixin_30292745

最新推荐文章于 2023-02-23 21:07:09 发布

阅读量2.3k

点赞数 3

文章标签： python 数据结构与算法人工智能

原文链接：http://www.cnblogs.com/laowangxieboke/p/11177651.html

版权

本文探讨了在聚类分析中如何选择最佳K值，对比了KMeans的inertia_指标和轮廓系数两种评价方法。指出inertia_可能造成过度细分的问题，而轮廓系数能更好地衡量同类样本间距离最小化和不同类样本间距离最大化的程度。通过代码展示了如何使用轮廓系数选择K值，并提供了一个绘制K值与轮廓系数关系的函数示例。

摘要由CSDN通过智能技术生成

在进行聚类分析时，机器学习库中提供了kmeans++算法帮助训练，然而，根据不同的问题，需要寻找不同的超参数，即寻找最佳的K值

最近使用机器学习包里两个内部评价聚类效果的方法:clf=KMeans(n_clusters=k,n_jobs=20)

其中方法一：clf.inertia_是一种聚类评估指标，我常见有人用这个。说一下他的缺点：这个评价参数表示的是簇中某一点到簇中距离的和，这种方法虽然在评估参数最小时表现了聚类的精细性，但是这种情况会出现划分过于精细的状况，并且未考虑和簇外点的距离最大化，因此，我推荐使用方法二：

方法二：使用轮廓系数法进行K值的选择，在此，我需要解释一下轮廓系数，以及为何选用轮廓系数作为内部评价的标准，轮廓系数的公式为：S=(b-a)/max(a,b)，其中a是单个样本离同类簇所有样本的距离的平均数，b是单个样本到不同簇所有样本的平均。

轮廓系数表示了同类样本间距离最小化，不同类样本间距离最大的度量

关于通过轮廓系数选择K值得问题：

通过建立循环来选取K值

# 构造自定义函数，用于绘制不同k值和对应轮廓系数的折线图
def k_silhouette(X, clusters):
K = range(2,clusters+1)
# 构建空列表，用于存储个中簇数下的轮廓系数
S = []
for k in K:
kmeans = KMeans(n_clusters=k)
kmea

最低0.47元/天解锁文章

weixin_30292745

关注

3
点赞
踩
20

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。