【机器学习】聚类分析的模型评估

本文介绍了聚类分析中的距离计算,如余弦距离,并探讨了聚类算法的评估标准,包括轮廓系数、调整兰德指数、互信息、同质性、完整性以及Calinski-Harabaz指数。这些指标用于衡量聚类效果,其中轮廓系数和调整兰德指数在不知道真实类别信息的情况下也能进行评估。
摘要由CSDN通过智能技术生成

  一、聚类算法中的距离

  1. 单个样本之间的距离

    

  余弦距离     

  在聚类分析中,一般需要对数据进行标准化,因为聚类数据会受数据量纲的影响。

  在sklearn库中,可调用如下方法进行标准化:

1 from sklearn.preprocessing import StandardScaler
2 data = StandardScaler().fit_transform(data)

  这种方法将data的均值和方差保存下来,并使用它们对数据进行归一化,这样,有新的数据输入时,仍可以沿用data的均值和方差来做归一化。

  【联】facenet中是采用的L2归一化,这和每个向量自身相关,而不是和整体数据相关。

  在上述距离中,受量纲影响较大的是明氏距离和欧氏距离(明氏距离的特例),马氏距离和余弦距离则受量纲影响较小。

  其中,余弦距离越大(趋近于1),代表两个向量的方向越接近,相似度越高。

  2. 两个聚类簇之间的距离

  

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值