4.聚类集成算法

概念
现有的聚类算法不具备通用性,没有一种算法可以解决所有的聚类问题。总结一下聚类算法的缺点:1)参数的设定很大程度上决定聚类结果;2)大多数聚类算法对于数据集的真实簇个数难以判断;3)不同的聚类算法处理同一数据集可能产生不同的聚类结果。在现实中,多维数据集可能具有各种形状或结构,其簇结构使用单一聚类算法无法分辨。于是引出了聚类集成这一算法。
聚类集成算法,简单来说就是用聚类算法多生成几次聚类结果,然后寻找一个包含所有聚类结果“优点”的聚类结果。
聚类集成学术一些的定义是:聚类集成指的是给定一个聚类结果集合,寻找一个聚类,使其可以汇集所有的输入聚类的结果,目标聚类尽可能多地与输入的聚类符合或一致。由此可见,聚类集成是利用经过选择的多个聚类结果找到一个新的数据或对象划分,这个划分在最大程度上共享了所有输入的聚类结果对数据集的聚类信息。[1]

过程
聚类集成算法过程通常分为两个主要部分,首先是使用聚类方法生成多个基聚类,然后设计有效的函数对聚类结果进行集成。
基聚类集的产生通常有四种方法:分别是同一个聚类算法使用不同的参数,不同的聚类算法,不同的数据特征子集以及上述方法的任意组合。
基聚类集生成后,需使用特定的方式来表示聚类结构,常用的方法有二进制矩阵、超图和共协矩阵。二进制矩阵关注数据与簇之间的关系,当数据属于相应聚类时,在矩阵中标注为1,否则标注为0。它是一种传递基聚类所有信息的空间变换;Strehl和Ghosh将基聚类表示为超图,其中超边是基簇。共协矩阵表示了在基聚类集中,每一对数据出现在同一簇的频率。
生成基聚类集后,需要采用函数方法作用于上述方式,常见的有Ncut算法、Tcut算法。

优点
与聚类算法相比,聚类集成算法具有以下优点:1)聚类集成提高了聚类结果的质量和健壮性。反映了数据集的结构。2)对聚类结果进行了充分利用。3)能划分具有分类属性的数据集。根据数据集的每个属性的不同值划分数据,每个属性得到一个聚类结果,对得到的划分进行集成,得到最终结果。4)能检测和处理孤立点、噪音。若一个数据对象不属于任何一个簇,则聚类算法无法对其划分,聚类集成将此对象划为单独的一个簇,以避免对其他数据对象及聚类结果造成影响。5)能并行处理数据集和分布式数据源。对大规模的数据集,每个主机只并行地处理数据集的一部分,然后再集成;对分布式数据源,先在本地聚类,然后主机访问各个聚类结果进行集成,避免将整个数据集传输到主机[1]。
[1]杨草原, 刘大有, 杨博,等. 聚类集成方法研究[J]. 计算机科学, 2011, 38(002):166-170.

  • 0
    点赞
  • 21
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值