算法面试必备-----聚类算法

最新推荐文章于 2024-07-13 17:53:07 发布

Avery123123

最新推荐文章于 2024-07-13 17:53:07 发布

阅读量1.8k

点赞数 1

分类专栏：算法岗面试笔试准备

本文链接：https://blog.csdn.net/avery123123/article/details/107640159

版权

总体上分为：传统聚类+基于深度学习的聚类（深度聚类）

1.基于划分
给定一个有N个元组或者纪录的数据集，分裂法将构造K个分组，每一个分组就代表一个聚类，K<N。
特点：计算量大。很适合发现中小规模的数据库中小规模的数据库中的球状簇。
算法：K-MEANS算法、K-MEDOIDS算法、CLARANS算法

2.基于层次
对给定的数据集进行层次似的分解，直到某种条件满足为止。具体又可分为“自底向上”和“自顶向下”两种方案。
特点：较小的计算开销。然而这种技术不能更正错误的决定。
算法：BIRCH算法、CURE算法、CHAMELEON算法

3.基于密度
只要一个区域中的点的密度大过某个阈值，就把它加到与之相近的聚类中去。
特点：能克服基于距离的算法只能发现“类圆形”的聚类的缺点。
算法：DBSCAN算法、OPTICS算法、DENCLUE算法

4.基于网格
将数据空间划分成为有限个单元（cell）的网格结构,所有的处理都是以单个的单元为对象的。
特点：处理速度很快，通常这是与目标数据库中记录的个数无关的，只与把数据空间分为多少个单元有关。
算法：STING算法、CLIQUE算法、WAVE-CLUSTER算法

5.基于模型
属于软聚类（每个样本可以属于多个类，有概率分布）GMM认为隐含的类别标签z(i)，服从多项分布，并且认为给定z(i)后，样本x(i)满足多值高斯分布，，由此可以得到联合分布。

GMM是个鸡生蛋、蛋生鸡的过程，与KMEANS特别像，其估计应用EM算法。

1.首先假设知道GMM参数，均值、协方差矩阵、混合系数，基于这些参数算出样本属于某一类的概率（后验概率）wji：

2.然后根据该概率，重新计算GMM的各参数。此参数求解利用了最大似然估计。

3.一直迭代，直到参数稳定。

EM（Expectation Maximization）算法是，假设我们想估计知道A和B两个参数，在开始状态下二者都是未知的，但如果知道了A的信息就可以得到B的信息，反过来知道了B也就得到了A。可以考虑首先赋予A某种初值，以此得到B的估计值，然后从B的当前值出发，重新估计A的取值ÿ

关注

专栏目录