- 什么是聚类
聚类就是按照某个特定标准(如距离准则)把一个数据集分割成不同的类或簇,使得同一个簇内的数据对象的相似性尽可能大,同时不在同一个簇中的数据对象的差异性也尽可能地大。即聚类后同一类的数据尽可能聚集到一起,不同数据尽量分离。
- 聚类分析主要步骤
- 数据预处理:选择数量、类型和特征的标度,将孤立点移出数据。
- 为衡量数据点间的相似度定义一个距离函数
- 聚类或分组:将数据对象分到不同的类中
- 评估输出:评估聚类结果的质量
- 聚类和分类的区别
聚类解决的是事物分组的问题,是非监督学习,那些表示数据类别的分类或者分组信息是没有的,简单地说,聚类就是把相似的东西分到一组,聚类时并不关心某一类是什么,需要实现的目标只是把相似的东西聚到一起。因此,一个聚类算法通常只需要知道如何计算相似度就可以开始工作了,并不需要使用训练数据进行学习。