K-means
非监督学习中的聚类算法
簇:所有数据的点点集合
质心:簇中所有点的中心
SSE:平方误差和,SSE值越小,表示越接近他们的质心
1.确定K个初始点为质心
2.然后将数据集中每个点分配到一个簇中,为每个点找距离最近的质心,并分类簇,根据簇里的点计算质心
k-means存在缺点:
k-means是局部最优的,容易受到初始质心的影响
k值的选取也会直接影响聚类结果,最优聚类的k值应与样本数据本身的结构信息相吻合,而这种结构信息是很难去掌握,因此选取最优k值是非常困难的
K-NN(k-近邻算法)
是一种监督学习方法
通过计算新数据与训练数据特征值之间的距离, 然后选取 K (K>=1) 个距离最近的邻居进行分类或者回归. 如果K = 1 , 那么新数据将被分配给其近邻的类.
- 方法/思路:
- 求新样本点在样本空间内与所有训练样本的欧拉距离;
- 对欧拉距离排序,找出最近的k个点;
- 对k个点分类统计,看哪种类型的点数量最多,此类型即为对新样本的预测类型;