聚类 Hierarchical and K-means Clustering (R/python)

本文介绍了聚类的基本概念和两种常见方法:层次聚类与K均值聚类。层次聚类通过逐步合并或分裂集群进行,适合小规模数据,但计算成本高。K均值聚类适用于大规模数据,但需要预设集群数量,对离群值敏感。文章还展示了R和Python中实现这两种聚类的方法。
摘要由CSDN通过智能技术生成

what is Clustering ?

聚类是一种统计技术,它适用于非监督学习,在数据中创建分组;

与不同集群中的对象相比,同一集群中的对象之间的相似性更大;

应用场景:

  • 客户偏好
  • 基因功能预测
  • 个体化用药
  • ......

Hierarchical Clustering (分层/层次聚类)

  1. 分层聚类首先将每个观测数据放到单独的集群中。
  2. 它检查了所有观测值之间的所有距离 (这个距离可以由不同的算法计算出来,比如欧里几何距离和曼哈顿距离),并将两个最近的观测值配对,形成一个新簇团。
  3. 这个过程不断重复,直到出现一个集群为止。

一个例子:

按照层级聚类,下图种 1-8 八个点将会按照如下顺序分类。

可视分层聚类模型 (树状图)如下:

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

Clark Kent 2000

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值