数据分析师之必会算法—聚类方法

本文深入探讨了聚类分析,解释了什么是聚类以及其在数据挖掘中的作用。主要聚类算法包括K-means、层次聚类、基于密度和网格的方法。K-means因其简单高效而广泛应用,但也对噪声和异常值敏感。在实践应用中,要注意数据噪声处理、数据标准化和选择关键变量。此外,聚类分析还可用于数据清理、个性化推荐和业务指标的辅助分析。
摘要由CSDN通过智能技术生成

阅读之前看这里👉:博主是正在学习数据分析的一员,博客记录的是在学习过程中一些总结,也希望和大家一起进步,在记录之时,未免存在很多疏漏和不全,如有问题,还请私聊博主指正。
博客地址:天阑之蓝的博客,学习过程中不免有困难和迷茫,希望大家都能在这学习的过程中肯定自己,超越自己,最终创造自己。

1.什么是聚类

聚类:聚类是根据给定的样本,依据它们特征的相似度或距离,将其归并到若干个“类”或“簇”的数据分析问题。
通俗的解释:物以类聚,人以群分。针对几个特定的业务指标,科研将观察对象的群体按照相似性和相异性进行不同的群组的划分。经过划分后,每个群组内部各对象间的相似度会很高,而在不同群组直接的对象彼此间将具有很高的相异度。

聚类分析的算法分为:

1.划分聚类
2.层次聚类
3.密度聚类
4.网格聚类
5.模型聚类

最常用的是划分聚类和层次聚类的方法。
层次聚类的方法是指让最相似的对象两两合并,这样不断地合并,最后就形成了一颗聚类树。

划分聚类的方法就是:给定 m m m个对象的数据集,以及希望生成的细分群体数量 K K K后,可采用这种方法将这些对象分成 K K K ( K ≤ m ) (K\leq m) (Km),使得每个组内对象是相似的, 而组间的对象是相异的。

  • 最常用的划分方法是 K − M e a n s K-Means KMeans方法, 其具体原理是:首先,随机选择 K K K个对象,并且所选择的每个对象都代表一个组的初始均值或初始的组中心值;对剩余的每个对象, 根据其与各个组初始均值的距离,将它们分配给最近的(最相似) 小组;然后, 重新计算每个小组新的均值;这个过程不断重复,直到所有的对象在 K K K组分布中都找到离自己最近的组。

聚类技术在数据分析和数据化运营中的主要用途表现在:既可以直接作为模型对观察对象进行群体划分, 为业务方的精细化运营提供具体的细分依据和相应的运营方案建议&#x

  • 3
    点赞
  • 10
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值