Python机器学习——聚类的有效性指标,2024年最新字节跳动面试难吗

先自我介绍一下,小编浙江大学毕业,去过华为、字节跳动等大厂,目前阿里P7

深知大多数程序员,想要提升技能,往往是自己摸索成长,但自己不成体系的自学效果低效又漫长,而且极易碰到天花板技术停滞不前!

因此收集整理了一份《2024年最新Python全套学习资料》,初衷也很简单,就是希望能够帮助到想自学提升又不知道该从何学起的朋友。
img
img



既有适合小白学习的零基础资料,也有适合3年以上经验的小伙伴深入学习提升的进阶课程,涵盖了95%以上Python知识点,真正体系化!

由于文件比较多,这里只是将部分目录截图出来,全套包含大厂面经、学习笔记、源码讲义、实战项目、大纲路线、讲解视频,并且后续会持续更新

如果你需要这些资料,可以添加V获取:vip1024c (备注Python)
img

正文

给定数据集D=x⃗ 1,x⃗ 2,…,x⃗ ND=x→1,x→2,…,x→N。假设某个参考模型给出的簇划分为C∗C∗={C∗1C1∗,C∗2C2∗,…,C∗k′′Ck"∗},其簇标记向量为λ⃗ ∗λ→∗。若聚类算法给出的簇划分为C=C={C1,C2,…,CKC1,C2,…,CK},其簇标记向量为λ⃗ λ→。定义:

a=|SS|,SS=[(x⃗ i,x⃗ j)|λi=λj,λ∗i=λ∗j,i<j]a=|SS|,SS=[(x→i,x→j)|λi=λj,λi∗=λj∗,i<j]

b=|SD|,SD=[(x⃗ i,x⃗ j)|λi=λj,λ∗i≠λ∗j,i<j]b=|SD|,SD=[(x→i,x→j)|λi=λj,λi∗≠λj∗,i<j]

c=|DS|,DS=[(x⃗ i,x⃗ j)|λi≠λj,λ∗i=λ∗j,i<j]c=|DS|,DS=[(x→i,x→j)|λi≠λj,λi∗=λj∗,i<j]

d=|DD|,DD=[(x⃗ i,x⃗ j)|λi≠λj,λ∗i≠λ∗j,i<j]d=|DD|,DD=[(x→i,x→j)|λi≠λj,λi∗≠λj∗,i<j]

其中,|.|表示集合元素的个数,各集合的意义如下:

  • SSSS:包含了同时隶属于CC和C∗C∗的样本对;

  • SDSD:包含了隶属于CC,但是不隶属于C∗C∗的样本对;

  • DSDS:包含了不隶属于CC,但是隶属于C∗C∗的样本对;

  • DDDD:包含了既不隶属于CC,又不隶属于C∗C∗的样本对;

由于每个样本对仅属于一个集合,因此有:

a+b+c+d=N(N−1)2a+b+c+d=N(N−1)2

使用上述定义式,可以有下面这些指****标外部指标:

  • Jaccard系数(Jaccard Cofficient,JC):

JC=aa+b+cJC=aa+b+c

它刻画了所有属于同一类的样本对(要么在CC中属于同一类,要么在C∗C∗中属于同一类),同时在C,C∗C,C∗中属于同一类的样本量的比值。

  • FM指数(Fowlkes and Mallows Index,FMI):

FMI=aa+b⋅aa+c−−−−−−−−−−−√FMI=aa+b⋅aa+c

它刻画的是:在CC中属于同一类的样本对中,同时属于C∗C∗的样本对的比例为p1p1,在C∗C∗中属于同一类的样本对中,同时属于CC的样本对的比例为p2p2,FMI就是p1p1和p2p2的几何平均。

  • Rand指数(Rand Index,RI)

RI=2(a+d)N(N−1)RI=2(a+d)N(N−1)

它刻画的是同时隶属C,C∗C,C∗的样本对与同时不隶属于C,C∗C,C∗的样本对之和占所有样本对的比例。

  • ARI指数(Adjusted Rand Index,ARI):

ARI=RI−E[RI]max(RI)−E[RI]ARI=RI−E[RI]max(RI)−E[RI]

使用RI时有个问题,就是对于随机聚类,RI不保证接近0(可能还很大)。而ARI指数就可以利用随机聚类情况下的RI即**E[RI]**来解决这个问题.

这些外部指标性能度量的结果都在[0,1]之间,这些值越大,说明聚类的性能越好

内部指标

现在能在网上找到很多很多的学习资源,有免费的也有收费的,当我拿到1套比较全的学习资源之前,我并没着急去看第1节,我而是去审视这套资源是否值得学习,有时候也会去问一些学长的意见,如果可以之后,我会对这套学习资源做1个学习计划,我的学习计划主要包括规划图和学习进度表。

分享给大家这份我薅到的免费视频资料,质量还不错,大家可以跟着学习

网上学习资料一大堆,但如果学到的知识不成体系,遇到问题时只是浅尝辄止,不再深入研究,那么很难做到真正的技术提升。

需要这份系统化的资料的朋友,可以添加V获取:vip1024c (备注python)
img

一个人可以走的很快,但一群人才能走的更远!不论你是正从事IT行业的老鸟或是对IT行业感兴趣的新人,都欢迎加入我们的的圈子(技术交流、学习资源、职场吐槽、大厂内推、面试辅导),让我们一起学习成长!
图片转存中…(img-0BvQOYRI-1713365345258)]

一个人可以走的很快,但一群人才能走的更远!不论你是正从事IT行业的老鸟或是对IT行业感兴趣的新人,都欢迎加入我们的的圈子(技术交流、学习资源、职场吐槽、大厂内推、面试辅导),让我们一起学习成长!

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值