机器学习_一条会说666的咸鱼

最新推荐文章于 2023-11-14 17:07:08 发布

forever luckness

最新推荐文章于 2023-11-14 17:07:08 发布

阅读量769

点赞数

分类专栏：机器学习笔记学习充电

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/leianuo123/article/details/104906962

版权

本文介绍了机器学习中的聚类方法，包括霍普金斯统计量用于检验数据分布，肘方法确定合适的簇数，以及EM算法在模糊聚类中的应用。同时，还讨论了离群值检测的重要性，提到了基于统计学和邻近性的检测方法。

摘要由CSDN通过智能技术生成

聚类对数据的要求
1.数据不能均匀分布
2.霍普金斯统计量，空间统计量，检验空间随机性，在给定的数据集D，它可以看作随机变量o的一个样本，我们想要确定o在多大的程度上，不同于数据空间中的均匀分布。

霍普金斯统计量的操作步骤
1.均匀的从D的空间中抽取n个点p1…pn，也就是说D中的每个样本点都以相同的概率包含在这个样本中，对于每个样本pi(1<=i<=n），我们找出pi在D中的最邻近，并令xi为Pi与它在D中的最邻近之间的距离。

2.均匀的从D的空间中抽取n个点q1…qn，也就是说D中的每个样本点都以相同的概率包含在这个样本中，对于每个样本qi(1<=i<=n），我们找出qi在D-{qi }中的最邻近，并令yi为qi与它在D-{ qi}中的最邻近之间的距离。

3.计算霍普金斯统计量
在这里插入图片描述
霍普金斯统计量解读
霍普金斯统计量告诉我们数据集D多大可能遵循数据空间的均匀分布
如果D是均匀分布，则霍普金斯统计量的分母中的两部分会很接近，从而导致得到的H值接近于0.5，然而，如果D是高度倾斜的，则上式中的第一项的值会显著小于第二项，因而H将接近于0。

聚类的簇数制定
1.经验判断的方法，列如样本点的数目是n,则取k=sqrt(n/2)
2.肘方法
3.PSF或者PST2这类统计量伪F统计量伪T2统计量
4.信息论方法与信息准则
5.交叉验证

肘方法
基于

最低0.47元/天解锁文章

forever luckness

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
机器学习_一条会说666的咸鱼

聚类对数据的要求1.数据不能均匀分布2.霍普金斯统计量，空间统计量，检验空间随机性，在给定的数据集D，它可以看作随机变量o的一个样本，我们想要确定o在多大的程度上，不同于数据空间中的均匀分布。霍普金斯统计量的操作步骤1.均匀的从D的空间中抽取n个点p1…pn，也就是说D中的每个样本点都以相同的概率包含在这个样本中，对于每个样本pi(1<=i<=n），我们找出pi在D中的最邻近，...
复制链接

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。