【机器学习】4. 相似性比较（二值化数据）与相关度(correlation)

最新推荐文章于 2024-09-30 13:17:10 发布

pen-ai

最新推荐文章于 2024-09-30 13:17:10 发布

阅读量832

点赞数 16

分类专栏：机器学习文章标签：机器学习人工智能 scikit-learn python

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/weixin_48846514/article/details/141475105

版权

机器学习专栏收录该内容

11 篇文章 0 订阅

订阅专栏

SMC

Simple Matching Coefficient 评估两组二进制数组相似性的参数
SMC = (f11 + f00) / (f01+f10+f11+f00)
其中，f11表示两组都为1的组合个数，f10表示第一组为1，第二组为0的组合个数。

这样做会有一个缺点，假设是比较稀疏的数据，如今天去哪一个地区，地区有成千上万个，但是去的只有一个地区。那么就会导致f00非常的大，如此计算的结果SMC必然很大，但是能够代表两组数据高度相关吗？这并不合理。

Jaccard

由于SMC不适配某些场景，Jaccard应运而生。
Jaccard剔除了f00，从而避免了f00过大导致的数值偏差。
J = f11 / (f01 + f10 + f11)

Cosine

适用于二值化数据，也适用于非二值化数据。
广泛用于文档的分类
$\frac{A * B}{||A|| ||B||}$
||A|| L2范式，即上一节讲的欧氏距离

A = [1 , 2, 3]
B = [4, 5, 6]
A*B = 1 * 4 + 2 * 5 + 3 * 6
||A|| = sqrt (1 * 1 + 2 * 2 + 3 * 3)
||B|| = sqrt (4 * 4 + 5 * 5 + 6 * 6)

0°相关
90°不相关
在这里插入图片描述
离的远则不相似，贴得近则相似

Correlation

$\frac{covar(x,y)}{std(x)std(y)}$
$\frac{1}{n-1}\sum^n_{k=1}(x_k - mean(x))(y_k - mean(y))$
$\sqrt{\frac{\sum^n_{k=1}(x_k - mean(x))^2}{n-1}}$

mean: 均值
范围[-1,1] -1是负相关， 0 是不相关， 1 是正相关

关注

16
点赞
踩
26

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。