KNN的优化算法1：距离加权

最新推荐文章于 2025-03-16 17:49:02 发布

有石为玉

最新推荐文章于 2025-03-16 17:49:02 发布

阅读量2.4w

点赞数 12

文章标签： KNN

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/weixin_41770169/article/details/81560946

版权

机器学习专栏收录该内容

63 篇文章

订阅专栏

本文介绍了kNN算法中的加权方法，包括反函数和高斯函数两种加权方式，并详细解释了它们的工作原理及优缺点。此外还讨论了如何在离散型和数值型数据中应用加权kNN。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

参考文章：https://www.cnblogs.com/bigmonkey/p/7387943.html

对参考文章中最后一部分说的有问题的地方进行了修改。

权值加权：为每个点的距离增加一个权重，使得距离近的点可以得到更大的权重，在此描述如何加权。

反函数

　　该方法最简单的形式是返回距离的倒数，比如距离d，权重1/d。有时候，完全一样或非常接近的商品权重会很大甚至无穷大。基于这样的原因，在距离求倒数时，在距离上加一个常量：

　　weight = 1 / (distance + const)

　　这种方法的潜在问题是，它为近邻分配很大的权重，稍远一点的会衰减的很快。虽然这种情况是我们希望的，但有时候也会使算法对噪声数据变得更加敏感。

高斯函数

　　高斯函数比较复杂，但克服了前述函数的缺点，其形式：

　　其中a,b,c∈R

　　高斯函数的图形在形状上像一个倒悬着的钟。a是曲线的高度，b是曲线中心线在x轴的偏移，c是半峰宽度（函数峰值一半处相距的宽度）。

半峰宽度

def gaussian(dist, a=1, b=0, c=0.3):
    return a * math.e ** (-(dist - b) ** 2 / (2 * c ** 2))

　　上面的高斯函数在距离为0的时候权重为1，随着距离增大，权重减少，但不会变为0。下图是高斯函数和其它几个函数的区别，其它函数在距离增大到一定程度时，权重都跌至0或0以下。

计算过程

　　加权kNN首先获得经过排序的距离值，再取距离最近的k个元素。

　　1.在处理离散型数据时，将这k个数据用权重区别对待，预测结果与第n个数据的label相同的概率：

将各个类预测的权重值相加，哪个类最大，就属于哪个类。

f(x) = Wi属于类x / Wi总和 i=1,2,...,k

　　2.在处理数值型数据时，并不是对这k个数据简单的求平均，而是加权平均：通过将每一项的值乘以对应权重，然后将结果累加。求出总和后，除以所有权重之和。

f(x) = Wi*Vi总和 / Wi总和 i=1,2,...,k

　　Vi代表近邻i的值，Wi代表其权重，f(x)是预测的数值型结果。每预测一个新样本的所属类别时，都会对整体样本进行遍历，可以看出kNN的效率实际上是十分低下的。

评论 1

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。