特征向量的归一化方法

  在使用KNN(k-Nearest Neighbours)根据特征值进行分类的时候,如果所有变量位于同一值域范围内,利用这些变量一次性算出距离值是有意义的。不过,假设我们引入一个对最终的分类结果产生影响的新变量(不同类型的变量 Heterogenous Varibales)。与我们目前使用过的变量不同(假设之前的变量的取值均介于0和100之间),这些变量可能会达到1000。很显然,和原先的变量相比,这个新的变量对距离计算所产生的影响更为显著——其影响将超过任何其他变量对距离计算所构成的影响,这意味着,在计算距离的过程中其他变量根本就未被考虑在内。 (摘自《Programming Collective Intelligence》)

  所以在使用KNN之前需要对所有的变量进行归一化处理。下面介绍几种归一化的方法:

  1、线性函数转换,表达式如下:

    y=(x-MinValue)/(MaxValue-MinValue)

  2、对数函数转换,表达式如下:

    y=log10 (x)

  3、反余切函数转换 ,表达式如下:

    y=arctan(x)*2/PI

  4、减去均值,乘以方差:

    y=(x-means)/ variance

转载于:https://www.cnblogs.com/XiaoS/archive/2011/01/22/1942001.html

  • 1
    点赞
  • 3
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值