数据挖掘面试：01特征归一化

最新推荐文章于 2024-05-28 08:45:00 发布

ID3

最新推荐文章于 2024-05-28 08:45:00 发布

阅读量628

点赞数

文章标签：数据挖掘

本文链接：https://blog.csdn.net/weixin_43269492/article/details/115049034

版权

01特征归一化

Q：为什么要对数值型特征做归一化
A：1）归一化后的特征可以提高模型的收敛速度速度
2）归一化可以提高模型精度，这在涉及到一些距离计算的算法时效果显著，比如算法要计算欧氏距离，下图中x2的取值范围比较小，涉及到距离计算时其对结果的影响远比x1带来的小，所以这就会造成精度的损失。所以归一化很有必要，他可以让各个特征对结果做出的贡献相同。
在多指标评价体系中，由于各评价指标的性质不同，通常具有不同的量纲和数量级。当各指标间的水平相差很大时，如果直接用原始指标值进行分析，就会突出数值较高的指标在综合分析中的作用，相对削弱数值水平较低指标的作用。因此，为了保证结果的可靠性，需要对原始指标数据进行标准化处理。
在数据分析之前，我们通常需要先将数据标准化，利用标准化后的数据进行数据分析。数据标准化也就是统计数据的指数化。数据标准化处理主要包括数据同趋化处理和无量纲化处理两个方面。数据同趋化处理主要解决不同性质数据问题，对不同性质指标直接加总不能正确反映不同作用力的综合结果，须先考虑改变逆指标数据性质，使所有指标对测评方案的作用力同趋化，再加总才能得出正确结果。数据无量纲化处理主要解决数据的可比性。经过上述标准化处理，原始数据均转换为无量纲化指标测评值，即各指标值都处于同一个数量级别上，可以进行综合测评分析。
从经验上说，归一化是让不同维度之间的特征在数值上有一定比较性，可以大大提高分类器的准确性。

在这里插入图片描述

使用MinMaxScaler做简单的归一化

数据(x)按照最小值中心化后，再按极差（最大值 - 最小值）缩放，数据移动了最小值个单位，并且会被收敛到[0,1]之间，而这个过程，就叫做数据归一化(Normalization，又称Min-Max Scaling)。注意，Normalization是归一化，不是正则化，真正的正则化是regularization，不是数据预处理的一种手段，归一化之后的数据服从正态分布。

from sklearn.preprocessing import MinMaxScaler
data=[[-1,2],[-0.5,<

最低0.47元/天解锁文章

ID3

关注

0
点赞
踩
1

收藏

觉得还不错? 一键收藏
0
评论
数据挖掘面试：01特征归一化

01特征归一化Q：为什么要对数值型特征做归一化A：1）归一化后的特征可以提高模型的收敛速度速度2）归一化可以提高模型精度，这在涉及到一些距离计算的算法时效果显著，比如算法要计算欧氏距离，下图中x2的取值范围比较小，涉及到距离计算时其对结果的影响远比x1带来的小，所以这就会造成精度的损失。所以归一化很有必要，他可以让各个特征对结果做出的贡献相同。在多指标评价体系中，由于各评价指标的性质不同，通常具有不同的量纲和数量级。当各指标间的水平相差很大时，如果直接用原始指标值进行分析，就会突出数值较高的指标在综
复制链接

扫一扫