因为在数据存在不同的量纲,为了消除不同量纲数值的影响,使得不同指标之间具备可比性。
for example:
分析一个人的身高和体重对健康的影响,如果
使用米(
m
)和千克(kg
)作为单位,那么身高特征会在
1.6
~
1.8m
的数值范围
内,体重特征会在
50
~
100kg
的范围内,分析出来的结果显然会倾向于数值差别比
较大的体重特征。
想要得到更为准确的结果,就需要进行特征归一化(
Normalization
)处理,使各指标处于同一数值量级,以便进行分析。
归一化的方法有
线性函数归一化(
Min-Max Scaling
)。它对原始数据进行线性变换,使
结果映射到
[0, 1]
的范围,实现对原始数据的等比缩放。归一化公式如下:
其中
X
为原始数据,
X
max
、
X
min
分别为数据最大值和最小值。
零均值归一化(
Z-Score Normalization
)。它会将原始数据映射到均值为
0
、标准差为
1
的分布上。具体来说,假设原始特征的均值为
μ
、标准差为
σ
,那么
归一化公式定义为