机器学习之数据归一化（Feature Scaling）

每天一道题

已于 2022-06-12 22:25:34 修改

阅读量746

点赞数 2

分类专栏：机器学习文章标签：机器学习 python

于 2022-06-06 12:49:10 首次发布

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/weixin_51711289/article/details/125144281

版权

机器学习专栏收录该内容

14 篇文章 0 订阅

订阅专栏

数据归一化的原因

如下图所示：
在这里插入图片描述

样本间的距离被发现时间所主导。这样就会使数据不准确，因此我们的解决方案就是将所有的数据映射到同一尺寸，接下来我们介绍两种方法。

最值归一化（normalization)

定义：把所有数据映射到0-1之间。
在这里插入图片描述
注：适用于分布有明显边界的情况，但是受outlier影响较大。
代码：

import numpy as np
import matplotlib.pyplot as plt
X = np.random.randint(0, 100, (50, 2))
X = np.array(X, dtype = float)
X[:,0] = (X[:,0] - np.min(X[:,0])) / (np.max(X[:,0]) - np.min(X[:,0]))
X[:,1] = (X[:,1] - np.min(X[:,1])) / (np.max(X[:,1]) - np.min(X[:,1]))

注：由于numpy只能存在一种数据类型，所以我们需要将数据类型转化为float，否则归一化完的数据无法正确显示。

然后我们将归一化的数据绘图：

plt.scatter(X[:,0], X[:,1])
plt.show()

在这里插入图片描述
可以明显的看出所有数据在0-1之间。

均值方差归一化（standardization）

定义：把所有数据归一到均值为0方差为1的分布中
!](https://img-blog.csdnimg.cn/4533d2d4ed1043fa86c949e960b559f4.png)
适用条件：数据分布没有明显的边界；有可能存在极端数据值。
代码：

X2 = np.random.randint(0, 100, (50, 2))
X2 = np.array(X, dtype = float)
X2[:,0] = (X2[:,0] - np.mean(X2[:,0])) / np.std(X2[:,0])
X2[:,1] = (X2[:,1] - np.mean(X2[:,1])) / np.std(X2[:,1])

然后我们绘图可得：

plt.scatter(X2[:,0],X2[:,1])
plt.show()

在这里插入图片描述
可以看出数据并不是在0-1之间。
接下来我们看下他的均值与标准差：

可以很明确的看出均值几乎等于0，而标准差就是为1。

每天一道题

关注

2
点赞
踩
0

收藏

觉得还不错? 一键收藏
打赏
1
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

专栏目录

每天一道题 CSDN认证博客专家 CSDN认证企业博客

码龄4年

101: 原创

17万+: 周排名

158万+: 总排名

20万+: 访问

: 等级

1673: 积分

1222: 粉丝

493: 获赞

96: 评论

2150: 收藏

私信

关注

热门文章

分类专栏

算法 6篇
机器学习 14篇
数学建模 20篇
计网 17篇
计组 16篇
天梯赛 12篇
opencv 10篇
汇编语言 6篇

最新评论

灰色关联分析
2401_86048272: 样本数量在多少范围内可以用灰色关联分析，是有界定区间嘛
主成分分析法
境界面上的双曲线: 其实预测之后的数据我们也可以用映射矩阵P把他返回到高维空间，但是我感觉这种操作没啥应用价值，因为如果想应用到实际现实生活中，用神经网络预测出一段时间序列的数据之后，但是我们没有这段时间序列的映射矩阵P，根本无法将数据返回到原始的高维空间，这只是我的理解而已，因为有论文就这么做了，所以可能是某些东西我没想到吧
主成分分析法
qq_49629697: 你解决了吗
主成分分析法
2301_77163053: 请问最后主成分提取个数多余量表纬度合理吗
灰色关联分析
goodluckcs_vb: 是否要考虑几个序列之间有无关联？比如第三产业实际是以第一、第二产业为基础的，没有第一、第二产业，第三产业也发展不起来。

最新文章

目录

评论 1

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

打赏作者

每天一道题 你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20

扫码支付：¥1

获取中

扫码支付

您的余额不足，请更换扫码支付或充值

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。