Li‘s 影像组学视频学习笔记(19)-数据标准化、归一化极简概述

本笔记来源于B站Up主: 有Li 的影像组学系列教学视频
本节(19)主要介绍: 数据的标准化、归一化

为什么要进行标准化、归一化?

  1. 机器学习算法的要求
  2. 便于横向比较

# 标准化 (影像组学中最常用)
# z = (x - u)/s
# 异常值一般对结果影响不大
from sklearn.preprocessing import StandardScaler
data = [[10,-20],[0.3,999],[-1,12],[0.1,21]]
res = StandardScaler().fit_transform(data)
print(res)

Output:

# [[ 1.72127555 -0.63345074]
#  [-0.46125685  1.73096796]
#  [-0.75376119 -0.55920011]
#  [-0.50625751 -0.53831711]]

# 归一化
# X_std = (X - X.min(axis=0)) / (X.max(axis=0) - X.min(axis=0))
# 异常值有可能对结果有重要影响
from sklearn.preprocessing import MinMaxScaler
data = [[10,-20],[0.3,999],[-1,12],[0.1,21]]
res = MinMaxScaler().fit_transform(data)
print(res)

Output:

# [[1.         0.        ]
#  [0.11818182 1.        ]
#  [0.         0.03140334]
#  [0.1        0.04023553]]

# 与IQR第1四分位数(第25个分位数)和第3个四分位数(第75个分位数)之间的范围相关。
# 不常用
from sklearn.preprocessing import RobustScaler
data = [[10,-20],[0.3,999],[-1,12],[0.1,21]]
res = RobustScaler().fit_transform(data)
print(res)

Output:

[[ 3.37931034 -0.13957935]
 [ 0.03448276  3.75717017]
 [-0.4137931  -0.01720841]
 [-0.03448276  0.01720841]]

Notes: 
 # 影像组学研究中有两处涉及标准化或归一化,一是在图像预处理时,二是特征提取后
 # Image normalization 图像归一化
 # normalize 当设置为True时, 对图像进行归一化处理,默认为False
 # normalizeScale: 对图像进行归一化处理的比例,默认为1
 # RemoveOutliers: 从图像中剔除的离群值

继续深化学习这两个概念时,发现网上对这个的讨论很热闹,原因是由于翻译的不一致,导致概念的混乱,所以最好的办法就是回归英文中的本来定义。

"标准化"和"归一化"这两个中文词要指代四种Feature scaling(特征缩放)方法:

在这里插入图片描述

Rescaling (min-max normalization) ,有时简称normalization(有点坑)。
一般把第一种叫做归一化,第三种叫做标准化。

具体可参考知乎上的讨论帖:标准化和归一化什么区别?
答主@龚焱 及@gokenu 回答的比较详细了。

作者:北欧森林
链接:https://www.jianshu.com/p/afd1a89148fc
来源:简书,已获授权转载

RadiomicsWorld.com “影像组学世界”论坛:
影像组学世界/RadiomicsWorld

  • 0
    点赞
  • 8
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值