偏态数据的观察、量化评估与处理前后的对比

最新推荐文章于 2023-12-26 23:49:44 发布

VIP文章 -Pursuit-

最新推荐文章于 2023-12-26 23:49:44 发布

阅读量1.9k

点赞数

分类专栏：机器学习文章标签： python 数据挖掘机器学习

本文链接：https://blog.csdn.net/weixin_45624843/article/details/124520137

版权

在机器学习中，模型更容易从具有正态分布特性的数据中学习到有用特征。但我们经常会发现有些特征存在长尾分布，对于这种偏态分布数据，需要进行特殊的处理，本文首先观察特征分布情况，然后以量化的方式评估数据偏态程度从而挑选出偏态数据，最后对偏态数据进行对数化处理，对比处理前后的特征分布。

通过箱线图观察不同特征的分布情况

# 查看特征的数据倾斜情况
# 丢弃y值
all_features = df_train.drop(['label'], axis=1)
 
# 找出所有的数值型变量
numeric_dtypes = ['int16', 'int32', 'int64', 'float16', 'float32', 'float64']
numeric = []
for i in df_data.columns:
    if df_data[i].dtype in numeric_dtypes:
        numeric.a

最低0.47元/天解锁文章

-Pursuit-

关注

0
点赞
踩
3

收藏

觉得还不错? 一键收藏
0
评论
偏态数据的观察、量化评估与处理前后的对比

在机器学习中，模型更容易从具有正态分布特性的数据中学习到有用特征。但我们经常会发现有些特征存在长尾分布，对于这种偏态分布数据，需要进行特殊的处理，本文首先观察特征分布情况，然后以量化的方式评估数据偏态程度从而挑选出偏态数据，最后对偏态数据进行对数化处理，对比处理前后的特征分布。通过箱线图观察不同特征的分布情况# 查看特征的数据倾斜情况# 丢弃y值all_features = df_train.drop(['label'], axis=1) # 找出所有的数值型变量numeric_dtype.
复制链接

扫一扫