【Python数据分析基础】: 数据缺失值处理

最新推荐文章于 2023-08-23 10:03:22 发布

weixin_33720956

最新推荐文章于 2023-08-23 10:03:22 发布

阅读量3k

点赞数 3

文章标签： python 数据结构与算法 php

原文链接：https://juejin.im/post/5b5c4e6c6fb9a04f90791e0c

版权

本文探讨了数据缺失的原因，包括无意、有意和不存在三种情况，并详细分析了数据缺失的类型：完全随机缺失、随机缺失和非随机缺失。接着，重点介绍了数据缺失的处理方法，包括删除记录、数据填补（如均值插补、K-means聚类填补、回归预测、多重插补等）以及不处理的选择。最后，强调了选择处理方法时需要考虑的因素，如数据量、缺失值随机性和模型兼容性。

摘要由CSDN通过智能技术生成

作者：xiaoyu

微信公众号：Python数据科学

知乎：python数据分析师

圣人曾说过：数据和特征决定了机器学习的上限，而模型和算法只是逼近这个上限而已。

再好的模型，如果没有好的数据和特征质量，那训练出来的效果也不会有所提高。数据质量对于数据分析而言是至关重要的，有时候它的意义会在某种程度上会胜过模型算法。

本篇开始分享如何使用Python进行数据分析，主要侧重介绍一些分析的方法和技巧，而对于pandas和numpy等Pyhon计算包的使用会在问题中提及，但不详细介绍。本篇我们来说说面对数据的缺失值，我们该如何处理。文末有博主总结的思维导图。

1 数据缺失的原因

首先我们应该知道：数据为什么缺失？数据的缺失是我们无法避免的，可能的原因有很多种，博主总结有以下三大类：

无意的：信息被遗漏，比如由于工作人员的疏忽，忘记而缺失；或者由于数据采集器等故障等原因造成的缺失，比如系统实时性要求较高的时候，机器来不及判断和决策而造成缺失；
有意的：有些数据集在特征描述中会规定将缺失值也作为一种特征值，这时候缺失值就可以看作是一种特殊的特征值；
不存在：有些特征属性根本就是不存在的，比如一个未婚者的配偶名字就没法填写，再如一个孩子的收入状况也无法填写；

总而言之，对于造成缺失值的原因，我们需要明确：是因为疏忽或遗漏无意而造成的，还是说故意造成的，或者说根本不存在。只有知道了它的来源，我们才能对症下药，做相应的处理。

2 数据缺失的类型

在对缺失数据进行处理前，了解数据缺失的机制和形式是十分必要的。将数据集中不含缺失值的变量称为完全变量，数据集中含有缺失值的变量称为不完全变量。而从缺失的分布来将缺失可以分为完全随机缺失，随机缺失和完全非随机缺失。

完全随机缺失（missing completely at random,MCAR）：指的是数据的缺失是完全随机的，不依赖于任何不完全变量或完全变量，不影响样本的无偏性，如家庭地址缺失；
随机缺失(missing at random,MAR)：指的是数据的缺失不是完全随机的，即该类数据的缺失依赖于其他完全变量，如财务数据缺失情况与企业的大小有关；
非随机缺失(missing not at random,MNAR)：指的是数据的缺失与不完全变量自身的取值有关，如高收入人群不原意提供家庭收入；

对于随机缺失和非随机缺失，直接删除记录是不合适的，原因上面已经给出。随机缺失可以通过已知变量对缺失值进行估计，而非随机缺失的非随机性还没有很好的解决办法。

3 数据缺失的处理方法

重点来了，对于各种类型数据的缺失，我们到底要如何处理呢？以下是处理缺失值的四种方法：删除记录，数据填补，和不处理。

1. 删除记录

优点：

最简单粗暴；

缺点：

牺牲了大量的数据，通过减少历史数据换取完整的信息，这样可能丢失了很多隐藏的重要信息；
当缺失数据比例较大时，特别是缺失数据非随机分布时，直接删除可能会导致数据发生偏离，比如原本的正态分布变为非正太；

最低0.47元/天解锁文章

weixin_33720956

关注

3
点赞
踩
32

收藏

觉得还不错? 一键收藏
2
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

评论 2

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。