数据挖掘07-数据分析之缺失值处理【方法+代码】

最新推荐文章于 2025-04-18 11:51:57 发布

SeafyLiang

最新推荐文章于 2025-04-18 11:51:57 发布

阅读量1.4w

点赞数 7

分类专栏： Python自学数据挖掘文章标签：数据挖掘数据分析人工智能

本文链接：https://blog.csdn.net/SeafyLiang/article/details/115671683

版权

本文探讨了数据分析中缺失值处理的多种方法，包括删除、常量填充（如均值、中位数）、插值填充、KNN和随机森林预测，并通过实例展示了如何根据数据特性选择合适的方法。处理后的效果通过可视化呈现，帮助理解不同策略的影响。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

数据分析之缺失值处理（方法+代码）

圣人曾说过：数据和特征决定了机器学习的上限，而模型和算法只是逼近这个上限而已。

再好的模型，如果没有好的数据和特征质量，那训练出来的效果也不会有所提高。数据质量对于数据分析而言是至关重要的，有时候它的意义会在某种程度上会胜过模型算法。

数据缺失的原因

首先我们应该知道：**数据为什么缺失？**数据的缺失是我们无法避免的，可能的原因有很多种，博主总结有以下三大类：

无意的：信息被遗漏，比如由于工作人员的疏忽，忘记而缺失；或者由于数据采集器等故障等原因造成的缺失，比如系统实时性要求较高的时候，机器来不及判断和决策而造成缺失；
有意的：有些数据集在特征描述中会规定将缺失值也作为一种特征值，这时候缺失值就可以看作是一种特殊的特征值；
不存在：有些特征属性根本就是不存在的，比如一个未婚者的配偶名字就没法填写，再如一个孩子的收入状况也无法填写；

总而言之，对于造成缺失值的原因，我们需要明确：是因为疏忽或遗漏无意而造成的，还是说故意造成的，或者说根本不存在。只有知道了它的来源，我们才能对症下药，做相应的处理。

数据缺失的类型

在对缺失数据进行处理前，了解数据缺失的机制和形式是十分必要的。将数据集中不含缺失值的变量称为完全变量，数据集中含有缺失值的变量称为不完全变量。而从缺失的分布来将缺失可以分为完全随机缺失，随机缺失和完全非随机缺失。

完全随机缺失（missing completely at random,MCAR）：指的是数据的缺失是完全随机的，不依赖于任何不完全变量或完全变量，不影响样本的无偏性，如家庭地址缺失；
随机缺失(missing at random,MAR)：指的是数据的缺失不是完全随机的，即该类数据的缺失依赖于其他完全变量，如财务数据缺失情况与企业的大小有关；
非随机缺失(missing not at random,MNAR)：指的是数据的缺失与不完全变量自身的取值有关，如高收入人群不原意提供家庭收入；

对于随机缺失和非随机缺失，直接删除记录是不合适的，原因上面已经给出。随机缺失可以通过已知变量对缺失值进行估计，而非随机缺失的非随机性还没有很好的解决办法。

缺失处理

方式1：删除

直接去除含有缺失值的记录，这种处理方式是简单粗暴的，适用于数据量较大（记录较多）且缺失比较较小的情形，去掉后对总体影响不大。一般不建议这样做，因为很可能会造成数据丢失、数据偏移。

func: df.dropna(axis=0, how='any', thresh=None, subset=None, inplace=False)

# 1、删除‘age’列
df.drop('age', axis=1, inplace=True)

# 2、删除数据表中含有空值的行
df.dropna()

# 3、丢弃某几列有缺失值的行
df.dropna(axis=0, subset=['a','b'], inplace=True)

最低0.47元/天解锁文章