![3ee61df426e3b244144fd16a4a2f21d6.gif](https://img-blog.csdnimg.cn/img_convert/3ee61df426e3b244144fd16a4a2f21d6.gif)
是新朋友吗?记得先点蓝字关注我哦~
数据挖掘中
常用的数据清洗方法
在数据挖掘过程中,数据清洗主要根据探索性分析后得到的一些结论入手,然后主要对四类异常数据进行处理,分别是缺失值(missing value),异常值(离群点),去重处理(Duplicate Data)以及噪音数据的处理。
![8b1a705a13ce2e75f09906f41190c2e2.png](https://img-blog.csdnimg.cn/img_convert/8b1a705a13ce2e75f09906f41190c2e2.png)
1. 探索性分析
探索性分析部分,对于整个数据来讲是获得对数据一个初步的认识以及对先验知识的一个探索分析过程,在我做相关数据挖掘的过程中,主要是利用python相关的科学计算库进行数据初步的探索,例如数据类型,缺失值,数据集规模,各特征下的数据分布情况等,并利用第三方绘图库进行直观的观察,以获取数据的基本属性与分布情况,另外,通过单变量分析与多变量分析,可以初步探索数据集中各特征之间的关系,以验证在业务分析阶段所提出的假设。
![2fa3245363f92bfca876a22d157a766b.png](https://img-blog.csdnimg.cn/img_convert/2fa3245363f92bfca876a22d157a766b.png)
2. 缺失值
数据集中缺失值的获取方法可以直接通过pandas的自带的多种方法获取,在大