数据挖掘-数据探索

数据探索是数据挖掘的重要步骤,涉及数据质量分析和数据特征分析。数据质量分析包括缺失值、异常值和一致性分析,确保数据准确性。异常值分析可通过统计量和箱型图识别,不一致性可能导致挖掘结果错误。数据特征分析则涉及分布、对比、统计量、周期性、贡献度和相关性等多个方面,揭示数据内在规律。
摘要由CSDN通过智能技术生成

数据探索

        根据观测、调查收集到初步的样本数据集后,接下来要考虑的问题是:样本数据集的数量和质量是否满足模型构建的要求?有没有出现从未设想过的数据状态?其中有没有什么明显的规律和趋势?各因素之间有什么样的关联性?

        数据探索就是通过检验数据集的数据质量、绘制图表、计算某些特征量等手段,对样本数据集的结构和规律进行分析的过程。

数据探索可以从数据质量分析和数据特征分析等两个角度进行展开。

一.数据质量分析

     数据质量分析是数据挖掘中数据准备过程中的重要一环,是数据预处理的前提,也是数据挖掘分析结论有效性和准确性的基础。数据质量分析的主要任务是检查原始数据中是否存在脏数据,脏数据一般是指不符合要求,以及不能直接进行相应分析的数据。在数据挖掘中,脏数据包括:

   缺失值

   异常值

   不一致的值

   重复数据及含有特殊符号的数据

1.1   缺失值分析

     数据的缺失主要包括记录的缺

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值