数据清洗

数据清洗

一.什么是数据清洗

我们在获得原始数据之后,并不是一股脑的把这些数据全都拿来使用,实际上,数据在整个机器学习阶段大致经历了这样一个流程:
(原始数据–>数据清洗(形成特征)–>数据预处理–>特征工程–>进入到模型进行训练)

为什么要经历这个流程?原因在于,最开始获得的原始数据,往往存在这样那样的问题,比如说有缺失值,或者干脆就有错误的值,或者前后矛盾的值,前后格式不一致的值,对于这些值,肯定会对训练结果产生影响,进而产生错误。即使不存在上述问题了,数据当中也难免会出现很多的噪声。这些噪声 如果被训练的过多,也会成为过拟合的帮凶。

举个例子:我们假设有一个仪器,它专门检测汽车的尾气排放情况,但是由于仪器本身的缘故,在车子没有停稳的时候,经常会出现一些异常,比如说像下图这样:

在这里插入图片描述

那么很显然,那几个特别高耸的地方,就是出现了异常,数据清洗就是要把这些高耸的尖尖给去掉,形成下面这个样子:

在这里插入图片描述

关于数据清洗,他与数据预处理的界限其

  • 0
    点赞
  • 2
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值