数据预处理

数据预处理

在这里插入图片描述

数据解读

1.利用pandas包读取数据

# 读取excel表格,第三行开始读取,读取train表
pd.read_excel('data.xlsx', header=2, sheet_name='train')
#读取csv文件 
pd.read_csv('data.csv', header=0)

2.查看数据集基本信息

data.info()  #DataFrame
data.shape  #数据集规模

数据探索

1.数据正确性校验

# 检验数据集id无重复
data['id'].nunique() == train.shape[0]

2.校验数据缺失情况

# 按列求缺失值并汇总
data.isnull().sum()

3.异常值校验
首先查看某一列的基本统计信息,一般对于连续变量,尤其对回归问题的数据集的标签

statistics = data['target'].describe()

在这里插入图片描述
对于连续变量,可以借助概率密度直方图进行分布的观察:

import seaborn as sns
import matplotlib.pyplot as plt
sns.set()
sns.histplot(train['target'], kde=True)

概率密度直方图
当然,对于连续变量,我们也可以简单计算下异常值范围:

statistics
  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
Flink是一个开源的流处理和批处理框架,它提供了强大的数据处理能力。在Flink中,数据预处理是指在进行实时流处理或者批处理之前对数据进行一系列的转换、清洗、过滤等操作,以便后续的分析和计算。 Flink提供了多种数据预处理的功能和工具,下面是一些常用的数据预处理技术和方法: 1. 数据转换:Flink支持对数据进行各种转换操作,如映射、过滤、合并等。通过使用Flink提供的转换函数,可以对输入数据进行各种操作,从而得到符合需求的输出数据。 2. 数据清洗:在实际应用中,原始数据往往存在一些噪声、错误或者缺失值。Flink提供了丰富的数据清洗工具,可以对数据进行去重、填充缺失值、异常值检测等操作,以保证数据的质量和准确性。 3. 数据聚合:在数据预处理过程中,常常需要对数据进行聚合操作,如求和、计数、平均值等。Flink提供了丰富的聚合函数和窗口操作,可以方便地对数据进行聚合分析。 4. 数据分割:有时候需要将大规模的数据集划分为多个小的数据集,以便进行并行处理。Flink提供了数据分割的功能,可以将数据集按照指定的规则进行划分,以便并行处理。 5. 数据格式转换:在实际应用中,数据的格式可能存在差异,如不同的编码方式、数据类型等。Flink提供了数据格式转换的工具,可以将不同格式的数据进行转换,以便后续的处理和分析。

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值