数据分析02：数据清洗及特征处理

最新推荐文章于 2023-04-03 14:49:53 发布

luckywlj0115

最新推荐文章于 2023-04-03 14:49:53 发布

阅读量276

点赞数

分类专栏：学习笔记文章标签：数据分析

本文链接：https://blog.csdn.net/weixin_44533660/article/details/119812489

版权

学习笔记专栏收录该内容

19 篇文章 0 订阅

订阅专栏

2 第二章：数据清洗及特征处理

我们拿到的数据通常是不干净的，所谓的不干净，就是数据中有缺失值，有一些异常点等，需要经过一定的处理才能继续做后面的分析或建模，所以拿到数据的第一步是进行数据清洗，本章我们将学习缺失值、重复值、字符串和数据转换等操作，将数据清洗成可以分析或建模的样子。

开始之前，导入numpy、pandas包和数据

import numpy as np
import pandas as pd
#加载数据train.csv
df = pd.read_csv("train.csv")
df.head()

在这里插入图片描述

2.1 缺失值观察与处理

我们拿到的数据经常会有很多缺失值，比如我们可以看到Cabin列存在NaN，那其他列还有没有缺失值，这些缺失值要怎么处理呢?

2.1.1 任务一：缺失值观察

(1) 请查看每个特征缺失值个数
(2) 请查看Age， Cabin， Embarked列的数据以上方式都有多种方式，所以大家多多益善

#方法一
df.info()   #可以看出Age,Cabin,Embrarked三列数据有缺失值

<class ‘pandas.core.frame.DataFrame’>
RangeIndex: 891 entries, 0 to 890
Data columns (total 12 columns):
#Column Non-Null Count Dtype

0 PassengerId 891 non-null int64
1 Survived 891 non-null int64
2 Pclass 891 non-null int64
3 Name 891 non-null object
4 Sex 891 non-null object
5 Age 714 non-null float64
6 SibSp 891 non-null int64
7 Parch 891 non-null int64
8 Ticket 891 non-null object
9 Fare 891 non-null float64
10 Cabin 204 non-null object
11 Embarked 889 non-null object
dtypes: float64(2), int64(5), object(5)
memory usage: 83.7+ KB

#方法二
df.isnull().sum() #可以直接得到Age,Cabin,Embrarked三列数据缺失值个数

PassengerId 0
Survived 0
Pclass 0
Name 0
Sex 0
Age 177
SibSp 0
Parch 0
Ticket 0
Fare 0
Cabin 687
Embarked 2
dtype: int64

df[['Age','Cabin','Embarked']].head(3)

在这里插入图片描述

2.1.2 任务二：对缺失值进行处理

(1)处理缺失值一般有几种思路
(2) 请尝试对Age列的数据的缺失值进行处理
(3) 请尝试使用不同的方法直接对整张表的缺失值进行处理

#处理缺失值的一般思路：
#提醒：可使用的函数有--->dropna函数与fillna函数
df[df['Age']==None]=0
df.head(10)

在这里插入图片描述

#把Age有缺失值的一行全部置为0
df[df['Age'].isnull()]=0
df.head(10)

在这里插入图片描述

#把Age值为NaN的一行全部置为0
df[df['Age']==np.nan]==0
df.head(10)

结果同上
【思考】检索空缺值用np.nan,None以及.isnull()哪个更好，这是为什么？如果其中某个方式无法找到缺失值，原因又是为什么？

【回答】数值列读取数据后，空缺值的数据类型为float64所以用None一般索引不到，比较的时候最好用np.nan

【思考1】dropna和fillna有哪些参数，分别如何使用呢?

dropna函数的作用是删除有缺失值的行或者列，具体用法如下：
data.dropna(how = ‘all’) # 传入这个参数后将只丢弃全为缺失值的那些行
data.dropna(axis = 1) # 丢弃有缺失值的列（一般不会这么做，这样会删掉一个特征）
data.dropna(axis=1,how=“all”) # 丢弃全为缺失值的那些列
data.dropna(axis=0,subset = [“Age”, “Sex”]) # 丢弃‘Age’和‘Sex’这两列中有缺失值的行
fillna函数的作用是填充缺失数值，具体用法如下：
df1.fillna(100) #用常数填充
df1.fillna({0:10,1:20,2:30})#通过字典填充不同的常数
df1.fillna(0,inplace=True)#传入inplace=True直接修改原对象
df2.fillna(method=‘ffill’)#用前面的值来填充
df2.fillna(method=‘bfill’,limit=2)#传入limit=“限制填充个数”
df2.fillna(method=“ffill”,limit=1,axis=1)#传入axis=” “修改填充方向
具体用法举例参考https://blog.csdn.net/weixin_38168620/article/details/79596819

luckywlj0115

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
数据分析02：数据清洗及特征处理

2 第二章：数据清洗及特征处理我们拿到的数据通常是不干净的，所谓的不干净，就是数据中有缺失值，有一些异常点等，需要经过一定的处理才能继续做后面的分析或建模，所以拿到数据的第一步是进行数据清洗，本章我们将学习缺失值、重复值、字符串和数据转换等操作，将数据清洗成可以分析或建模的样子。2.1 缺失值观察与处理¶2.1.1 任务一：缺失值观察使用df.info()可以获得数据的索引,数据类型和内存信息df.info()使用.isnull()函数可以观察缺失值df.isnull()使用,sum()
复制链接

扫一扫