（二）数据处理及特征清理

最新推荐文章于 2021-08-18 23:02:37 发布

YakultGo

最新推荐文章于 2021-08-18 23:02:37 发布

阅读量256

点赞数

分类专栏：数据分析 python pandas 文章标签：数据分析数据挖掘 python

本文链接：https://blog.csdn.net/weixin_43869610/article/details/108077299

版权

python 同时被 3 个专栏收录

18 篇文章 0 订阅

订阅专栏

pandas

7 篇文章 0 订阅

订阅专栏

数据分析

5 篇文章 2 订阅

订阅专栏

2.1 缺失值观察与处理

我们拿到的数据经常会有很多缺失值，比如我们可以看到Cabin列存在NaN，那其他列还有没有缺失值，这些缺失值要怎么处理呢。

2.1.1 缺失值观察

还是以泰坦尼克号的数据为例。查看各个特征缺失值个数

# 首先导入库和数据
import numpy as np
import pandas as pd
df = pd.read_csv('train.csv')

方法1：

df.info()

不过这样显示的是非缺失值的数据，不够直观。

方法2：

df.isnull().sum()

2.1.2 对缺失值进行处理

1）填充

方法1：不使用函数（假设对Age这列进行0填充）

df[df['Age']==None] = 0
df[df['Age'].isnull()] = 0
df[df['Age'] == np.nan] = 0

当然了，上面我使用的是用0填充，你可以用别的你想用的值进行填充。

方法2：使用fillna()

DataFrame.``fillna(value=None, method=None**,** axis=None**,** inplace=False**,** limit=None**,** downcast=None**)**

这是文档当中的定义。

df['Age'].fillna(0)

2.2 重复值观察与处理

1）查看重复值：使用的是duplicated()

df[df.duplicated()]

2）删掉重复值：使用的是drop_duplicates()

df.drop_duplicates()

2.3 特征观察与处理

数值型特征一般可以直接用于模型的训练，但有时候为了模型的稳定性及鲁棒性会对连续变量进行离散化。文本型特征往往需要转换成数值型特征才能用于建模分析。

1）分箱：一种无监督离散化方法，分为两类，1 等距离分箱 2 等频度分箱。等距离分箱即等宽度分箱，设有K个空间，则每个空间的间距 I=（Max-Min）/K。等频率分箱，即等深度分箱

pandas.``cut(x, bins**,** right=True**,** labels=None**,** retbins=False**,** precision=3**,** include_lowest=False**,** duplicates='raise’, ordered=True**)**

pandas.``qcut(x, q**,** labels=None**,** retbins=False**,** precision=3**,** duplicates='raise’)

分箱一般会使用上面这两个函数。

【例子】1：将连续变量Age平均分箱成5个年龄段，并分别用类别变量12345表示

pd.cut(df['Age'], 5, labels=[1, 2, 3, 4, 5])

【例子】2：将连续变量Age划分为[0,5) [5,15) [15,30) [30,50) [50,80)五个年龄段，并分别用类别变量12345表示

pd.cut(df['Age'], [0, 5, 15, 30, 50, 80], right=False, labels=[1, 2, 3, 4, 5])

【例子】3：将连续变量Age按10% 30% 50 70% 90%五个年龄段，并用分类变量12345表示

pd.qcut(df['Age'], [0.1, 0.3, 0.5, 0.7, 0.9, 1.], labels=[1, 2, 3, 4, 5])

2）对文本变量进行转换

方法1

df['Sex_num'] = df['Sex'].replace(['male','female'],[1,2])
# 适用于种类较少的

方法2

df['Sex_num'] = df['Sex'].map({'male':1, 'female':2})
# 跟方法1一样，适用于种类较少的。

方法3

from sklearn.preprocessing import LabelEncoder
for feat in ['Cabin', 'Ticket']:
    lbl = LabelEncoder()  
    label_dict = dict(zip(df[feat].unique(), range(df[feat].nunique())))
    df[feat + "_labelEncode"] = df[feat].map(label_dict)
    df[feat + "_labelEncode"] = lbl.fit_transform(df[feat].astype(str))
# 这种就无所谓种类的的多少了，均适用

YakultGo

关注

0
点赞
踩
1

收藏

觉得还不错? 一键收藏
0
评论
（二）数据处理及特征清理

2.1 缺失值观察与处理我们拿到的数据经常会有很多缺失值，比如我们可以看到Cabin列存在NaN，那其他列还有没有缺失值，这些缺失值要怎么处理呢。2.1.1 缺失值观察还是以泰坦尼克号的数据为例。查看各个特征缺失值个数# 首先导入库和数据import numpy as npimport pandas as pddf = pd.read_csv('train.csv')方法1：df.info()不过这样显示的是非缺失值的数据，不够直观。方法2：df.isnull().sum()
复制链接

扫一扫