入门python代码系列：数据清洗与预处理（一）

最新推荐文章于 2024-04-11 09:30:36 发布

wyh_wen

最新推荐文章于 2024-04-11 09:30:36 发布

阅读量1.6k

点赞数 4

分类专栏： python sklearn 机器学习文章标签：数据清洗与预处理 python

本文链接：https://blog.csdn.net/qq_42370261/article/details/84872075

版权

对于刚接触机器学习或者数据分析的同学来说，看大佬们比赛的代码是很难的，一头雾水，都是看不懂的，心里很慌。所以对于初学者来说，还是需要回归简单，只有掌握基础，才能不断深入，我是深有体会的，不知道你感觉如何？接下来我将梳理一套针对初学者的代码系列，希望可以帮助大家也受益自己。

1.导入需要的库

import numpy as np
import pandas as pd

2.导入数据集

data=pd.read_csv("E:/data/data.csv")

3.处理丢失数据

一般情况下连续型变量用列的平均值或中位数填充，分类型变量用众数填充

from sklearn.preprocessing import Imputer
imputer=Imputer(missing_values='NaN',strategy='mean',axis=0)
imputer=imputer.fit(X[:,1:3])
X[:,1:3]=imputer.transform(X[:,1:3])  #需要在array 数组情况下使用，即X.values

4.解析分类数据

from sklearn.preprocessing import LabelEncoder
labelencoder_X=LabelEncoder()
X[

最低0.47元/天解锁文章

wyh_wen

关注

4
点赞
踩
17

收藏

觉得还不错? 一键收藏
0
评论
入门python代码系列：数据清洗与预处理（一）

对于刚接触机器学习或者数据分析的同学来说，看大佬们比赛的代码是很难的，一头雾水，都是看不懂的，心里很慌。所以对于初学者来说，还是需要回归简单，只有掌握基础，才能不断深入，我是深有体会的，不知道你感觉如何？接下来我将梳理一套针对初学者的代码系列，希望可以帮助大家也受益自己。1.导入需要的库import numpy as npimport pandas as pd2.导入...
复制链接

扫一扫