对于刚接触机器学习或者数据分析的同学来说,看大佬们比赛的代码是很难的,一头雾水,都是看不懂的,心里很慌。所以对于初学者来说,还是需要回归简单,只有掌握基础,才能不断深入,我是深有体会的,不知道你感觉如何?接下来我将梳理一套针对初学者的代码系列,希望可以帮助大家也受益自己。
1.导入需要的库
import numpy as np
import pandas as pd
2.导入数据集
data=pd.read_csv("E:/data/data.csv")
3.处理丢失数据
一般情况下连续型变量用列的平均值或中位数填充,分类型变量用众数填充
from sklearn.preprocessing import Imputer
imputer=Imputer(missing_values='NaN',strategy='mean',axis=0)
imputer=imputer.fit(X[:,1:3])
X[:,1:3]=imputer.transform(X[:,1:3]) #需要在array 数组情况下使用,即X.values
4.解析分类数据
from sklearn.preprocessing import LabelEncoder
labelencoder_X=LabelEncoder()
X[