使用原始的Titanic数据，通过特征筛选，一步步提升性能（特征如何提取）

最新推荐文章于 2023-12-22 11:49:43 发布

459817216

最新推荐文章于 2023-12-22 11:49:43 发布

阅读量516

点赞数

分类专栏：机器学习

本文链接：https://blog.csdn.net/u014727529/article/details/78492121

版权

# coding=gbk
#使用Titanic数据集，通过特征筛选的方法一步步提升决策树的预测性能
import pandas as pd
from sklearn.cross_validation import train_test_split , cross_val_score
from sklearn.feature_extraction import DictVectorizer
from sklearn.tree import DecisionTreeClassifier
from sklearn import feature_selection
import numpy as np
import pylab as pl

titanic = pd.read_csv('http://biostat.mc.vanderbilt.edu/wiki/pub/Main/DataSets/titanic.txt')
#分离数据特征与预测目标
y = titanic['survived']
X = titanic.drop(['row.names','name','survived'],axis=1)
#对缺失的数据进行填充
X['age'].fillna(X['age'].mean(),inplace=True)
X.fillna('UNKNOW',inplace=True)
#分割数据
X_train,X_test,y_train,y_test = train_test_split(X,y,test_size=0.25,random_state=33)
#类别型特征向量化
vec = DictVectoriz

最低0.47元/天解锁文章

确定要放弃本次机会？

福利倒计时

: :

立减 ¥

普通VIP年卡可用

立即使用

459817216

关注关注

0
点赞
踩
1

收藏

觉得还不错? 一键收藏
0
评论
使用原始的Titanic数据，通过特征筛选，一步步提升性能（特征如何提取）

# coding=gbk#使用Titanic数据集，通过特征筛选的方法一步步提升决策树的预测性能import pandas as pdfrom sklearn.cross_validation import train_test_split , cross_val_scorefrom sklearn.feature_extraction import DictVectorizer
复制链接

扫一扫