16.【进阶】特征提升之特征筛选----feature_selection

本文深入探讨了在机器学习项目中如何进行特征筛选,以提升模型性能。以泰坦尼克号数据集为例,详细阐述了特征筛选的重要性和具体方法,包括基于统计的方法和基于模型的方法,旨在帮助读者掌握有效的特征选择技巧。
摘要由CSDN通过智能技术生成
#-*- coding:utf-8 -*-

#特征筛选的目标:一句话来说就是去冗余特征;与PCA不同,不会修改特征值,而是寻找那些对模型性能提升较大的少量特征

#使用Titanic数据集,通过特征筛选的方法一步步提升决策树的预测性能

import pandas as pd
titanic = pd.read_csv('http://biostat.mc.vanderbilt.edu/wiki/pub/Main/DataSets/titanic.txt')

#分离数据特征与预测目标
y = titanic['survived']
X = titanic.drop(['row.names','name','survived'],axis=1)

#填充缺失数据
X['age'].fillna(X['age'].mean(),inplace=True)
X.fillna('UNKNOWN',inplace=True)

#分割数据
from sklearn.cross_validation import train_test_split
X_train,X_test,y_train,y_test = train_test_split(X,y,test_size=0.25,random_state=33)

#类别型特征向量化
from sklearn.feature_extraction import DictVect
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值