13.4 Introduction to scikit-learn(scikit-learn简介)
scikit-learn
是一个被广泛使用的python
机器学习工具包。里面包含了很多监督式学习和非监督式学习的模型,可以实现分类,聚类,预测等任务。
虽然scikit-learn
并没有和pandas
深度整合,但在训练模型之前,pandas
在数据清洗阶段能起很大作用。
译者:构建的机器学习模型的一个常见流程是,用
pandas
对数据进行查看和清洗,然后把处理过的数据喂给scikit-learn
中的模型进行训练。
这里用一个经典的kaggle
比赛数据集来做例子,泰坦尼克生还者数据集。加载训练集和测试集:
import numpy as np
imp