目前业界有句话被广为流传:
“数据和特征决定了机器学习的上限,而模型与算法则是逼近这个上限而已。”
因此,特征工程做得好,我们得到的预期结果也就好。
那特征工程到底是什么呢?在此之前,我们得了解特征的类型:文本特征、图像特征、数值特征和类别特征等。我们知道计算机并不能直接处理非数值型数据,那么在我们要将数据灌入机器学习算法之前,就必须将数据处理成算法能理解的格式,有时甚至需要对数据进行一些组合处理如分桶、缺失值处理和异常值处理等。
这也就是特征工程做的事:提取和归纳特征,让算法最大程度地利用数据,从而得到更好的结果。
特征工程功能 流程
获取特征
特征处理
数据采样
数据切分
缺失值填充
数据类型转换
生成ID列
样本去重
修改列名
选择特征列
变量的衍生