特征选择
- 特征选取
从文字、图像、声音等其他非结构化的数据中提取信息作为特征
- 特征创造
把现有的特征进行组合,或相互计算得到新的特征
- 特征选择
从所有的特征中,选择出有意义、对模型有帮助的特征,避免将所有的特征都导入到模型中
选择特征的方法
- 过滤法
- 嵌入法
- 包装法
- 降维算法
决策树
决策树是一种有监督的方法,它能从一系列有特征和标签的数据中总结出决策规则,并用树状图的结构来呈现这些规则,以解决分类和回归问题。
- 剪枝
在不加限制的情况下,一棵决策树会生长到衡量不纯度的指标最优,或者没有更多的特征可用为止。这样的决策树往往会过拟合,这就是说,它会在训练集上表现很好,在测试集上却表现糟糕。我们收集的样本数据不可能和整体的状况完全一致,因此当一棵决策树对训练数据有了过于优秀的解释性,它找出的规则必然包含了训练样本中的噪声,并使它对未知数据的拟合程度不足。