随机森林
在机器学习中,随机森林是一个包含多个决策树的分类器,并且其输出的类别是由个别树输出的类别的众数而定。随机森林是一种继承算法,它属于bagging类型,通过组合多个弱分类器,最终结果通过投票或取均值,使得整体模型的结果具有较高的精确度和泛化性能。
其可以取得不错成绩,主要归功于“随机”和“森林”,一个使它具有抗过拟合能力,一个使它更加精确。
随机森林注意点:
设有N个样本,每个样本有M个features,决策树们其实都是随机的接受n个样本(对行随机取样)的m个feature(对列随机取样),每颗决策树的m个feature相同。
特征选择
特征选择目前比较流行的方法是信息增益、增益率、基尼系数。这里主要介绍基于基尼系数(GINI)的特征选择,因为随机森林采用的CART决策树就是基于基尼系数选择特征的。