决策树
随机森林算法是机器学习、计算机视觉等领域内应用极为广泛的一个算法,它不仅可以用来做分类,也可用来做回归即预测,随机森林机由多个决策树构成,相比于单个决策树算法,它分类、预测效果更好,不容易出现过度拟合的情况。
图1 具体例子
决策树的含义:
决策树是数据挖掘与机器学习领域中一种非常重要的分类器,算法通过训练数据来构建一棵用于分类的树,从而对未知数剧进行高校分类。
决策树的构建步骤:
- 将所有记录看作是一个节点
- 遍历每个记录的分割方式,找到最好的分割点
- 利用分割点将记录分割成两个子节点C1和C2
- 对子结点C1和C2重复执行步骤2. 3. 直到满足特定条件为止。
分割点:
寻找好的分割点是通过量化分割后类的纯度来确定的,目前有三种纯度计算方式,分别是Gini不纯度、熵(Entropy)及错误率,它们的公式定义为:(1)、