机器学习笔记:ID3算法建立决策树(一)

ID3算法的核心思想

信息熵的下降速度作为选取测试属性的标准,所选的测试属性是从根节点到当前节点的路径上尚未被考虑的具有最高信息增益的属性。

维基百科上对ID3算法有比较详细的介绍:ID3维基

计算过程相关公式

  1. x 是一个离散型的随机变量,其概率分布为

    p(x)=P(X=x),xX

    则X的熵为

    H(X)=i=0np(xi)log2p(xi)

    约定 0log20=0
    n 表示有多少个分类,可以理解为所选测试属性下有多少个不同值,H越大,信息的不确定性越大,H越小,信息的不确定性越小,H等于0时最具确定性,这种情况是所有元素都归为同一类,每个值的发生都有相同的概率。

  2. 参考至信息论中的信道的数学模型 ,有
    U=[u1,u2,u3,...,ur] ,信源所发消息,离散随机变量;
    V=[v1,v2,v3,...,vq] ,新宿所收消息,离散随机变量;
    P(V|U) :转移概率表示发生为U,接收为V的概率,存在

    (vj|ui)=1,i=1,2,...,r;j=1,2,...,q

    P(V|U) 可以这样理解,当一个属性中取值为 U 时,对另一个属性取值
    V的影响程度

  3. 先验概率 P(U) :信源发送消息前, U 的概率分布。其实就是上面的p(x)

  4. 后验概率 P(U|vj) : 信宿端收到消息 vj 后,U的概率分布。
  5. 后验熵:信宿端收到 vj 后,关于U的平均不确定性为:
    H(U|vj)=i=0rP(ui|vj)log2P(ui|vj),j=1,2,...,q
  6. 条件熵:
    H(U|V)=j=0qi=0rP(ui|vj)log2P(ui|vj)

    条件熵即信道疑异度,对后验熵在输出 V 集合中求期望值,表示在信宿端收到全部输出v后,对信源端 U 尚存在的不确定性。
  7. H(U|V)<H(U)
  8. 信息增益:衡量通过信道传输进行通信后所消除的不确定性的大小,定义为:
    I(U,V)=H(U)H(U|V)

    表示收到 V 后获得关于U的信息量,是不确定性的消除是信宿端所获得的信息量,其中:
    H(U)=i=0rP(ui)log2P(ui)

    H(U|V)=j=0qi=0rP(ui|vj)log2P(ui|vj)

ID3算法步骤

计算各属性的信息增益,找出最大者为根节点
1. 先验熵:没有接收到其他属性时的平均不确定性
2. 后验熵:接收到输出符号Vj时关于信源的不确定性
3. 条件熵:对后验熵在输出符号集V中求期望,接收到全部符号后对信源的不确定性
4. 信息增益:先验熵与条件熵的差,是信宿端所获得信息量
对剩余属性重复上述步骤。递归思想。

例子后续补充

  • 2
    点赞
  • 3
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
### 回答1: 《机器学习学习笔记.pdf》是一本关于机器学习的学习笔记的电子书,其内容涵盖了机器学习的基本概念、算法原理和实践应用等方面。 该电子书的主要内容包括但不限于以下几个方面: 1. 机器学习基础:介绍了机器学习的基本概念、发展历史和核心原理,帮助读者建立起对机器学习的整体认识和理解。 2. 机器学习算法:详细介绍了常见的机器学习算法,包括监督学习算法(如线性回归、逻辑回归、决策树、支持向量机等)、无监督学习算法(如聚类算法、降维算法等)和强化学习算法等,使读者能够了解和掌握不同类型的机器学习算法及其应用场景。 3. 机器学习实践:讲解了机器学习的实践方法和流程,涵盖了数据预处理、特征工程、模型选择和评估等方面的内容,帮助读者掌握如何在实际问题中应用机器学习技术。 4. 应用案例:通过实际案例的介绍和分析,展示了机器学习在自然语言处理、计算机视觉、推荐系统等领域的应用,激发读者对机器学习在实际问题中的应用的兴趣和思考能力。 通过阅读《机器学习学习笔记.pdf》,读者可以系统地学习机器学习的基础知识和算法原理,了解机器学习的应用场景和实践方法,并通过实际案例的分析加深对机器学习技术的理解。这本电子书可以作为机器学习初学者的入门学习资料,也适合有一定机器学习基础的读者作为参考和进一步学习的资料。希望通过这本电子书的阅读,读者能够理解和掌握机器学习的相关知识,为未来在机器学习领域的学习和研究打下坚实的基础。 ### 回答2: 《机器学习学习笔记.pdf》是一本介绍机器学习的学习资料。机器学习是一种通过利用数据来训练计算算法的方法,使其能够自动地从数据中学习和提高性能。这本学习笔记涵盖了机器学习的基本概念、原理和方法,适合初学者和对机器学习感兴趣的读者。 首先,学习笔记机器学习的基本概念入手,包括机器学习的定义、应用领域以及机器学习的三个主要任务:监督学习、无监督学习和强化学习。然后,详细介绍了机器学习的基本原理,如训练集、测试集、特征选择和模型评估等。此外,学习笔记还介绍了几种常见的机器学习算法,如决策树、支持向量机和深度学习等。 除了理论知识,学习笔记还提供了实践案例和代码示例,帮助读者更好地理解和应用机器学习算法。读者可以通过实践案例来掌握机器学习算法的具体应用,并且可以利用代码示例进行实际编程实践。同时,学习笔记还讨论了机器学习的一些挑战和未来的发展方向,如数据质量、模型解释性和自动化机器学习等。 总的来说,《机器学习学习笔记.pdf》是一本全面介绍机器学习的学习资料。它结合理论和实践,旨在帮助读者建立机器学习的基本理解,并具备在实际问题中应用机器学习算法的能力。无论是初学者还是有一定机器学习基础的读者,都可以从中获得有益的知识和经验。 ### 回答3: 《机器学习学习笔记.pdf》是一本关于机器学习的学习笔记文档。机器学习是人工智能领域的重要分支,它研究如何使计算机系统自动从数据中学习和改进,以完成特定任务。这本学习笔记以简洁明了的方式介绍了机器学习的基本概念、算法和实践应用。 笔记中首先介绍了机器学习的基础知识,包括监督学习、无监督学习和强化学习等不同的学习类型。然后详细讲解了常用的机器学习算法,如线性回归、逻辑回归、决策树、支持向量机等。每种算法都给出了清晰的定义和示例,并详细解释了算法的原理和应用场景。 此外,《机器学习学习笔记.pdf》还包括了机器学习的实践应用和案例分析。它介绍了如何通过Python等编程语言和机器学习库进行实际的机器学习项目开发,包括数据预处理、特征工程、模型训练和评估等环节。对于初学者来说,这部分内容非常有价值,可以帮助他们快速进入实际应用的阶段。 总结来说,《机器学习学习笔记.pdf》是一本很好的机器学习入门教材,它详细介绍了机器学习的基本概念和常用算法,并提供了实际项目的实践指导。无论是对于想要了解机器学习基础知识的初学者,还是对于已经有一定机器学习经验的开发者来说,这本学习笔记都是一本值得阅读和参考的资料。

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值