数据挖掘十大经典算法解析-CSDN博客

本文链接：https://blog.csdn.net/taigw/article/details/19407297

本文介绍了2006年ICDM评选出的数据挖掘十大算法，包括C4.5决策树、k-Means聚类、SVM、Apriori关联规则、EM算法、PageRank、AdaBoost、kNN、朴素贝叶斯和CART。这些算法在机器学习和数据挖掘领域具有重要影响，分别应用于分类、聚类、预测等多个场景。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

2006年的ICDM（the IEEE International Conference on Data Mining) 上，评选出了数据挖掘领域的十大算法，分别是

1，C4.5

C4.5是一系列用在机器学习和数据挖掘的分类问题中的算法。它的目标是监督学习：给定一个数据集，其中的每一个元组都能用一组属性值来描述，每一个元组属于一个互斥的类别中的某一类。C4.5的目标是通过学习，找到一个从属性值到类别的映射关系，并且这个映射能用于对新的类别未知的实体进行分类。

C4.5由J.Ross Quinlan在ID3的基础上提出的。ID3算法用来构造决策树。决策树是一种类似流程图的树结构，其中每个内部节点（非树叶节点）表示在一个属性上的测试，每个分枝代表一个测试输出，而每个树叶节点存放一个类标号。一旦建立好了决策树，对于一个未给定类标号的元组，跟踪一条有根节点到叶节点的路径，该叶节点就存放着该元组的预测。决策树的优势在于不需要任何领域知识或参数设置，适合于探测性的知识发现。

文章：Quinlan, J. R. C4.5: Programs for Machine Learning. Morgan Kaufmann Publishers, 1993.

代码实现

2，k-Means

k-means 算法是一种得到最广泛使用的基于划分的聚类算法，把n个对象分为k个簇，以使簇内具有较高的相似度。相似度的计算根据一个簇中对象的平均值来进行。它与处理混合正态分布的最大期望算法很相似，因为他们都试图找到数据中自然聚类的中心。

算法首先随机地选择k个对象，每个对象初始地代表了一个簇的平均值或中心。对剩余的每个对象根据其与各个簇中心的距离，将它赋给最近的簇，然后重新计算每个簇的平均值。这个过程不断重复，直到准则函数收敛。