数据挖掘及算法

最新推荐文章于 2023-01-25 11:14:55 发布

北陈

最新推荐文章于 2023-01-25 11:14:55 发布

阅读量588

点赞数

文章标签：人工智能算法

本文链接：https://blog.csdn.net/m0_65249160/article/details/125412352

版权

数据挖掘的一般过程包括以下几个方面：

数据预处理数据挖掘后处理

首先来说说数据预处理。之所以有这样一个步骤，是因为通常的数据挖掘需要涉及相对较大的数据量，这些数据可能来源不一导致格式不同，可能有的数据还存在一些缺失值或者无效值，如果不经处理直接将这些‘脏’数据放到模型中去跑，非常容易导致模型计算的失败或者可用性很差，所以数据预处理是数据挖掘过程中都不可或缺的一步。

至于数据挖掘和后处理相对来说就容易理解多了。完成了数据的预处理，我们通常进行特征构造，然后放到特定的模型中去计算，利用某种标准去评判不同模型或组合模型的表现，最后确定一个最合适的模型用于后处理。后处理的过程相当于已经发现了那个我们想要找到的结果，然后去应用它或者用合适的方式将其表示出来。

这里涉及到数据挖掘的一系列算法，主要分为分类算法，聚类算法和关联规则三大类，这三类基本上涵盖了目前商业市场对算法的所有需求。而这三类里，最为经典的则是下面这十大算法。

1、分类决策树算法C4.5

C4.5，是机器学习算法中的一种分类决策树算法，它是决策树(决策树，就是做决策的节点间的组织方式像一棵倒栽树)核心算法ID3的改进算法。

2、K平均算法

K平均算法(k-means algorithm)是一个聚类算法，把n个分类对象根据它们的属性分为k类(k

3、支持向量机算法

支持向量机(Support Vector Machine)算法，简记为SVM，是一种监督式学习的方法，广泛用于统计分类以及回归分析中。

4、The Apriori algorithm

Apriori算法是一种最有影响的挖掘布尔关联规则频繁项集的算法，其核心是基于两阶段“频繁项集”思想的递推算法。其涉及到的关联规则在分类上属于单维、单层、布尔关联规则。

5、最大期望(EM)算法

最大期望(EM，Expectation–Maximization)算法是在概率模型中寻找参数最大似然估计的算法，其中概率模型依赖于无法观测的隐藏变量。最大期望经常用在机器学习和计算机视觉的数据集聚领域。

6、Page Rank算法

Page Rank根据网站的外部链接和内部链接的数量和质量，衡量网站的价值。

7、Ada Boost 迭代算法

Ada boost是一种迭代算法，其核心思想是针对同一个训练集训练不同的分类器(弱分类器)，然后把这些弱分类器集合起来，构成一个更强的最终分类器(强分类器)。

8、kNN 最近邻分类算法

K最近邻(k-Nearest Neighbor，KNN)分类算法，是一个理论上比较成熟的方法，也是最简单的机器学习算法之一。该方法的思路是：如果一个样本在特征空间中的k个最相似(即特征空间中最邻近)的样本中的大多数属于某一个类别，则该样本也属于这个类别。

9、Naive Bayes 朴素贝叶斯算法

Naive Bayes 算法通过某对象的先验概率，利用贝叶斯公式计算出其后验概率，并选择具有最大后验概率的类作为该对象所属的类。朴素贝叶斯模型所需估计的参数很少，对缺失数据不太敏感，其算法也比较简单。

10、CART: 分类与回归树算法。

分类与回归树算法(CART，Classification and Regression Trees)是分类数据挖掘算法的一种，有两个关键的思想：第一个是关于递归地划分自变量空间的想法;第二个想法是用验证数据进行剪枝。

北陈

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
数据挖掘及算法

数据挖掘的一般过程包括以下几个方面：数据预处理数据挖掘后处理首先来说说数据预处理。之所以有这样一个步骤，是因为通常的数据挖掘需要涉及相对较大的数据量，这些数据可能来源不一导致格式不同，可能有的数据还存在一些缺失值或者无效值，如果不经处理直接将这些‘脏’数据放到模型中去跑，非常容易导致模型计算的失败或者可用性很差，所以数据预处理是数据挖掘过程中都不可或缺的一步。至于数据挖掘和后处理相对来说就容易理解多了。完成了数据的预处理，我们通常进行特征构造，然后放到特定的模型中去计算，利用某种标准去评判不
复制链接

扫一扫