机器学习（额外篇）：监督学习和无监督学习的区别以及半监督学习

最新推荐文章于 2023-09-04 16:38:19 发布

Auraros

最新推荐文章于 2023-09-04 16:38:19 发布

阅读量2.4k

点赞数 2

分类专栏： # 机器学习文章标签：监督学习和无监督学习的区别监督学习和无监督学习半监督学习机器学习监督学习和无监督学习

本文链接：https://blog.csdn.net/qq_43634001/article/details/96481610

版权

机器学习专栏收录该内容

26 篇文章 27 订阅

订阅专栏

机器学习（额外篇）：监督学习和无监督学习的区别

前言

学了大部分机器学习算法，今天看到一个名词“监督”。突然发现自己好像不太了解监督学习和无监督学习的区别，于是查阅了部分资料，并且做了一定的总结。

根据训练数据是否拥有标记信息，学习任务可大致划分为两大类：“监督学习”（supervised learning)和“无监督学习”（unsupervised learning）。分类和回归是前者的代表，而聚类则是后者的代表。

学习是什么？

简单来说，学习是在外部刺激下记住大部分以往的经验，从而能够实现改变的能力。因此，机器学习是一种工程方法，对于增加或提高自适应变化的各项技术都十分重要。例如，机械手表是一种非凡的工件，但其结构符合静止定律，当外部变化发生变化时会变得没有任何用处。

学习能力是动物特别是人特有的，根据达尔文的理论，它也是所有物种生存和进化的关键要素。机器虽然不能自主进化，但似乎也遵循同样的规律。

对于机器学习而言，我更加倾向于把它理解为一种数据分析的机器。对于机器学习，我们必须拥有一定规律的实际数据，在加上使用一些模型进行套用分析，从而得到一定的预测值。这里的预测并不是猜测，两者有着一个极大的不同点——有无依据。

监督学习（supervised learning）

从给定的训练数据集中学习出一个函数（模型参数），当新的数据到来时，可以根据这个函数预测结果。监督学习的训练集要求包括输入输出，也可以说是特征和目标。训练集中的目标是由人标注的。监督学习就是最常见的分类（注意和聚类区分）问题，通过已有的训练样本（即已知数据及其对应的输出）去训练得到一个最优模型（这个模型属于某个函数的集合，最优表示某个评价准则下是最佳的），再利用这个模型将所有的输入映射为相应的输出，对输出进行简单的判断从而实现分类的目的。也就具有了对未知数据分类的能力。监督学习的目标往往是让计算机去学习我们已经创建好的分类系统（模型）。

监督学习是训练神经网络和决策树的常见技术。这两种技术高度依赖事先确定的分类系统给出的信息，对于神经网络，分类系统利用信息判断网络的错误，然后不断调整网络参数。对于决策树，分类系统用它来判断哪些属性提供了最多的信息。

常见的监督学习算法：回归分析和统计分类。最典型的算法是KNN和SVM。

无监督学习（unsupervised learning）

输入数据没有被标记，也没有确定的结果。样本数据类别未知，需要根据样本间的相似性对样本集进行分类（聚类，clustering）试图使类内差距最小化，类间差距最大化。通俗点将就是实际应用中，不少情况下无法预先知道样本的标签，也就是说没有训练样本对应的类别，因而只能从原先没有样本标签的样本集开始学习分类器设计。

非监督学习目标不是告诉计算机怎么做，而是让它（计算机）自己去学习怎样做事情。非监督学习有两种思路。第一种思路是在指导Agent时不为其指定明确分类，而是在成功时，采用某种形式的激励制度。需要注意的是，这类训练通常会置于决策问题的框架里，因为它的目标不是为了产生一个分类系统，而是做出最大回报的决定，这种思路很好的概括了现实世界，agent可以对正确的行为做出激励，而对错误行为做出惩罚。

无监督学习的方法分为两大类：

一类为基于概率密度函数估计的直接方法：指设法找到各类别在特征空间的分布参数，再进行分类。
另一类是称为基于样本间相似性度量的简洁聚类方法：其原理是设法定出不同类别的核心或初始内核，然后依据样本与核心之间的相似性度量将样本聚集成不同的类别。
利用聚类结果，可以提取数据集中隐藏信息，对未来数据进行分类和预测。应用于数据挖掘，模式识别，图像处理等。

两者的不同

有监督学习方法必须要有训练集与测试样本。在训练集中找规律，而对测试样本使用这种规律。而非监督学习没有训练集，只有一组数据，在该组数据集内寻找规律。
有监督学习的方法就是识别事物，识别的结果表现在给待识别数据加上了标签。因此训练样本集必须由带标签的样本组成。而非监督学习方法只有要分析的数据集的本身，预先没有什么标签。如果发现数据集呈现某种聚集性，则可按自然的聚集性分类，但不予以某种预先分类标签对上号为目的。
非监督学习方法在寻找数据集中的规律性，这种规律性并不一定要达到划分数据集的目的，也就是说不一定要“分类”。

什么时候使用哪种方法？简单的方法就是从定义入手，有训练样本则考虑采用监督学习方法；无训练样本，则一定不能用监督学习方法。但是，现实问题中，即使没有训练样本，我们也能够凭借自己的双眼，从待分类的数据中，人工标注一些样本，并把它们作为训练样本，这样的话，可以把条件改善，用监督学习方法来做。对于不同的场景，正负样本的分布如果会存在偏移（可能大的偏移，可能比较小），这样的话，监督学习的效果可能就不如用非监督学习了。

半监督学习

所给的数据有的是有标签的，而有的是没有标签的。常见的两种半监督的学习方式是直推学习（Transductive learning）和归纳学习（Inductive learning）。
直推学习（Transductive learning）：没有标记的数据是测试数据，这个时候可以用test的数据进行训练。这里需要注意，这里只是用了test数据中的feature而没有用label，所以并不是一种欺骗的方法。
归纳学习（Inductive learning）：没有标签的数据不是测试集。