[Machine Learning] 监督学习综述

最新推荐文章于 2021-08-10 18:33:34 发布

ingy

最新推荐文章于 2021-08-10 18:33:34 发布

阅读量522

点赞数

分类专栏：机器学习

本文链接：https://blog.csdn.net/simonyucsdy/article/details/100156909

版权

机器学习专栏收录该内容

9 篇文章 0 订阅

订阅专栏

假如说你想预测房价，研究所收集了一些房价的数据。你把这些数据画出来，看起来是这个样子：横轴表示房子的面积，单位是平方英尺，纵轴表示房价，单位是千美元。那基于这组数据，假如你有一套 750 平方英尺房子，现在你希望把房子卖掉，你想知道这房子能卖多少钱。
那么关于这个问题，机器学习算法将会怎么帮助你呢？

我们应用学习算法，可以在这组数据中画一条直线，或者换句话说，拟合一条直线，根据这条线我们可以推测出，这套房子可能卖$150,000，当然这不是唯一的算法。可能还有更好的，比如我们不用直线拟合这些数据，用二次方程去拟合可能效果会更好。根据二次方程的曲线，我们可以从这个点推测出，这套房子能卖接近$200,000。稍后我们将讨论如何选择学习算法，如何决定用直线还是二次方程来拟合。两个方案中有一个能让你的房子出售得更合理。这些都是学习算法里面很好的例子。以上就是监督学习的例子。
可以看出，监督学习指的就是我们给学习算法一个数据集。这个数据集由“正确答案”组成。在房价的例子中，我们给了一系列房子的数据，我们给定数据集中每个样本的正确价格，即它们实际的售价然后运用学习算法，算出更多的正确答案。比如你的房子的价格。
用术语来讲，这叫做回归问题。我们试着推测出一个连续值的结果，即房子的价格。
回归这个词的意思是，我们在试着推测出这一系列连续值属性。一般房子的价格被看成一个连续的数值。

我再举另外一个监督学习的例子。假设说你想通过查看病历来推测乳腺癌良性与否，假如有人检测出乳腺肿瘤，恶性肿瘤有害并且十分危险，而良性的肿瘤危害就没那么大，所以人们显然会很在意这个问题。

这个数据集中，横轴表示肿瘤的大小，纵轴上， 1 和 0 表示是或者不是恶性肿瘤。我们之前见过的肿瘤，如果是恶性则记为 1，良性记为 0。
我有 5 个良性肿瘤样本，在 1 的位置有 5 个恶性肿瘤样本。现在我们有一个朋友很不幸检查出乳腺肿瘤。假设她的肿瘤大小为x，那么机器学习的问题就在于，你能否估算出肿瘤是恶性的或是良性的概率。用术语来讲，这是一个分类问题。
分类指的是，我们试着推测出离散的输出值： 0 或 1 ，而事实上在分类问题中，输出可能不止两个值。比如说可能有三种乳腺癌，所以你希望预测离散输出 0、1、2、3。0代表良性，1表示第1类乳腺癌，2表示第2类癌症，3表示第3类，但这也是分类问
题。因为这几个离散的输出分别对应良性，第一类第二类或者第三类癌症，在分类问题中我们可以用另一种方式绘制这些数据点。

现在我用不同的符号来表示这些数据。既然我们把肿瘤的尺寸看做区分恶性或良性的特征，那么我可以这么画，我用不同的符号来表示良性和恶性肿瘤。或者说是负样本和正样本，现在我们把良性的肿瘤改成用O表示，恶性的继续用X表示。来预测肿瘤的恶性与否。
在其它一些机器学习问题中，可能会遇到不止一种特征。举个例子，我们不仅知道肿瘤的尺寸，还知道对应患者的年龄。在其他机器学习问题中，我们通常有更多的特征，比如肿块密度，肿瘤细胞尺寸的一致性和形状的一致性等等，还有一些其他的特征。这就是我们即将学到最有趣的学习算法之一。
那种算法不仅能处理 2 种 3 种或 5 种特征，即使有无限多种特征都可以处理。

上图中列举了总共 5 种不同的特征，坐标轴上的两种和右边的 3 种，但是在一些学习问题中，你希望不只用 3 种或 5 种特征。相反，你想用无限多种特征，好让你的算法可以利用大量的特征，或者说线索来做推测。那你怎么处理无限多个特征，甚至怎么存储这些特征都存在问题，你电脑的内存肯定不够用。 支持向量机有一个巧妙的数学技巧，能让计算机处理无限多个特征。

监督学习，其基本思想是，我们数据集中的每个样本都有相应的“正确答案”。再根据这些样本作出预测，就像房子和肿瘤的例子中做的那样。我们还介绍了回归问题，即通过回归来推出一个连续的输出，之后我们介绍了分类问题，其目标是推出一组离散的结果。

现在来个小测验：假设你经营着一家公司，你想开发学习算法来处理这两个问题：
1. 你有一大批同样的货物，想象一下，你有上千件一模一样的货物等待出售，这时你想预测接下来的三个月能卖多少件？
2. 你有许多客户，这时你想写一个软件来检验每一个用户的账户。对于每一个账户，你要判断它们是否曾经被盗过？
那这两个问题，它们属于分类问题、还是回归问题?
问题一是一个回归问题，因为你知道，如果我有数千件货物，我会把它看成一个实数，一个连续的值。因此卖出的物品数，也是一个连续的值。
问题二是一个分类问题，因为我会把预测的值，用0来表示账户未被盗，用1表示账户曾经被盗过。所以我们根据账号是否被盗过，把它们定为0或1，然后用算法推测一个账号是0还是1，因为只有少数的离散值，所以我把它归为分类问题。
以上就是监督学习的内容。

ingy

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
[Machine Learning] 监督学习综述

假如说你想预测房价，研究所收集了一些房价的数据。你把这些数据画出来，看起来是这个样子：横轴表示房子的面积，单位是平方英尺，纵轴表示房价，单位是千美元。那基于这组数据，假如你有一套 750 平方英尺房子，现在你希望把房子卖掉，你想知道这房子能卖多少钱。那么关于这个问题，机器学习算法将会怎么帮助你呢？我们应用学习算法...
复制链接

扫一扫