1.3监督学习

假如说你想预测房价,把房价的数据表示出来:横轴表示房子的面积,纵轴表示房价,基于这组数据预测750平方英尺房子的房价。
在这里插入图片描述
应用学习算法,可以在这组数据中画一条直线,或者换句话说,拟合一条直线,根据这条线我们可以推测出,这套房子可能$150,000,当然这不是唯一的算法,可能还有更好的,比如我们不用直线拟合这些数据,用二次方程去拟合可能效果会更好。根据二次方程的曲线,我们可以从这个点推测出,这套房子能卖接近$200,000。
可以看出,监督学习指的就是我们给学习算法一个数据集。这个数据集由“正确答案”组成。在房价的例子中,我们给了一系列房子的数据,我们给定数据集中每个样本的正确价格,即它们实际的售价然后运用学习算法,算出更多的正确答案。用术语来讲,这叫回归问题。我们试着推测出一个连续值的结果,即房子的价格。一般房子的价格会记到美分,所以房价实际上是一系列离散的值,但是我们通常又把房价看成实数,看成是标量,所以又把它看成一个连续的数值。
回归这个词的意思是,我们在试着推测出这一系列连续值属性。
假如你想推测乳腺癌的良性与否,有一组数据:横轴表示肿瘤的大小,纵轴上的1和0表示是或者不是恶性肿瘤。假如知道肿瘤的大致大小,那么机器学习的问题在于,你能否估算出肿瘤是恶性的或者是良性的概率。用术语来讲,这是一个分类问题。
在这里插入图片描述
分类指的是,我们试着推测出离散的输出值:0或1良性或者恶性,而事实上在分类问题中,输出可能不止两个值。比如说可能有三种乳腺癌,所以你希望预测离散输出0、1、2、3。0代表良性,1代表第一类乳腺癌,2代表第二类,3代表第三类,这也是分类问题。
因为这几个离散的输出分别对应良性、第一类、第二类或者第三类癌症,在分类问题中我们可以用另一种方式绘制这些数据点。
现在我们用不同的符号来表示这些数据。既然我们把肿瘤的尺寸看作区分恶性或良性的特征,那么我们可以用不同的符号来表示良性和恶性肿瘤,或者说是负样本和正样本。良性肿瘤改成O表示,恶性肿瘤用X表示,来预测肿瘤的恶性与否。
在其它一些机器学习问题中,可能会遇到不止一种特征。举个例子,我们不仅知道肿瘤的尺寸,还知道对应患者的年龄。在其它机器学习问题中,我们通常有更多的特征,比如肿块密度,肿瘤细胞尺寸的一致性和形状的一致性等。
在这里插入图片描述
上图中,列举了总共5种不同的特征,坐标轴上的两种和右边的3种,但是在一些学习问题中,你希望不只用3种或5种特征。相反,你想用无限多种特征,好让你的算法可以利用大量的线索来推测。那该怎么处理无限多个特征,甚至怎么存储这些特征都存在问题。支持向量机算法里有一个巧妙的数学技巧,能让计算机处理无限多个特征。

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值