机器学习概念

一、机器学习分类

近些年来,得益于互联网的普及,我们可以非常轻松地获取大量文本、音乐、图片、视频等各种各样的数据。机器学习,就是让计算机具有像人一样的学习能力的技术,是从堆积如山的数据(也称为大数据)中寻找出有用知识的数据挖掘技术。通过运用机器学习技术,从视频数据库中寻找出自己喜欢的视频资料,或者根据用户的购买记录向用户推荐其他相关产品等成为了现实。

计算机的学习,根据所处理的数据种类的不同,可以分为监督学习、无监督学习和强化学习等几种类型。

监督学习,是指有求知欲的学生从老师那里获取知识、信息,老师提供对错指示、告知最终答案的学习过程。在机器学习里,学生对应于计算机,老师则对应于周围的环境。根据在学习过程中所获得的经验、技能,对没有学习过的问题也可以做出正确解答,使计算机获得这种泛化能力,是监督学习的最终目标。监督学习,在手写文字识别、声音处理、图像处理、垃圾邮件分类与拦截、网页检索、基因诊断以及股票预测等各个方面,都有着广泛的应用。这一类机器学习的典型任务包括:预测数值型数据的回归、预测分类标签的分类、预测顺序的排序等。

无监督学习,是指在没有老师的情况下,学生自学的过程。在机器学习里,基本上都是计算机在互联网中自动收集信息,并从中获取有用信息。无监督学习不仅仅局限于解决像监督学习那样的有明确答案的问题,因此,它的学习目标可以不必十分明确。无监督学习在人造卫星故障诊断、视频分析、社交网站解析和声音信号解析等方面大显身手的同时,在数据可视化以及作为监督学习方法的前处理工具方面,也有广泛的应用。这一类机器学习的典型任务有聚类、异常检测等。

强化学习,与监督学习类似,也以使计算机获得对没有学习过的问题做出正确解答的泛化能力为目标,但是在学习过程中,不设置老师提示对错、告知最终答案的环节。然而,如果真的在学习过程中不能从周围环境中获得任何信息的话,强化学习就变成无监督学习了。强化学习,是指在没有老师提示的情况下,自己对预测的结果进行评估的方法。通过这样的自我评估,学生为了获得老师的最高嘉奖而不断地进行学习。婴幼儿往往会为了获得父母的表扬去做事情,因此,强化学习被认为是人类主要的学习模式之一。强化学习,在机器人的自动控制、计算机游戏中的人工智能、市场战略的最优化等方面均有广泛应用。在强化学习中经常会用到回归、分类、聚类和降维等各种各样的机器学习算法。

二、机器学习任务

2.1 回归

图1 回归

回归是指把实函数在样本点附近加以近似的有监督的函数近似问题,如图1所示。这里,我们来考虑一下以d次方的实数向量c作为输入实数值y作为输出的函数y=f(x)的学习问题。在监督学习里,这里的真实函数关系f是未知的,作为训练集的输入输出样本 { ( x i , y i ) } i = 1 n \left\{ \left( {{x}_{i}},{{y}_{i}} \right) \right\}_{i=1}^{n} {(xi,yi)}i=1n是已知的。但是,一般情况下,在输出样本 y i {{y}_{i}} yi的真实值 f ( x i ) f\left( {{x}_{i}} \right) f(xi)中经常会观测到噪声。通过这样的设定,输入样本 x i {{x}_{i}} xi就是学生向老师请教的问题,输出样本 y i {{y}_{i}} yi是老师对学生的解答,输出样本中包含的噪声则与老师的教学错误或学生的理解错误相对应。老师的知识(无论什么样的问题,都可以做出正确的解答)与真实的函数f相对应,使学生获得这个函数就是监督学习的最终目标。如果以 f ^ \hat{f} f^来表示学生通过学习而获得的函数,那么学生对没有学习过的问题也可以做出正确解答的泛化能力的大小,就可以通过比较函数f和 f ^ \hat{f} f^相似性来进行分析。

2.2 分类

在这里插入图片描述

图2 分类

分类,是指对于指定的模式进行识别的有监督的模型识别问题,如图2所示。在这里,以d次方的实数向量x作为输入样本,而所有的输入样本,可以被划分为c个类别的问题来进行说明。作为训练集的输入输出样本 { ( x i , y i ) } i = 1 n \left\{ \left( {{x}_{i}},{{y}_{i}} \right) \right\}_{i=1}^{n} {(xi,yi)}i=1n是已知的。但是,分类问题中的输出样本,并不是具体的实数,而是分别代表类别1,2,…,c。在这样的任务里,得到输出类别1,2,……,c的函数y=f(x)的过程,就是机器学习的过程。因此,分类问题也可以像回归问题那样,被看作是函数近似问题。然而,在分类问题中,并不存在类别1比类别3更接近于类别2这样的说法。分类问题只是单纯地对样本应该属于哪一个类别进行预测,并根据预测准确与否来衡量泛化误差,这一点与回归是不同的。

2.3 异常检测

在这里插入图片描述

图3 异常检测

异常检测,是指寻找输入样本 { ( x i ) } i = 1 n \left\{ \left( {{x}_{i}} \right) \right\}_{i=1}^{n} {(xi)}i=1n中所包含的异常数据的问题。在已知正常数据与异常数据的例子的情况下,其与有监督的分类问题是相同的。但是,一般情况下,在异常检测任务中,对于什么样的数据是异常的,什么样的数据是正常的,在事先是未知的。在这样的无监督的异常检测问题中,一般采用密度估计的方法,把靠近密度中心的数据作为正常的数据,把偏离密度中心的数据作为异常的数据,如图3所示。

2.4 聚类分析

在这里插入图片描述

图4 聚类分析

聚类,与分类问题相同,也是模式识别问题,但是属于无监督学习的一种。即只给出输入样本 { ( x i ) } i = 1 n \left\{ \left( {{x}_{i}} \right) \right\}_{i=1}^{n} {(xi)}i=1n,然后判断各个样本分别属于1,2,…,c中的哪个簇。隶属于相同簇的样本之间具有相似的性质,不同簇的样本之间具有不同的性质。在聚类问题中,如何准确地计算样本之间的相似度是很重要的课题。

2.5 降维

降维,是指从高维度数据中提取关键信息,将其转换为易于计算的低维度问题进而求解的方法,如图5所示。具体来说,当输入样本 { ( x i ) } i = 1 n \left\{ \left( {{x}_{i}} \right) \right\}_{i=1}^{n} {(xi)}i=1n的维数d非常大的时候,可以把样本转换为较低维度的样本 { z i } i = 1 n \left\{ {{z}_{i}} \right\}_{i=1}^{n} {zi}i=1n。线性降维的情况下,可以使用横向量T将其变换为 z i = T x i {{z}_{i}}=T{{x}_{i}} zi=Txi。降维,根据数据种类的不同,可以分为监督学习和无监督学习两种。作为训练集的输入输出样本 { ( x i , y i ) } i = 1 n \left\{ \left( {{x}_{i}},{{y}_{i}} \right) \right\}_{i=1}^{n} {(xi,yi)}i=1n是已知的时候,属于监督学习,可以把样本转换为较低维度的样本 { z i } i = 1 n \left\{ {{z}_{i}} \right\}_{i=1}^{n} {zi}i=1n,从而获得较高的泛化能力。与之相对,如果只有输入样本 { x i } i = 1 n \left\{ {{x}_{i}} \right\}_{i=1}^{n} {xi}i=1n是已知的话,就属于无监督学习,在转换为较低维度的样本 { z i } i = 1 n \left\{ {{z}_{i}} \right\}_{i=1}^{n} {zi}i=1n之后,应该保持原始输入样本 { x i } i = 1 n \left\{ {{x}_{i}} \right\}_{i=1}^{n} {xi}i=1n的数据分布性质,以及数据间的近邻关系不发生变化。

在这里插入图片描述

图5 降维

博主简介:擅长智能优化算法信号处理图像处理机器视觉深度学习神经网络等领域Matlab仿真以及实验数据分析等,matlab代码问题、商业合作、课题选题与指导等均可私信交流


  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 打赏
    打赏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

matlab科研中心

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值