机器学习,就是让计算机具有像人一样的学习能力的技术,是从堆积如山的数据(也称为大数据)中寻找出有用知识的数据挖掘技术。通过运用机器学习技术,从视频数据库中寻找出自己喜欢的视频资料,或者根据用户的购买记录向用户推荐其他相关产品等成了现实。
一、机器学习的种类
计算机的学习,根据所需处理的数据种类不同,可以分为监督学习、无监督学习和强化学习等几种类型。
1、监督学习
监督学习,是指有求知欲的学生从老师那里获取知识、信息,老师提供对错提示、告知最终答案的学习过程。在机器学习里,学生对应于计算机,老师对应于周围的环境。根据在学习过程中所获得的经验、技能,对没有学习过的问题也可以做出正确解答,使计算机获得这种泛化能力,是监督学习的最终目标。监督学习,在手写文字识别、声音处理、图像处理、垃圾邮件分类与拦截、网页检索、基因诊断以及股票预测等各个方面,都有着广泛的应用。这一类机器学习的典型任务包括:预测数值类型数据的回归、预测分类标签的分类、预测顺序的排序等。
2、无监督学习
无监督学习,是指在没有老师的情况下,学生自学的过程。在机器学习里,基本上都是计算机在互联网中自动收集数据,并从中获取有用信息。无监督学习不仅仅局限于解决像监督学习那样的有明确答案的问题,因此,它的学习目标可以不必十分明确。无监督学习在人造卫星故障诊断、视频分析、社交网站解析和声音信号解析等方面大显身手的同时,在数据可视化以及作为监督学习方法的前处理工具方面,也有广泛应用。这一类机器学习的典型任务有聚类、异常检测等。
3、强化学习
强化学习,与监督学习类似,也以计算机获得对没有学习过的问题做出正确解答的泛化能力为目标,但是在学习过程中,不设置老师提示对错、告知最终答案的环节。然而,如果真的在学习过程中不能从周围环境中获得任何信息的话,强化学习就变成无监督学习了。强化学习,是指在没有老师提示的情况下,自己对预测的结果进行评估的方法。通过这样的自我评估,学生为了获得老师的最高嘉奖而不断地进行学习。婴幼儿往往会为了获得父母的表扬去做事情,因此,强化学习被认为是人类最主要的学习模式之一。强化学习,在机器人的自动控制、计算机游戏中的人工智能、市场战略的最优化等方面均有广泛应用。在强化学习中经常会用到回归、分类、聚类和降维等各种各样的机器学习算法。
二、机器学习的典型任务
1、回归
回归,是指把实函数在样本点附近加以近似的有监督的函数近似问题。这里,我们来考虑下以维实向量
作为输入,实数值
作为输出的函数
的学习问题。在监督学习里,这里的真实函数关系
是未知的,作为训练集的输入输出样本
是已知的。但是,一般情况下,在输出样本
的真实值
中经常会观测到噪声。通过这样的设定,输入样本
就是学生向老师请教的问题,输出样本
是老师对学生的解答,输出样本中包含的噪声则与老师的教学错误或学生的理解错误相对应。老师的知识(无论什么样的问题,都可以做出正确的解答)与真实的函数
相对应,使学生获得这个函数就是监督学习的最终目标。如果以
来表示学生通过学习而获得的函数,那么学生对没有学习过的问题也可以做出正确的解答的泛化能力的大小,就可以通过比较函数
和
的相似性来进行分析。
注:回归是对一个或多个自变量和因变量之间的关系进行建模、求解的一种统计方法。
2、分类
分类,是指对于指定的模式进行识别的有监督的模式识别问题。在这里,以维实向量
作为输入样本,而所有的输入样本,可以被划分为
个类别的问题来进行说明。作为训练集的输入输出样本
是已知的。但是,分类问题中的输出样本
,并不是具体的实数,而是分别代表类别1,2,···,
。在这样的任务里,得到输出类别1,2,···,
的函数
的过程,就是机器学习的过程。因此,分类问题也可以像回归问题那样,被看作是函数近似问题。然而,在分类问题中,并不存在类别1比类别3更接近于类别2这样的说法。分类问题只是单纯地对样本应该属于哪一个类别进行预测,并根据预测准确与否来衡量泛化误差,这一点与回归是不同的。
3、异常检测
异常检测,是指寻找输入样本中所包含的异常数据的问题。在已知正常数据与异常数据的例子的情况下,其与有监督的分类问题是相同的。但是,一般情况下,在异常检测任务中,对于什么样的数据是异常的,什么样的数据是正常的,在事先是未知的。在这样的无监督的异常检测问题中,一般采用密度估计的方法,把靠近密度中心的数据作为正常数据,把偏离密度中心的数据作为异常的数据。
4、聚类
聚类,与分类问题相同,也是模式识别问题,但是属于无监督学习的一种。即只给出输入样本,然后判断各个样本分别属于1,2,···,
中的哪个簇(代表类别)。隶属于相同簇的样本之间具有相似性,不同的样本之间具有不同的性质。在聚类问题中,如何准确地计算样本之间的相似度是很重要的课题。
5、降维
降维,是指从高纬度数据中提取关键信息,将其转换为易于计算的低纬度问题进而求解的方法。具体来说,当输入样本的维数
非常大的时候,可以把样本转换为较低维度的样本
。线性降维的情况下,可以使用横向量T 将其变换为
。降维,根据数据种类的不同,可以分为监督学习和无监督学习两种。作为训练集的输入输出样本
是已知的时候,属于监督学习,可以把样本转换为较低维度的样本
,从而获得较高的泛化能力。与之相对,如果只有输入样本
是已知的话,就属于无监督学习,在转换为较低维度的样本
之后,应该保持原始输入样本
的数据分布性质,以及数据间的近邻关系不发生变化。