统计学习方法学习笔记

最新推荐文章于 2023-03-09 22:01:42 发布

lorillp

最新推荐文章于 2023-03-09 22:01:42 发布

阅读量185

点赞数

分类专栏：机器学习文章标签：统计学习方法

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/lorillp/article/details/79180901

版权

机器学习专栏收录该内容

2 篇文章 0 订阅

订阅专栏

机器学习之学习

学习通常来讲就是利用一些训练数据，使机器能够利用它们分析未知数据。
最简单也最普遍的一类机器学习算法就是分类（classification）。对于分类，输入的训练数据有特征（feature），有标签（label）。所谓的学习，其本质就是找到特征和标签间的关系（mapping）。这样当有特征而无标签的未知数据输入时，我们就可以通过已有的关系得到未知数据标签。

在上述的分类过程中，如果所有训练数据都有标签，则为有监督学习（supervised learning）。如果数据没有标签，显然就是无监督学习（unsupervised learning）了，也即聚类（clustering）。
有监督学习和无监督学习中间带就是半监督学习（semi-supervised learning）。对于半监督学习，其训练数据的一部分是有标签的，另一部分没有标签，而没标签数据的数量常常极大于有标签数据数量（这也是符合现实情况的）。隐藏在半监督学习下的基本规律在于：数据的分布必然不是完全随机的，通过一些有标签数据的局部特征，以及更多没标签数据的整体分布，就可以得到可以接受甚至是非常好的分类结果。

特征（feature）
标签（label）
有监督学习（supervised learning）
无监督学习（unsupervised learning）
半监督学习（semi-supervised learning）
聚类（clustering）
分类（classification）
回归（regression）

特征

能表征对象的一些特征，比如西瓜黑籽、绿皮、红囊等。

标签

数据的标签，标注某个对象属于哪个类别，比如书这一大类包括“计算机”“图形学”“英文书”“教材”等。

学习

利用一些训练数据，使机器能够利用它们分析未知数据，找到特征与标签的映射（mapping）关系。
这样当有特征而无标签的未知数据输入时，我们就可以通过已有的关系得到未知数据标签。

把很多书交给一个学生，培养他给书本分类的能力。

有监督学习

不仅把训练数据丢给计算机，而且还把分类的结果（数据具有的标签）也一并丢给计算机分析。
由于计算机在学习的过程中不仅有训练数据，而且有训练结果（标签），因此训练的效果通常不错。训练结束之后进行测试

不仅把书给学生进行训练给书本分类的能力，而且把分类的结果（哪本书属于哪些类别）也给了学生做标准参考。

无监督学习

只给计算机训练数据，不给结果（标签），因此计算机无法准确地知道哪些数据具有哪些标签，只能凭借强大的计算能力分析数据的特征，从而得到一定的成果，通常是得到一些集合，集合内的数据在某些特征上相同或相似。

只给学生进行未分类的书本进行训练，不给标准参考，学生只能自己分析哪些书比较像，根据相同与相似点列出清单，说明哪些书比较可能是同一类别的。

半监督学习

给计算机大量训练数据与少量的分类结果（具有同一标签的集合）。

给学生很多未分类的书本与少量的清单，清单上说明哪些书属于同一类别。

聚类

无监督学习的结果。聚类的结果将产生一组集合，集合中的对象与同集合中的对象彼此相似，与其他集合中的对象相异。

没有标准参考的学生给书本分的类别，表示自己认为这些书可能是同一类别的（具体什么类别不知道）。

分类

有监督学习的两大应用之一，产生离散的结果。

例如向模型输入人的各种数据的训练样本，产生“输入一个人的数据，判断是否患有癌症”的结果，结果必定是离散的，只有“是”或“否”。

回归

有监督学习的两大应用之一，产生连续的结果。

例如向模型输入人的各种数据的训练样本，产生“输入一个人的数据，判断此人20年后今后的经济能力”的结果，结果是连续的，往往得到一条回归曲线。当输入自变量不同时，输出的因变量非离散分布。

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
统计学习方法学习笔记

机器学习之学习学习通常来讲就是利用一些训练数据，使机器能够利用它们分析未知数据。最简单也最普遍的一类机器学习算法就是分类（classification）。对于分类，输入的训练数据有特征（feature），有标签（label）。所谓的学习，其本质就是找到特征和标签间的关系（mapping）。这样当有特征而无标签的未知数据输入时，我们就可以通过已有的关系得到未知数据标签。在上述的分类过程中...
复制链接

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。