机器学习笔记1

谁是我！

于 2018-09-19 19:44:32 发布

阅读量170

点赞数

本文链接：https://blog.csdn.net/qq_42700429/article/details/82774211

版权

1.监督学习(supervised learning)：利用一组已知类别的样本调整分类器的参数，使其达到所要求性能的过程。
在监督学习的过程中，我们只需要给定输入样本集，机器就可以从中推演出指定目标变量的可能结果。
监督学习一般使用两种类型的目标变量：标称型和数值型。分类和回归属于监督学习。

2.机器学习的comments

机器学习就是把无序的数据转换成有用的信息。
为了测试机器学习算法的效果，通常使用两套独立的样本集：训练数据和测试数据。
机器学习的算法
选择实际可用的算法，必须考虑下面两个问题：
一、使用机器学习算法的目的，想要算法完成何种任务？
二、需要分析和收集的数据是什么？

3… k-近邻算法(kNN)
存在一个样本数据集合（训练样本集），并且样本集中每个数据都存在标签，即我们知道样本集中每一数据与所属分类的对应关系。输入没有标签的新数据后，将新数据的每个特征与样本集中数据对应的特征进行比较，然后算法提取样本集中特征最相似数据（最近邻）的分类标签。一般来说，我们只选择样本数据集中前k个最相似的数据，通常k是不大于20的整数。最后，选择k个最相似数据中出现次数最多的分类，作为新数据的分类。
在这里插入图片描述
k-近邻算法是分类数据最简单最有效的算法，k-近邻算法是基于实例的学习，使用算法时我们必须有接近实际数据的训练样本数据。k-近邻算法必须保存全部数据集，如果训练数据集的很大，必须使用大量的存储空间。此外，由于必须对数据集中的每个数据计算距离值，实际使用时可能非常耗时。 k-近邻算法的另一个缺陷是它无法给出任何数据的基础结构信息，因此我们也无法知晓平均实例样本和典型实例样本具有什么特征。

4…决策树
决策树的主要优势在于数据形式非常容易理解。
在这里插入图片描述
在构造决策树时，我们需要解决的第一个问题就是，当前数据集上哪个特征在划分数据分类时起决定性作用。为了找到决定性的特征，划分出最好的结果，我们必须评估每个特征。完成测试之后，原始数据集就被划分为几个数据子集。这些数据子集会分布在第一个决策点的所有分支上。如果某个分支下的数据属于同一类型，无需进一步对数据集进行分割。如果数据子集内的数据不属于同一类型，则需要重复划分数据子集的过程。
在这里插入图片描述

谁是我！

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
机器学习笔记1

1.监督学习(supervised learning)：利用一组已知类别的样本调整分类器的参数，使其达到所要求性能的过程。在监督学习的过程中，我们只需要给定输入样本集，机器就可以从中推演出指定目标变量的可能结果。监督学习一般使用两种类型的目标变量：标称型和数值型。...
复制链接

扫一扫