机器学习
test103
这个作者很懒,什么都没留下…
展开
-
机器学习实战学习笔记(二):决策树
决策树优缺点优点:计算复杂度不高,输出结果易于理解,对中间值的确实不敏感,可以处理不相关特征数据。缺点:可能会产生过度匹配问题。适用数据类型:数值型和标称型。原理树结构信息增益在划分数据集之前之后信息发生的变化称为信息增益。香农商集合信息的度量方式称为香农熵或者简称为熵,这个名字来源于信息论之父克劳德.香农。例子略实际中的应用——预测隐形眼镜类型隐形眼镜数据集是非常著名的数据集。构造树结构。原创 2017-03-22 13:30:38 · 285 阅读 · 0 评论 -
机器学习实战学习笔记(三):朴素贝叶斯
贝叶斯原理之所以称之为“朴素”,是因为整个形式化过程只做最原始、最简单的假设。优缺点 - 优点:在数据较少的情况下仍然有效,可以处理多类别问题。 - 确定:对于输入数据的准备方式比较敏感。 - 适用数据类型:标称型数据。入门示例 二维坐标中,如果p1(x,y) > p2(x,y),那么(x,y)属于类别1,否则属于类别2.共有7块石头,3块灰色的,4块黑色的 p(gray) = 3/7原创 2017-04-04 15:18:45 · 502 阅读 · 0 评论 -
机器学习实战学习笔记(四):Logistic回归
逻辑回归 逻辑回归分类的主要思想是:根据现有数据对分类边界线建立回归公式,以此进行分类。优缺点优点:计算代价不高,易于理解和实现。确定:容易欠拟合,分类精度可能不高。适用数据类型:数值型和标称型数据。核心概念sigma函数最大释然估计应用——从疝气病预测病马的死亡率这章不详细描述,请参考书中描述及这篇博客,写的很好(http://sbp810050504.blog.51cto.c原创 2017-04-04 20:03:50 · 400 阅读 · 0 评论 -
机器学习实战学习笔记(一):K-近邻算法
K-近邻算法优缺点 K-近邻算法采用测量不同特征值之间的距离方法进行分类。优点:精度高、对异常值不敏感、无数据输入假定。缺点:计算复杂度高、空间复杂度高。适用数据范围:数值型和标称型。原理存在一个样本数据集合,也称作训练样本集,并且样本集中每个数据都存在标签,即我们知道样本集中每一数据与所属分类的对应关系。输入没有标签的新数据后,将新数据的每个特征和样本集中数据对应的特征进行比较,然后算法原创 2017-03-20 21:40:52 · 261 阅读 · 0 评论