机器学习(二)贝叶斯分类器 聚类 降维与度量学习 特征选择与稀疏学习

本文介绍了机器学习中的基础概念,包括基于贝叶斯定理的分类器,如朴素贝叶斯;无监督学习中的聚类方法,以k-means为例;以及解决维数灾难的降维技术和度量学习的重要性。此外,还讨论了特征选择在减轻维数灾难和提升学习效率中的作用。
摘要由CSDN通过智能技术生成

目录

1贝叶斯分类器

2.聚类(以k-means为例)

3.降维与度量学习

4.特征选择与稀疏学习

参考文献


1贝叶斯分类器

定理:贝叶斯分类器是一类分类算法的总称,这类算法均以贝叶斯定理为基础,故统称为贝叶斯分类器。其主要思想为:先验概率+新的数据=后验概率

贝叶斯原理:先验概率,后验概率,全概率

解释:假如从家里去公司上班有三种交通方式打车、坐地铁和乘公交,对应概率为P(A1)=0.5、P(A2)=0.3、P(A3)=0.2,在已知每种方式下上班迟到的概率分别为:打车迟到:P(B|A1)=0.2,坐地铁迟到:P(B|A2)=0.4,乘公交迟到P(B|A3)=0.7,求解,若上班迟到了,是打车方式的概率是多少,即求解P(A1|B)。

      其中

                 P(A1)、P(A2)、P(A3)为先验概率

                 加入新的条件(数据),即上班迟到了P(B)

                 P(A1|B)为后验概率

                 P(B)为全概率(迟到的概率)

朴素贝叶斯分类器机器学习 --- 朴素贝叶斯分类器_从1,2,...,15中小明和小红两人各任取一个数字,现已知小明取到的数字是5的倍数,请_程子的小段的博客-CSDN博客

2.聚类(以k-means为例)

分类:类别是已知的,通过对已知类别的数据进行训练和学习,找到这些不同类的特征,再对未知类别的数据进行分类。属于监督学习。

聚类:事先不知道数据会分为几类,通过聚类分析将数据聚合成几个群体。聚类不需要对数据进行训练和学习。

思想(物以类聚,人以群分):

  1. 首先输入 k 的值,即我们指定希望通过聚类得到 k 个分组;

  2. 从数据集中随机选取 k 个数据点作为初始大佬(质心);

  3. 对集合中每一个小弟,计算与每一个大佬的距离,离哪个大佬距离近,就跟定哪个大佬;

  4. 这时每一个大佬手下都聚集了一票小弟,这时候召开选举大会,每一群选出新的大佬(即通过算法选出新的质心)。

  5. 如果新大佬和老大佬之间的距离小于某一个设置的阈值(表示重新计算的质心的位置变化不大,趋于稳定,或者说收敛),可以认为我们进行的聚类已经达到期望的结果,算法终止。

  6. 如果新大佬和老大佬距离变化很大,需要迭代3~5步骤。

3.降维与度量学习

为什么要降维:样本的特征数称为维数(dimensionality),当维数非常大时,也就是现在所说的“维数灾难”,具体表现在:在高维情形下,数据样本将变得十分稀疏,因为此时要满足训练样本为“密采样”的总体样本数目是一个触不可及的天文数字,谓可远观而不可亵玩焉…训练样本的稀疏使得其代表总体分布的能力大大减弱,从而消减了学习器的泛化能力;同时当维数很高时,计算距离也变得十分复杂,甚至连计算内积都不再容易,这也是为什么支持向量机(SVM)使用核函数“低维计算,高维表现”的原因。


降维:即通过某种数学变换将原始高维空间转变到一个低维的子空间。在这个子空间中,样本的密度将大幅提高,同时距离计算也变得容易。这时也许会有疑问,这样降维之后不是会丢失原始数据的一部分信息吗?这是因为在很多实际的问题中,虽然训练数据是高维的,但是与学习任务相关也许仅仅是其中的一个低维子空间,也称为一个低维嵌入,例如:数据属性中存在噪声属性、相似属性或冗余属性等,对高维数据进行降维能在一定程度上达到提炼低维优质属性或降噪的效果。

 

4.特征选择与稀疏学习

特征
      相关特征:对当前学习任务有用的属性

      无关特征:对当前学习任务没什么用的属性

      冗余特征:该属性所包含的信息能从其他特征中推演出来(eg:面积:能从长宽推出来),它很多时候不起作用,但也有时候可恰好对应完成学习任务所需的中间概念,是有益的,能降低学习任务的难度(比如要算体积,底面积这个冗余特征有利于估算体积)

特征选择
      定义:从特征集合中选取出相关特征,是一种数据预处理过程。

      原因
             减轻维数灾难问题(与降维的原因相同)

             去除不相关特征往往会降低学习任务的难度

特征选择方法
             过滤式(先选择特征子集,再学习)

             包裹式(先学习,再以这个学习器的基础上选择特征子集)

             嵌入式(学习与特征子集的选择的优化同时进行)

参考文献

1.机器学习-贝叶斯分类器(附Python代码)_朴素贝叶斯分类器代码_gao_vip的博客-CSDN博客 

2.贝叶斯分类器详解_陈小虾的博客-CSDN博客

3.5 分钟带你弄懂 K-means 聚类

4.周志华《Machine Learning》学习笔记(12)--降维与度量学习_努力进行光合作用的博客-CSDN博客5.机器学习基础(八):降维与度量学习(KNN、MDS、线性降维、PCA、核化线性降维、流形学习、度量学习)_ling零零零的博客-CSDN博客

6.特征选择与稀疏学习详解_tt丫的博客-CSDN博客 

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值