机器学习——机器学习的可行性分析

最新推荐文章于 2024-02-29 08:58:25 发布

yue200403

最新推荐文章于 2024-02-29 08:58:25 发布

阅读量1.2k

点赞数 2

分类专栏：机器学习文章标签：机器学习

本文链接：https://blog.csdn.net/yue200403/article/details/109216907

版权

机器学习专栏收录该内容

9 篇文章 0 订阅

订阅专栏

1.机器学习是否可行

1.1列子阐述

看一个二分类例子，输入特征x是二进制的、三维的，对应有8种输入，其中训练样本D有5个。那么，根据训练样本对应的输出y，假设有8个hypothesis（假设模型），这8个hypothesis在D上，对5个训练样本的分类效果效果都完全正确。但是在另外3个测试数据上，不同的hypothesis表现有好有坏。
在这里插入图片描述
在已知数据D上，我们选择的模型和真实结果很接近；但是在D以外的未知数据上，我们选择的模型和真实结果不一定很接近。而机器学习目的，恰恰是希望我们选择的模型能在未知数据上的预测与真实结果是一致的，而不是在已知的数据集D上寻求最佳效果。
在这里插入图片描述

这个例子告诉我们，我们想要在D以外的数据中更接近目标函数似乎是做不到的，只能保证对D有很好的分类结果。机器学习的这种特性被称为没有免费午餐（No FreeLunch）定理。

1.2NFL定理

NFL定理表明没有一个学习算法可以在任何领域总是产生最准确的学习器。

不管采用何种学习算法，至少存在一个目标函数，能够使得随机猜测算法是更好的算法。平常所说的一个学习算法比另一个算法更“优越”，效果更好，只是针对特定的问题，特定的先验信息，数据的分布，训练样本的数目，代价或奖励函数等。

1.3机器学习需要有假设条件

这个例子来看，NFL说明了无法保证一个机器学习算法在D以外的数据集上一定能分类或预测正确，除非加上一些假设条件。

2.引入Hoeffding不等式

2.1统计学问题

如果有一个装有很多（数量很大数不过来）橙色球和绿色球的罐子，我们能不能推断橙色球的比例u？
在这里插入图片描述
统计学上的做法是，从罐子中随机取出N个球，作为样本，计算这N个球中橙色球的比例v，那么就估计出罐子中橙色球的比例约为v。

2.2数学推导

上述这种随机抽取的做法能否说明罐子里橙色球的比例一定是v呢？答案是否定的。但是从概率的角度来说，样本中的v很有可能接近我们未知的u。下面从数学推导的角度来看v与u是否相近。

已知u是罐子里橙色球的比例，v是N个抽取的样本中橙色球的比例。当N足够大的时候，v接近于u。这就是Hoeffding’s inequality：

在这里插入图片描述
Hoeffding不等式说明当N很大的时候，v与u相差不会很大，它们之间的差值被限定在之内。我们把结论v=u称为probably approximately correct(PAC)。【可能近似正确】

3.统计抽样模型和机器学习

3.1统计学问题和机器学习概念的对应

我们将罐子的内容对应到机器学习的概念上来。

机器学习中hypothesis与目标函数相等的可能性，类比于罐子中橙色球的概率问题；罐子里的一颗颗弹珠类比于机器学习样本空间的x；橙色的弹珠类比于h(x)【h(x)是一个假设的模型】与f【f是我想要得到的模型】不相等；绿色的弹珠类比于h(x)与f相等；从罐子中抽取的N个球类比于机器学习的训练样本D，且这两种抽样的样本与总体样本之间都是独立同分布的。

所以呢，如果样本N够大，且是独立同分布的，那么，从样本中f(x) 不等于h(x)的概率就能推导在抽样样本外的所有样本中f(x) 不等于h(x)的概率是多少。
在这里插入图片描述
映射中最关键的点是讲抽样中橙球的概率理解为样本数据集D上h(x)错误的概率，以此推算出在所有数据上h(x)错误的概率，这也是机器学习能够工作的本质，即我们为啥在采样数据上得到了一个假设，就可以推到全局呢？因为两者的错误率是PAC的，只要我们保证前者小，后者也就小了。
在这里插入图片描述

4.实际机器学习的情况

4.1问题

在这里插入图片描述
假设现在有很多罐子M个（即有M个hypothesis），如果其中某个罐子抽样的球全是绿色，那是不是应该选择这个罐子呢？

我们先来看这样一个例子：150个人抛硬币，那么其中至少有一个人连续5次硬币都是正面朝上的概率是：
在这里插入图片描述
可见这个概率是很大的，但是能否说明5次正面朝上的这个硬币具有代表性呢？答案是否定的！并不能说明该硬币单次正面朝上的概率很大，其实都是0.5。一样的道理，抽到全是绿色求的时候也不能一定说明那个罐子就全是绿色球。当罐子数目很多或者抛
硬币的人数很多的时候，可能引发Bad Sample。

Bad Sample就是E(in)和E(out)差别很大，即选择过多带来的负面影响，选择过多会恶化不好的情形…
在这里插入图片描述

5.M值的讨论，即M(h)增长函数

yue200403

关注

2
点赞
踩
4

收藏

觉得还不错? 一键收藏
打赏
0
评论
机器学习——机器学习的可行性分析

1.机器学习是否可行1.1列子阐述看一个二分类例子，输入特征x是二进制的、三维的，对应有8种输入，其中训练样本D有5个。那么，根据训练样本对应的输出y，假设有8个hypothesis（假设模型），这8个hypothesis在D上，对5个训练样本的分类效果效果都完全正确。但是在另外3个测试数据上，不同的hypothesis表现有好有坏。在已知数据D上，我们选择的模型和真实结果很接近；但是在D以外的未知数据上，我们选择的模型和真实结果不一定很接近。而机器学习目的，恰恰是希望我们选择的模型能在未知数据上
复制链接

扫一扫