吴恩达机器学习笔记(8.机器学习系统的设计)

1,首先要做什么

接下来我们将讨论机器学习系统的设计。在设计复杂的机器学习系统时,你将遇到的主要问题。同时我们会试着给出一些关于如何巧妙构建一个复杂的机器学习系统的建议。可能在构建大型的机器学习系统时,节省大量的时间。

我么首先要做的就是如何选择并表达特征向量X,以垃圾邮件分类为例,我们可以 选择一个由 100 个最常出现在垃圾邮件中的词所构成的列表,根据这些词是否有在邮件中 出现,来获得我们的特征向量(出现为 1,不出现为 0),尺寸为 100×1。

我们要做到:

1. 收集更多的数据,让我们有更多的垃圾邮件和非垃圾邮件的样本

2. 基于邮件的路由信息开发一系列复杂的特征

3. 基于邮件的正文信息开发一系列复杂的特征,包括考虑截词的处理

4. 为探测刻意的拼写错误(把 watch 写成 w4tch)开发复杂的算法

在上面这些选项中,非常难决定应该在哪一项上花费时间和精力,作出明智的选择。

接下来我们将分析怎样用一个更加系统的方法,选择一个合适的选择。

2,误差分析

如果你准备研究机器学习的东西,或者构造机器学习应用程序,最好的实践方法 不是建立一个非常复杂的系统,拥有多么复杂的变量;而是构建一个简单的算法,这样你可以很快地实现它。 每当我研究机器学习的问题时,我会花很少的时间 来试图很快的把结果搞出来,即便效果不好。坦白的说,就是根本没有用复杂的系统,但是 只是很快的得到的结果。即便运行得不完美,但是也把它运行一遍,最后通过交叉验证来检 验数据。一旦做完,你可以画出学习曲线,通过画出学习曲线,以及检验误差,来找出你的 算法是否有高偏差和高方差的问题,或者别的问题。在这样分析之后,再来决定用更多的数 据训练,或者加入更多的特征变量是否有用。

这么做的原因是:这在你刚接触机器学习问题 时是一个很好的方法,你并不能提前知道你是否需要复杂的特征变量,或者你是否需要更多 的数据,还是别的什么。提前知道你应该做什么,是非常难的,因为你缺少证据,缺少学习 曲线。因此,你很难知道你应该把时间花在什么地方来提高算法的表现。但是当你实践一个 非常简单即便不完美的方法时,你可以通过画出学习曲线来做出进一步的选择。你可以用这 种方式来避免一种电脑编程里的过早优化问题,这种理念是:我们必须用证据来领导我们的 决策,怎样分配自己的时间来优化算法,而不是仅仅凭直觉,凭直觉得出的东西一般总是错 误的。

除了画出学习曲线之外,一件非常有用的事是误差分析,我的意思是说:当我们在构 造垃圾邮件分类器时,我会看一看我的交叉验证数据集,然后亲自看一看哪些邮件被算法错 误地分类。因此,通过这些被算法错误分类的垃圾邮件与非垃圾邮件,你可以发现某些系统 性的规律:什么类型的邮件总是被错误分类。经常地这样做之后,这个过程能启发你构造新 的特征变量,或者告诉你:现在这个系统的短处,然后启发你如何去提高它。

所以构建一个算法的推荐方法为:

1. 从一个简单的能快速实现的算法开始,实现该算法并用交叉验证集数据测试这个算 法

2. 绘制学习曲线,决定是增加更多数据,或者添加更多特征,还是其他选择

3. 进行误差分析:人工检查交叉验证集中我们算法中产生预测误差的实例,看看这些实例是否有某种系统化的趋势

因此,不要担心你的算法太简单,或者太 不完美,而是尽可能快地实现你的算法。当你有了初始的实现之后,它会变成一个非常有力 的工具,来帮助你决定下一步的做法。因为我们可以先看看算法造成的错误,通过误差分析, 来看看他犯了什么错,然后来决定优化的方式。

3,类偏斜的误差度量

类偏斜情况表现为我们的 训练集中有非常多的同一种类的实例,只有很少或没有其他类的实例。

例如我们希望用算法来预测癌症是否是恶性的,在我们的训练集中,只有 0.5%的实例 是恶性肿瘤。假设我们编写一个非学习而来的算法,在所有情况下都预测肿瘤是良性的,那 么误差只有 0.5%。然而我们通过训练而得到的神经网络算法却有 1%的误差。这时,误差的 大小是不能视为评判算法效果的依据的。

我们将算法预测的结果分成四种情况:

1. 正确肯定(True Positive,TP):预测为真,实际为真

2. 正确否定(True Negative,TN):预测为假,实际为假

3. 错误肯定(False Positive,FP):预测为真,实际为假

4. 错误否定(False Negative,FN):预测为假,实际为真

那么,查准率=TP/(TP+FP)。例,在所有我们预测有恶性肿瘤的病人中,实际上有恶性肿 瘤的病人的百分比,越高越好。

查全率=TP/(TP+FN)。例,在所有实际上有恶性肿瘤的病人中,成功预测有恶性肿瘤的 病人的百分比,越高越好。

这样的话,对于那个总是预测病人肿瘤为良性的算法,其查全率是 0。

4,查全率和查准率之间的权衡

在 很多应用中,我们希望能够保证查准率和召回率的相对平衡。

以上边的预测肿瘤的例子来说,如果我们希望只在非常确信的情况下预测为真(肿瘤为恶性),即我们希望更高的查 准率,我们可以使用比 0.5 更大的阀值,如 0.7,0.9。这样做我们会减少错误预测病人为恶 性肿瘤的情况,同时却会增加未能成功预测肿瘤为恶性的情况。 如果我们希望提高查全率,尽可能地让所有有可能是恶性肿瘤的病人都得到进一步地 检查、诊断,我们可以使用比 0.5 更小的阀值,如 0.3。 我们可以将不同阀值情况下,查全率与查

我们可以将不同阀值情况下,查全率与查准率的关系绘制成图表,曲线的形状根据数 据的不同而不同(图上的三条线代表的是数据的不同导致的线的形状的不同):

选择阈值的方法有一个是F1值方法,我们选择使得 F1 值最高的阀值:

关于阈值有很多方法,这个只是其中一种方法。

  • 0
    点赞
  • 1
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值