机器学习中关于正则化防止过拟合的原理解析

最新推荐文章于 2025-04-25 21:59:41 发布

心之所向丶7

最新推荐文章于 2025-04-25 21:59:41 发布

阅读量1.4k

点赞数 3

分类专栏：深度学习人工智能

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/javaisnotgood/article/details/88996624

版权

本文探讨了机器学习中的过拟合问题，解释了什么是欠拟合和过拟合，以及它们的原因。过拟合通常发生在特征过多而训练数据不足的情况下。解决过拟合的两种方法是减少特征数量和使用正则化。正则化通过添加惩罚项来减小参数值，从而保持模型简单并提高泛化能力。正则化在线性回归和逻辑回归中都有应用，能有效防止过度拟合。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

作者：邓子明
链接：https://www.zhihu.com/question/20700829/answer/119314862
来源：知乎
著作权归作者所有，转载请联系作者获得授权。

网易云也有免费视频的，另外 coursera 有很多课程都挺不错，可以学习。

The Problem of Overfitting

1.What is Overfitting

看预测房价的这个例子，我们先对该数据做线性回归，也就是左边第一张图。

如果这么做，我们可以获得拟合数据的这样一条直线，但是，实际上这并不是一个很好的模型。我们看看这些数据，很明显，随着房子面积增大，住房价格的变化趋于稳定或者说越往右越平缓。因此线性回归并没有很好拟合训练数据。

我们把此类情况称为欠拟合(underfitting)，或者叫作叫做高偏差(bias)。

这两种说法大致相似，都表示没有很好地拟合训练数据。高偏差这个词是 machine learning 的研究初期传下来的一个专业名词，具体到这个问题，意思就是说如果用线性回归这个算法去拟合训练数据，那么该算法实际上会产生一个非常大的偏差或者说存在一个很强的偏见。

第二幅图，我们在中间加入一个二次项，也就是说对于这幅数据我们用二次函数去拟合。自然，可以拟合出一条曲线，事实也证明这个拟合效果很好。

另一个极端情况是，如果在第三幅图中对于该数据集用一个四次多项式来拟合。因此在这里我们有五个参数θ0到θ4，这样我们同样可以拟合一条曲线，通过我们的五个训练样本，我们可以得到如右图的一条曲线。

一方面，我们似乎对训练数据做了一个很好的拟合，因为这条曲线通过了所有的训练实例。但是，这实际上是一条很扭曲的曲线，它不停上下波动。因此，事实上我们并不认为它是一个预测房价的好模型。

所以，我们把这类情况叫做过拟合(overfitting)，也叫高方差(variance)。

与高偏差一样，高方差同样也是一个历史上的叫法。从第一印象上来说，如果我们拟合一个高阶多项式，那么这个函数能很好的拟合训练集（能拟合几乎所有的训练数据），但这也就面临函数可能太过庞大的问题，变量太多。

同时如果我们没有足够的数据集（训练集）去约束这个变量过多的模型，那么就会发生过拟合。

2. The reason of Overfitting

过度拟合的问题通常发生在变量（特征）过多的时候。这种情况下训练出的方程总是能很好的拟合训练数据，也就是说，我们的代价函数可能非常接近于 0 或者就为 0。

但是，这样的曲线千方百计的去拟合训练数据，这样会导致它无法泛化到新的数据样本中，以至于无法预测新样本价格。在这里，术语"泛化"指的是一个假设模型能够应用到新样本的能力。新样本数据是指没有出现在训练集中的数据。

之前，我们看到了线性回归情况下的过拟合。

最低0.47元/天解锁文章

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。