机器学习1---模型基础知识

最新推荐文章于 2024-07-13 10:53:53 发布

aBIT_Tu

最新推荐文章于 2024-07-13 10:53:53 发布

阅读量412

点赞数

分类专栏：机器学习文章标签：机器学习

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/aBIT_Tu/article/details/82192907

版权

本文介绍了机器学习中的基本概念，包括误差的类型、过拟合与欠拟合、训练集与测试集的划分方法，以及性能度量如错误率、精度、查准率、查全率、F1分数和ROC曲线。重点探讨了泛化误差及其与偏差、方差的关系，以及如何通过交叉验证等方法评估模型性能。

摘要由CSDN通过智能技术生成

1. 误差：在机器学习中算法的预测输出与实际输出之间的差异，包含经验误差和泛化误差。

2. 经验误差：学习算法在训练集上的误差，也称为训练误差。

3. 泛化误差：学习算法在新样本集上的误差，优秀的学习算法都具有泛化误差较小的特点。泛化误差一定程度上可以被拆解为偏差、方差、噪声之和。偏差表示算法本身的拟合能力。方差表示数据扰动的影响。噪声表示误差的下限，即问题本身的难度。

4. 过拟合：学习算法的能力过于强大，不但学会了样本的“普遍特征”，也学会了样本的自身特性。过拟合无法避免，只能缓解。

5. 欠拟合：含义与过拟合相反，易通过增强算法来克服。

6. 训练集、测试集、验证集之间的关系：训练集和验证集可以统称为训练数据，验证集是在训练阶段完成模型选择和调参任务的。测试集主要模仿模型在实际中的数据，用于测试模型的泛化能力。

7. 划分训练集与测试集的主流方法

（1）留出法：直接将数据集随机划分为两个互斥的集合，同时保证数据分布的一致性，避免由于数据分布而产生的偏差。

（2）交叉验证法：又称k-折交叉验证，将数据集随机划分为k个集合（例如划分p次），每次选取其中一个集合作为测试集，其余集合作为训练集合，则一共了进行 $p\times k$ 次实验，再取平均值。特别的，当k等于数据中包含的样本数时，称为留1法，评估结果较为准确但是计算开销随数据量变化明显。

最低0.47元/天解锁文章

关注

0
点赞
踩
1

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。