集成学习

最新推荐文章于 2024-09-13 13:53:08 发布

hahehaing

最新推荐文章于 2024-09-13 13:53:08 发布

阅读量81

点赞数

文章标签：集成学习

本文链接：https://blog.csdn.net/wanghaha180325/article/details/96879873

版权

Bagging：
通过对原数据进行有放回的抽取，构建出多个样本数据集，然后用这些新的数据集训练多个分类器。因为是有放回的采用，所以一些样本可能会出现多次，而其他样本会被忽略。该方法是通过降低基分类器方法来改善泛化能力，因此Bagging的性能依赖于基分类器的稳定性，如果基分类器是不稳定的，Bagging有助于减低训练数据的随机扰动导致的误差，但是如果基分类器是稳定的，即对数据变化不敏感，那么Bagging方法就得不到性能的提升，甚至会降低。

Boosting
提升方法是一个迭代的过程，通过改变样本分布，使得分类器聚集在那些很难分的样本上，对那些容易错分的数据加强学习，增加错分数据的权重，这样错分的数据再下一轮的迭代就有更大的作用（对错分数据进行惩罚）。

Bagging和Boosting的区别：
1）样本选择上：
　Bagging：训练集是在原始集中有放回选取的，从原始集中选出的各轮训练集之间是独立的。
　Boosting：每一轮的训练集不变，只是训练集中每个样例在分类器中的权重发生变化。而权值是根据上一轮的分类结果进行调整。
2）样例权重：
　Bagging：使用均匀取样，每个样例的权重相等
　Boosting：根据错误率不断调整样例的权值，错误率越大则权重越大。
3）预测函数：
　Bagging：所有预测函数的权重相等。
　Boosting：每个弱分类器都有相应的权重，对于分类误差小的分类器会有更大的权重。
4）并行计算：
　Bagging：各个预测函数可以并行生成
　Boosting：各个预测函数只能顺序生成，因为后一个模型参数需要前一轮模型的结果。