集成学习之bagging

最新推荐文章于 2022-07-13 10:36:46 发布

蓝棠

最新推荐文章于 2022-07-13 10:36:46 发布

阅读量240

点赞数

原文链接：https://github.com/datawhalechina/team-learning-data-mining/tree/master/EnsembleLearning

版权

这里写目录标题

bagging思路和算法
bagging的案例分析(基于sklearn，介绍随机森林的相关理论以及实例)

bagging思路和算法

投票法提到提到，希望各个模型之间具有较大的差异性，而实际操作中的模型却往往是同质的，因此一个简单的思路是通过不同的采样增加模型的差异性。

Bagging（bootstrap aggregating），其含义是自助聚合。
Bagging的核心在于自助采样(bootstrap)，首先我们随机取出一个样本放入采样集合中，再把这个样本放回初始数据集，重复K次采样，最终可以获得一个大小为K的样本集合。同样的方法，可以采样出T个含K个样本的采样集合，然后基
于每个采样集合训练出一个基学习器，再将这些基学习器进行结合，这就是Bagging的基本流程。

Bagging方法之所以有效，是因为每个模型都是在略微不同的训练数据集上拟合完成的，这又使得每个基模型之间存在略微的差异，使每个基模型拥有略微不同的训练能力。

Bagging是一种降低方差的技术，因此它在不剪枝决策树、神经网络等易受样本扰动的学习器上效果更加明显。在实际的使用中，加入列采样的Bagging技术对高维小样本往往有神奇的效果。

bagging的案例分析(基于sklearn，介绍随机森林的相关理论以及实例)

Sklearn为我们提供了 BaggingRegressor 与 BaggingClassifier 两种Bagging方法的API，这里通过一个完整的例子演示Bagging在分类问题上的具体应用。这里两种方法的默认基模型是树模型。

树模型

树模型一般指决策树，它是一种树形结构，树的每个非叶子节点表示对样本在一个特征上的判断，节点下方的分支代表对样本的划分。决策树的建立过程是一个对数据不断划分的过程，每次划分中，首先要选择用于划分的特征，之后要确定划分的方案（类别/阈值）。我们希望通过划分，决策树的分支节点所包含的样本“纯度”尽可能地高。节点划分过程中所用的指标主要是信息增益和GINI系数。
在这里插入图片描述

通过计算信息增益或Gini指数确定了首先根据天气情况对样本进行划分，之后对于每个分支，继续考虑除天气之外的其他特征，直到样本的类别被完全分开，所有特征都已使用，或达到树的最大深度为止。

bagging之随机森林

在这里插入图片描述

sklearn实例

from numpy import mean
from numpy import std
from sklearn.datasets import make_classification
from sklearn.model_selection import cross_val_score
from sklearn.model_selection import RepeatedStratifiedKFold
from sklearn.ensemble import BaggingClassifier

#创建数据集,1000个样本20维特征分类数据集
X, y = make_classification(n_samples=1000, n_features=20, n_informative=15, n_redundant=5, random_state=5)
print(X.shape, y.shape)

#使用重复的分层k-fold交叉验证来评估模型，重复3次，每次有10个fold。评估该模型在所有重复交叉验证中性能的平均值和标准差
model = BaggingClassifier()
cv = RepeatedStratifiedKFold(n_splits=10, n_repeats=3, random_state=1) 
n_scores = cross_val_score(model, X, y, scoring='accuracy', cv=cv, n_jobs=-1,error_score='raise')
print('Accuracy: %.3f (%.3f)' % (mean(n_scores), std(n_scores)))

Accuracy: 0.854 (0.036)

蓝棠

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
集成学习之bagging

这里写目录标题bagging思路和算法bagging的案例分析(基于sklearn，介绍随机森林的相关理论以及实例)树模型bagging之随机森林sklearn实例bagging思路和算法投票法提到提到，希望各个模型之间具有较大的差异性，而实际操作中的模型却往往是同质的，因此一个简单的思路是通过不同的采样增加模型的差异性。Bagging（bootstrap aggregating），其含义是自助聚合。Bagging的核心在于自助采样(bootstrap)，首先我们随机取出一个样本放入采样集合中，再把
复制链接

扫一扫