python sklearn模型融合案例分享

最新推荐文章于 2024-07-19 18:14:35 发布

仙人掌_lz

最新推荐文章于 2024-07-19 18:14:35 发布

阅读量3.1k

点赞数 3

分类专栏： python 统计学习

本文链接：https://blog.csdn.net/qq_36603091/article/details/89331658

版权

python 同时被 2 个专栏收录

23 篇文章 0 订阅

订阅专栏

统计学习

6 篇文章 0 订阅

订阅专栏

heamy库的blending方法和mlxtend库的Stacking 方法

# -*- coding: utf-8 -*-
from heamy.dataset import Dataset
from heamy.estimator import Regressor, Classifier
from heamy.pipeline import ModelsPipeline
from sklearn.model_selection import KFold
from sklearn.model_selection import train_test_split
from sklearn.ensemble import RandomForestRegressor
from sklearn.linear_model import LinearRegression
from sklearn.metrics import mean_absolute_error
from sklearn.model_selection import cross_val_score
#加载数据集
from sklearn.datasets import load_boston
data = load_boston()
X, y = data['data'], data['target']
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.1, random_state=111)
#创建数据集
dataset = Dataset(X_train,y_train,X_test)
#创建RF模型和LR模型
model_rf = Regressor(dataset=dataset, estimator=RandomForestRegressor, parameters={'n_estimators': 50},name='rf')
model_lr = Regressor(dataset=dataset, estimator=LinearRegression, parameters={'normalize': True},name='lr')
# Stack两个模型
# Returns new dataset with out-of-fold predictions
pipeline = ModelsPipeline(model_rf,model_lr)
stack_ds = pipeline.stack(k=10,seed=111)
#第二层使用lr模型stack
stacker = Regressor(dataset=stack_ds, estimator=LinearRegression)
results = stacker.predict()
# 使用10折交叉验证结果
results10 = stacker.validate(k=10,scorer=mean_absolute_error)

from sklearn.metrics import explained_variance_score
from mlxtend.regressor import StackingRegressor
import numpy as np
rf = RandomForestRegressor(n_estimators=100)
lr =LinearRegression()

sclf = StackingRegressor(regressors=[rf,lr],
                         meta_regressor=lr)
n_folds = 10
kf = KFold(n_folds, shuffle=True, random_state=42).get_n_splits(X)
scores = cross_val_score(sclf,X_train,y_train,cv = kf,scoring='neg_mean_absolute_error')
print("KF:,",np.mean(scores))

scores2 = []
for i in range(10):
    x_train,  x_test, Y_train,Y_test = train_test_split(X_train, y_train,test_size=0.1)
    sclf.fit(x_train, Y_train)
    prediction = sclf.predict(X_test)
    scores2.append(mean_absolute_error(y_test, prediction))
print("for:",np.mean(scores2))