模型调参

最新推荐文章于 2024-05-09 15:35:47 发布

你扰到我学习了

最新推荐文章于 2024-05-09 15:35:47 发布

阅读量436

点赞数

本文链接：https://blog.csdn.net/jianmojiayou/article/details/115220691

版权

模型调参：
常用的调参方法：
1.手动调参数（根据参数的重要性）
2.网格搜索
3.贝叶斯优化

1.建立模型后一次对learning_rate,max_depth等进行调节，看模型的评价指标的变化

cv_scores = []
for i, (train_index, valid_index) in enumerate(kf.split(X_train, y_train)):
    print('************************************ {} ************************************'.format(str(i+1)))
    X_train_split, y_train_split, X_val, y_val = X_train.iloc[train_index], y_train[train_index], X_train.iloc[valid_index], y_train[valid_index]
    
    train_matrix = lgb.Dataset(X_train_split, label=y_train_split)
    valid_matrix = lgb.Dataset(X_val, label=y_val)

    params = {
                "learning_rate": 0.1,
                "boosting": 'gbdt',  
                "lambda_l2": 0.1,
                "max_depth": -1,
                "num_leaves": 128,
                "bagging_fraction": 0.8,
                "feature_fraction": 0.8,
                "metric": None,
                "objective": "multiclass",
                "num_class": 4,
                "nthread": 10,
                "verbose": -1,
            }
    
    model = lgb.train(params, 
                      train_set=train_matrix, 
                      valid_sets=valid_matrix, 
                      num_boost_round=2000, 
                      verbose_eval=100, 
                      early_stopping_rounds=200,
                      feval=f1_score_vali)
    
    val_pred = model.predict(X_val, num_iteration=model.best_iteration)
    
    val_pred = np.argmax(val_pred, axis=1)
    cv_scores.append(f1_score(y_true=y_val, y_pred=val_pred, average='macro'))
    print(cv_scores)

print("lgb_scotrainre_list:{}".format(cv_scores))
print("lgb_score_mean:{}".format(np.mean(cv_scores)))
print("lgb_score_std:{}".format(np.std(cv_scores)))

2.网格搜索：
需要指出的是用网格搜索的话不能用原生API，要有Sklearn接口：

from sklearn.model_selection import GridSearchCV

def get_best_cv_params(learning_rate=0.1, n_estimators=581, num_leaves=31, max_depth=-1, bagging_fraction=1.0, 
                       feature_fraction=1.0, bagging_freq=0, min_data_in_leaf=20, min_child_weight=0.001, 
                       min_split_gain=0, reg_lambda=0, reg_alpha=0, param_grid=None):
    # 设置5折交叉验证
    cv_fold = KFold(n_splits=5, shuffle=True, random_state=2021)

    model_lgb = lgb.LGBMClassifier(learning_rate=learning_rate,
                                   n_estimators=n_estimators,
                                   num_leaves=num_leaves,
                                   max_depth=max_depth,
                                   bagging_fraction=bagging_fraction,
                                   feature_fraction=feature_fraction,
                                   bagging_freq=bagging_freq,
                                   min_data_in_leaf=min_data_in_leaf,
                                   min_child_weight=min_child_weight,
                                   min_split_gain=min_split_gain,
                                   reg_lambda=reg_lambda,
                                   reg_alpha=reg_alpha,
                                   n_jobs= 8
                                  )

    f1 = make_scorer(f1_score, average='micro')
    grid_search = GridSearchCV(estimator=model_lgb, 
                               cv=cv_fold,
                               param_grid=param_grid,
                               scoring=f1

                              )
    grid_search.fit(X_train, y_train)

    print('模型当前最优参数为:{}'.format(grid_search.best_params_))
    print('模型当前最优得分为:{}'.format(grid_search.best_score_))

因此重新建立模型，确定参数搜索的空间，用GridSearchCV函数进行网格搜索，可以返回最优模型的参数。

3.贝叶斯优化
from bayes_opt import BayesianOptimization
需要安装贝叶斯优化的包

from sklearn.model_selection import cross_val_score

"""定义优化函数"""
def rf_cv_lgb(num_leaves, max_depth, bagging_fraction, feature_fraction, bagging_freq, min_data_in_leaf, 
              min_child_weight, min_split_gain, reg_lambda, reg_alpha):
    # 建立模型
    model_lgb = lgb.LGBMClassifier(boosting_type='gbdt', objective='multiclass', num_class=4,
                                   learning_rate=0.1, n_estimators=5000,
                                   num_leaves=int(num_leaves), max_depth=int(max_depth), 
                                   bagging_fraction=round(bagging_fraction, 2), feature_fraction=round(feature_fraction, 2),
                                   bagging_freq=int(bagging_freq), min_data_in_leaf=int(min_data_in_leaf),
                                   min_child_weight=min_child_weight, min_split_gain=min_split_gain,
                                   reg_lambda=reg_lambda, reg_alpha=reg_alpha,
                                   n_jobs= 8
                                  )
    f1 = make_scorer(f1_score, average='micro')
    val = cross_val_score(model_lgb, X_train_split, y_train_split, cv=5, scoring=f1).mean()

    return val
from bayes_opt import BayesianOptimization
"""定义优化参数"""
bayes_lgb = BayesianOptimization(
    rf_cv_lgb, 
    {
        'num_leaves':(10, 200),
        'max_depth':(3, 20),
        'bagging_fraction':(0.5, 1.0),
        'feature_fraction':(0.5, 1.0),
        'bagging_freq':(0, 100),
        'min_data_in_leaf':(10,100),
        'min_child_weight':(0, 10),
        'min_split_gain':(0.0, 1.0),
        'reg_alpha':(0.0, 10),
        'reg_lambda':(0.0, 10),
    }
)

"""开始优化"""
bayes_lgb.maximize(n_iter=10)

比较好的链接：https://mp.weixin.qq.com/s?__biz=MzIyNjM2MzQyNg==&mid=2247534748&idx=2&sn=dc350e3cd61efd4bb269e3b3c61a28b7&key=894f956096063b6030168dc051dc4d2afdfa751652201a528e188ed057645f21d5e3a6f744cd9df875e994fb664895e200dd45de15b23bebd3e7a88c5ef2b2c7c7b027101086c7e616a622b6cee0cd83205173952db6418bf52ca297b05405d184a4f329329efadb8890a54fe710b9e7dcddf96d1f19c562053a0b5a96b0d60e&ascene=14&uin=MTY5MTgxNzYyNA%3D%3D&devicetype=Windows+10+x64&version=63000039&lang=zh_CN&exportkey=AUCJz4E8BO609j04ugsfJxY%3D&pass_ticket=XOd3UD8VyLYimDdsjgnnCKQZ5lUcNYWy25xPPWOS6bmsrjNwy5Y3qrHe3IpPnoyV&wx_header=0

你扰到我学习了

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
模型调参

模型调参：常用的调参方法：1.手动调参数（根据参数的重要性）2.网格搜索3.贝叶斯优化1.建立模型后一次对learning_rate,max_depth等进行调节，看模型的评价指标的变化cv_scores = []for i, (train_index, valid_index) in enumerate(kf.split(X_train, y_train)): print('************************************ {} ***************
复制链接

扫一扫