python 并行化_Python多进程实现并行化随机森林

最新推荐文章于 2021-09-11 18:32:12 发布

牛八日今口

最新推荐文章于 2021-09-11 18:32:12 发布

阅读量599

点赞数 1

文章标签： python 并行化

本文链接：https://blog.csdn.net/weixin_33895274/article/details/111990291

版权

本文介绍了如何使用Python的多进程实现随机森林的并行化训练和预测。随机森林是一种集成算法，通过多进程并行训练决策树，提高了训练效率。每个进程生成的决策树数量相同，训练结束后，再进行并行化的预测操作。

摘要由CSDN通过智能技术生成

1. 前言

Python其实已经实现过随机森林，而且有并行化的参数n_jobs 来设置可以使用多个可用的cpu核并行计算。

n_jobs : int or None, optional (default=None)

The number of jobs to run in parallel for both fit and predict. None means 1 unless in a joblib.parallel_backend context. -1 means using all processors. See Glossary for more details.

当然我们使用的是多进程来实现并行化，和scikit-learn有些不同

2. 随机森林原理

随机森林是一种集成算法(Ensemble Learning)，它属于Bagging类型，通过组合多个弱分类器，最终结果通过投票或取均值，使得整体模型的结果具有较高的精确度和泛化性能。其可以取得不错成绩，主要归功于“随机”和“森林”，一个使它具有抗过拟合能力，一个使它更加精准。

Bagging

Bagging也叫自举汇聚法(bootstrap aggregating)，是一种在原始数据集上通过有放回抽样重新选出k个新数据集来训练分类器的集成技术。它使用训练出来的分类器的集合来对新样本进行分类，然后用多数投票或者对输出求均值的方法统计所有分类器的分类结果，结果最高的类别即为最终标签。此类算法可以有效降低bias，并能够降低variance。

3.实现原理

3.1并行化训练

由于随机森林是通过bagging方法分成多个数据集，然后在生成的数据集上训练生成多个决策树，因为每个决策树是相互独立的，则可以在开启多个进程，每个进程都生成决策树，然后把生成的决策树放到队列，用于训练

3.1.1训练函数

首先平均分出每个线程应该生成几颗决策树，然后生成进程，进行训练，把训练生成的决策树加入到决策树队列(决策树森林)中，这里用的决策树是直接调用的库决策树，若有兴趣，可以单撸一个决策树出来。

注意这里我选择让每个进程生成的决策树的个数相同，所以参数输入的决策树个数可能不是实际生成的决策树个数，例如 100颗决策树 8个进程，则每个进程只会生成 int(100/8) = 12颗决策树

def

最低0.47元/天解锁文章

牛八日今口

关注

1
点赞
踩
3

收藏

觉得还不错? 一键收藏
0
评论
python 并行化_Python多进程实现并行化随机森林

1. 前言Python其实已经实现过随机森林，而且有并行化的参数n_jobs 来设置可以使用多个可用的cpu核并行计算。n_jobs : int or None, optional (default=None)The number of jobs to run in parallel for both fit and predict. None means 1 unless in a jobli...
复制链接

扫一扫