随机森林如何处理缺失值？

最新推荐文章于 2024-05-22 12:28:53 发布

加油！小小七

最新推荐文章于 2024-05-22 12:28:53 发布

阅读量1w

点赞数 5

分类专栏：机器学习小知识

机器学习小知识专栏收录该内容

11 篇文章 1 订阅

订阅专栏

序

RF中有相应的缺失值处理方法，本次记录其两种缺失值处理技巧

暴力填补

Python中的na.roughfix包提供简单的缺失值填补策略：
对于训练集中处于同一个类别下的数据，如果是类别变量缺失，则用众数补全，如果是连续变量，则用中位数。

相似度矩阵填补

RF的Python实现中，有一个rfImpute包，可以提供更加高层的缺失值填补。

首先先用暴力填补法进行粗粒度填充。
然后使用上述填补后的训练集来训练随机森林模型，并统计相似度矩阵（proximity matrix），然后再看之前缺失值的地方，如果是分类变量，则用没有缺失的观测实例的相似度中的权重进行投票；如果是连续性变量，则用相似度矩阵进行加权求均值。
上述投票方案迭代进行4~6次。

解释相似度矩阵：
相似度矩阵就是任意两个观测实例间的相似度矩阵，原理是如果两个观测实例落在同一棵树的相同节点次数越多，则这两个观测实例的相似度越高。

详细来说：
Proximity 用来衡量两个样本之间的相似性。原理就是如果两个样本落在树的同一个叶子节点的次数越多，则这两个样本的相似度越高。当一棵树生成后，让数据集通过这棵树，落在同一个叶子节点的”样本对(xi,xj)” proximity 值 P(i,j) 加 1 。所有的树生成之后，利用树的数量来归一化 proximity matrix。继而，我们得到缺失值所在样本的权重值，权重值相近的可以用于缺失值的填补参考。

作者：0过把火0
链接：https://www.jianshu.com/p/a4bf9224d66c
來源：简书
简书著作权归作者所有，任何形式的转载都请联系作者获得授权并注明出处。

加油！小小七

关注

5
点赞
踩
17

收藏

觉得还不错? 一键收藏
2
评论
随机森林如何处理缺失值？

序RF中有相应的缺失值处理方法，本次记录其两种缺失值处理技巧暴力填补Python中的na.roughfix包提供简单的缺失值填补策略：对于训练集中处于同一个类别下的数据，如果是类别变量缺失，则用众数补全，如果是连续变量，则用中位数。相似度矩阵填补RF的Python实现中，有一个rfImpute包，可以提供更加高层的缺失值填补。首先先用暴力填补法进行粗粒度填充。然后使用...
复制链接

扫一扫

专栏目录

评论 2

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。