Hadoop集群不均衡的解决方案

最新推荐文章于 2024-05-25 11:32:41 发布

机器学习和人工智能

最新推荐文章于 2024-05-25 11:32:41 发布

阅读量1.7k

点赞数

分类专栏：大数据编程语言人工智能机器学习互联网资讯程序员文章标签：大数据程序员编程语言 hadoop

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/dieagag/article/details/90318745

版权

本文探讨了Hadoop HDFS集群中磁盘利用率不均衡的问题，列举了多种解决方案，包括使用balancer工具、调整节点状态、改变数据副本数量、使用distcp和优化配置。针对大规模集群，建议通过提高dfs.datanode.du.reserved值、关闭nodemanager、升降副本及合理平衡数据来缓解不均衡现象。

摘要由CSDN通过智能技术生成

Hadoop的HDFS集群非常容易出现机器与机器之间磁盘利用率不平衡的情况，比如集群中添加新的数据节点，节点与节点之间磁盘大小不一样等等。
一、引言：

Hadoop的HDFS集群非常容易出现机器与机器之间磁盘利用率不平衡的情况，比如集群中添加新的数据节点，节点与节点之间磁盘大小不一样等等。当hdfs出现不平衡状况的时候，将引发很多问题，比如MR程序无法很好地利用本地计算的优势，机器之间无法达到更好的网络带宽使用率，机器磁盘无法利用等等。

在这里我还是要推荐下我自己建的大数据学习交流qq裙：522189307 ，裙里都是学大数据开发的，如果你正在学习大数据，小编欢迎你加入，大家都是软件开发党，不定期分享干货（只有大数据开发相关的），包括我自己整理的一份最新的大数据进阶资料和高级开发教程，欢迎进阶中和进想深入大数据的小伙伴。上述资料加群可以领取

二、问题：

因业务需要搭建一个新Hadoop集群，并将老的Hadoop集群中的数据迁移至新的hadoop集群，而且datanode节点不能全部上线，其中还可能会出现节点上线或下线的情况，这个时候就很容易出现机器与机器之间磁盘的均衡的情况，具体如下：

上图中可以看出max是94.18%，而min是0.37%，其中有600多台是达到94%的，这个时候在跑mapred的时候往往会报错误：

登陆到该机器上查看服务器的磁盘，磁盘都快已经达到100%，如下：

因为我们在hdfs-site.xml中设置了dfs.datanode.du.reserved的值，所以磁盘会有一定预留空间：

dfs.datanode.du.reserved107374182400

上面这个参数的意思：

Reserved space in bytes per volume. Always leave this much space free for non dfs use.

再查看datanode日志，希

最低0.47元/天解锁文章

机器学习和人工智能

关注

0
点赞
踩
1

收藏

觉得还不错? 一键收藏
0
评论
Hadoop集群不均衡的解决方案

Hadoop的HDFS集群非常容易出现机器与机器之间磁盘利用率不平衡的情况，比如集群中添加新的数据节点，节点与节点之间磁盘大小不一样等等。一、引言：Hadoop的HDFS集群非常容易出现机器与机器之间磁盘利用率不平衡的情况，比如集群中添加新的数据节点，节点与节点之间磁盘大小不一样等等。当hdfs出现不平衡状况的时候，将引发很多问题，比如MR程序无法很好地利用本地计算的优势，机器之间无法达到更...
复制链接

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。