Hadoop 企业优化（调优）

最新推荐文章于 2024-08-25 12:13:51 发布

yidianyidei

最新推荐文章于 2024-08-25 12:13:51 发布

阅读量110

点赞数

分类专栏：从零开始学习大数据-Haddop 文章标签： hadoop hdfs

本文链接：https://blog.csdn.net/yidianyidei/article/details/107713658

版权

9 篇文章 0 订阅

订阅专栏

在这里插入图片描述

2- 设置相等

3-map reduce 共存 

4-打har 包 或者combineTextinputformat

5-指压缩后的 ---解压

6-溢写， 改大环型缓冲区

7-合并  改变一次合并文件数量

MapReduce优化方法主要从六个方面考虑：数据输入、Map阶段、Reduce阶段、IO传输、数据倾斜问题和常用的调优参数

在这里插入图片描述

在这里插入图片描述

在这里插入图片描述

在这里插入图片描述

在这里插入图片描述

HDFS上每个文件都要在NameNode上建立一个索引，这个索引的大小约为150byte，这样当小文件比较多的时候，就会产生很多的索引文件，一方面会大量占用NameNode的内存空间，另一方面就是索引文件过大使得索引速度变慢。

小文件的优化无非以下几种方式：

（1）在数据采集的时候，就将小文件或小批数据合成大文件再上传HDFS。

（2）在业务处理之前，在HDFS上使用MapReduce程序对小文件进行合并。

（3）在MapReduce处理时，可采用CombineTextInputFormat提高效率。

在这里插入图片描述

关注

专栏目录