HDFS小文件优化方法（存储、执行优化）

最新推荐文章于 2024-07-19 10:49:07 发布

五块兰州拉面

最新推荐文章于 2024-07-19 10:49:07 发布

阅读量1.3k

点赞数

分类专栏： # hadoop 文章标签： hdfs hadoop java

本文链接：https://blog.csdn.net/qq_39331255/article/details/109752693

版权

hadoop 专栏收录该内容

10 篇文章 1 订阅

订阅专栏

HDFS小文件弊端

HDFS上每个文件都要在NameNode上建立一个索引，这个索引的大小约为150byte，这样当小文件比较多的时候，就会产生很多的索引文件，一方面会大量占用NameNode的内存空间，另一方面就是索引文件过大使得索引速度变慢。

HDFS小文件解决方案

小文件的优化无非以下几种方式：
（1）在数据采集的时候，就将小文件或小批数据合成大文件再上传HDFS。
（2）在业务处理之前，在HDFS上使用MapReduce程序对小文件进行合并。
（3）在MapReduce处理时，可采用CombineTextInputFormat提高效率。
以下介绍中，1,2是针对存储小文件的优化，3,4是执行小文件的优化
在这里插入图片描述

在这里插入图片描述

方法1的使用：小文件存档

方法2原理和1相同，对外是一个整体，对内是一个个独立文件

在这里插入图片描述
案例实操
（1）需要启动YARN进程
[atguigu@hadoop102 hadoop-2.7.2]$ start-yarn.sh
（2）归档文件
把/user/atguigu/input目录里面的所有文件归档成一个叫input.har的归档文件，并把归档后文件存储到/user/atguigu/output路径下。
[atguigu@hadoop102 hadoop-2.7.2]$ bin/hadoop archive -archiveName input.har –p /user/atguigu/input /user/atguigu/output
（3）查看归档
[atguigu@hadoop102 hadoop-2.7.2]$ hadoop fs -lsr /user/atguigu/output/input.har
[atguigu@hadoop102 hadoop-2.7.2]$ hadoop fs -lsr har:///user/atguigu/output/input.har
（4）解归档文件
[atguigu@hadoop102 hadoop-2.7.2]$ hadoop fs -cp har:/// user/atguigu/output/input.har/* /user/atguigu
或者查看归档文件hadoop fs -ls -R har:/// user/atguigu/output/input.har