- 博客(1)
- 收藏
- 关注
原创 HDFS处理小文件问题以及如何解决
哎,鹅厂面试问到这个题一时间没想出很好的答案,就说了运用CombineInputTextFormat的方法,其实还有别的方法,现在总结一下,纪念一下自己惨痛的经历 1.最简单的是避免产生小文件,在数据采集的时候,就将小文件或小批数据合成大文件再上传HDFS。 2.Hadoop Archive 为了缓解大量小文件带给namenode内存的压力,Hadoop 0.18.0引入了Hadoop Archives(HAR files),其本质就是在HDFS之上构建一个分层文件系统。通过执行hadoop archive
2021-04-02 20:50:36 697
空空如也
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人