【图文详细 】HDFS面试题:hdfs 的数据压缩算法?

本文详细介绍了HDFS中四种常见的数据压缩算法:Gzip, Bzip2, Lzo和Snappy。Gzip压缩率高但不支持split,适用于日志处理;Bzip2压缩率最高但速度慢;Lzo压缩速度快且支持split,适合大文件;Snappy速度快但压缩率较低,常用于MapReduce中间数据压缩。各种算法在不同场景下有其独特优势。" 110489805,10293292,Ubuntu20.04安装划词翻译神器:CopyTranslator与沙拉查词,"['Ubuntu', '翻译工具', '文献阅读', 'PDF工具', '科研辅助']
摘要由CSDN通过智能技术生成

(1) Gzip 压缩

优点:压缩率比较高,而且压缩/解压速度也比较快; hadoop 本身支持,在应用中处理gzip 格式的文件就和直接处理文本一样;大部分 linux 系统都自带 gzip 命令,使用方便.

缺点:不支持 split。

应用场景: 当每个文件压缩之后在 130M 以内的(1 个块大小内),都可以考虑用 gzip压缩格式。 例如说一天或者一个小时的日志压缩成一个 gzip 文件,运行 mapreduce 程序的时候通过多个 gzip 文件达到并发。 hive 程序, streaming 程序,和 java 写的 mapreduce 程序完全和文本处理一样,压缩之后原来的程序不需要做任何修改。

 

(2) Bzip2 压缩

优点:支持 split;具有很高的压缩率,比 gzip 压缩率都高; hadoop 本身支持,但不支持 native;在 linux 系统下自带 bzip2 命令,使用方便。

缺点:压缩/解压速度慢;不支持 native。

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值