Hadoop整合压缩在大数据中的应用
为什么使用压缩
压缩的使用场景
常见压缩格式
压缩和解压缩实战
Hadoop整合压缩的使用
Why
单击: 磁盘空间的限制
Hadoop/HDFS:DN是用来存储数据用的 要对HDFS上的数据进行压缩==>减少存储在HDFS上数据所占用的空间
1T==>300G
3T 900G
INPUT==>MR==>OUTPUT
好处:
减少HDFS读写数据量:DISK IO
提升网络传输效率:网络IO
Shuffle是所有分布式计算框架中一个主要的技术瓶颈
压缩使用场景:
MR在进行压缩数据的处理时,是否需要手工添加一个步骤去处理呢?
不需要手工处理
但是:MR执行过程中肯定是需要有一个动作去进行数据的压缩或者解压的
注意事项:
事情是有两面性的: 带来的好处的同时,势必还有一个反面的已有存在。
压缩: 原始数据==>压缩的技术手段==>目标数据输入和输出的内容是“一样”的,但是体积是不一样的!
解压缩:原始数据==>解压缩的技术手段==>目标数据
技术手段: 算法
反面:
在处理压缩以及解压的过程中,是有资源(CPU)的消耗
常见压缩格式:
GZIP
BZIP2
LZO
SNAPPY
压缩格式:
压缩比:原始数据大小和压缩的数据大小的百分比
1G 200M 500M 700M
速度: 压缩和解压过程中所消耗的时间比。