Hadoop系统入门之压缩在大数据中的使用

Hadoop整合压缩在大数据中的应用
为什么使用压缩
压缩的使用场景
常见压缩格式
压缩和解压缩实战
Hadoop整合压缩的使用

Why
单击: 磁盘空间的限制
Hadoop/HDFS:DN是用来存储数据用的 要对HDFS上的数据进行压缩==>减少存储在HDFS上数据所占用的空间
1T==>300G
3T 900G
INPUT==>MR==>OUTPUT
好处:
减少HDFS读写数据量:DISK IO
提升网络传输效率:网络IO

Shuffle是所有分布式计算框架中一个主要的技术瓶颈

压缩使用场景:
在这里插入图片描述
在这里插入图片描述
MR在进行压缩数据的处理时,是否需要手工添加一个步骤去处理呢?
不需要手工处理
但是:MR执行过程中肯定是需要有一个动作去进行数据的压缩或者解压的
注意事项:
事情是有两面性的: 带来的好处的同时,势必还有一个反面的已有存在。
压缩: 原始数据==>压缩的技术手段==>目标数据输入和输出的内容是“一样”的,但是体积是不一样的!
解压缩:原始数据==>解压缩的技术手段==>目标数据

技术手段: 算法

反面:
在处理压缩以及解压的过程中,是有资源(CPU)的消耗

常见压缩格式:
GZIP
BZIP2
LZO
SNAPPY

压缩格式:
压缩比:原始数据大小和压缩的数据大小的百分比
1G 200M 500M 700M
速度: 压缩和解压过程中所消耗的时间比。

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值