Hive的数据压缩

最新推荐文章于 2023-07-04 22:45:00 发布

散_步

最新推荐文章于 2023-07-04 22:45:00 发布

阅读量1.2k

点赞数

分类专栏：数据仓库

本文链接：https://blog.csdn.net/zhumengguang/article/details/105253745

版权

数据仓库专栏收录该内容

9 篇文章 0 订阅

订阅专栏

在实际工作当中，hive当中处理的数据，一般都是需要经过压缩，前期我们在学习hadoop的时候，已经配置过hadoop的压缩，

这里的hive也是一样，可以使用压缩来节省我们的额MR的处理的网络带宽。

为了支持多种压缩/解压缩算法，Hadoop引入编码/解码器，

压缩配置参数：

要在Hadoop中启用压缩，可以配置如下参数（mapred-site.xml文件中）

开启Map输出阶段压缩：

开启map输出阶段压缩可以减少job中map和Reduce task间数据传输量，具体配置如下：

1.开启hive中间传输数据压缩功能

set hive.exec.compress.intermediate=true;
2.开启mapreduce中map输出压缩功能：

set mapreduce.map.output.compress=true;
3.设置mapreduce中map输出数据压缩方式：

set mapreduce.map.output.compress.codec=
org.apache.hadoop.io.compress.SnappyCodec;

4.执行查询语句：

select count(1) from score;

开启Reduce输出阶段压缩：

当Hive将输出写入到表中时，输出内容同样可以进行压缩。属性hive.exec.compress.output控
制着这个功能。用户可能需要保持默认设置文件中的默认值false，这样默认的输出就是非压
缩的纯文本文件了。用户可以通过在查询语句或执行脚本中设置这个值为true，来开启输出结
果压缩功能。

1.开启hive最终输出数据压缩功能：

set hive.exec.compress.output=true;
2.开启mapreduce最终输出数据压缩：

set mapreduce.output.fileoutputformat.compress=true;
3.设置mapreduce最终数据输出压缩方式：

set mapreduce.output.fileoutputformat.compress.codec =
org.apache.hadoop.io.compress.SnappyCodec;
4.设置mapreduce最终数据输出压缩为块压缩：
set mapreduce.output.fileoutputformat.compress.type=BLOCK;
5.测试一下输出结果是否是压缩文件：
insert overwrite local directory '/export/servers/snappy' select * from
score distribute by s_id sort by s_id desc;

hive的数据存储方式：

Hive支持的存储数的格式主要有：TEXTFILE（行式存储）、SEQUENCEFILE(行式存储)、ORC （列式存储）、PARQURT（列式存储）。

行存储的特点： 查询满足条件的一整行数据的时候，列存储则需要去每个聚集的字段找到对
应的每个列的值，行存储只需要找到其中一个值，其余的值都在相邻地方，所以此时行存储
查询的速度更快。
列存储的特点： 因为每个字段的数据聚集存储，在查询只需要少数几个字段的时候，能大大
减少读取的数据量；每个字段的数据类型一定是相同的，列式存储可以针对性的设计更好的
设计压缩算法

TEXTFILE和SEQUENCEFILE的存储格式都是基于行存储的；
ORC和PARQUET是基于列式存储的

常用的数据存储格式：

TEXTFILE格式：

默认格式，数据不做压缩，磁盘开销大，数据解析开销大。可结合Gzip、Bzip2使用。

ORC格式：

Orc(Optimized Row Columnar)是hive 0.11版里引入的新的存储格式。
可以看到每个Orc文件由1个或多个stripe组成，每个stripe250MB大小，每个Stripe里有三部分
组成，分别是Index Data,Row Data,Stripe Footer：

indexData：某些列的索引数据
rowData :真正的数据存储
StripFooter：stripe的元数据信息

PARQUET格式：

Parquet是面向分析型业务的列式存储格式，由Twitter和Cloudera合作开发，
Parquet文件是以二进制方式存储的，所以是不可以直接读取的，文件中包括该文件的数据和
元数据，因此Parquet格式文件是自解析的
通常情况下，在存储Parquet数据的时候会按照Block大小设置行组的大小，由于一般情况下每
一个Mapper任务处理数据的最小单位是一个Block，这样可以把每一个行组由一个Mapper任务
处理，增大任务执行并行度。Parquet文件的格式如下图所示

散_步

关注

0
点赞
踩
8

收藏

觉得还不错? 一键收藏
0
评论
Hive的数据压缩

在实际工作当中，hive当中处理的数据，一般都是需要经过压缩，前期我们在学习hadoop的时候，已经配置过hadoop的压缩，这里的hive也是一样，可以使用压缩来节省我们的额MR的处理的网络带宽。为了支持多种压缩/解压缩算法，Hadoop引入编码/解码器，压缩配置参数：要在Hadoop中启用压缩，可以配置如下参数（mapred-site.xml文件中）...
复制链接

扫一扫