17 hive 的数据存储格式

最新推荐文章于 2023-05-10 17:26:35 发布

莹火虫的另一半

最新推荐文章于 2023-05-10 17:26:35 发布

阅读量1.2k

点赞数

分类专栏： hive

本文链接：https://blog.csdn.net/woshilovetg/article/details/113065063

版权

19 篇文章 0 订阅

订阅专栏

行存储和列存储

行存储的特点：查询满足条件的一整行（所有列）数据的时候，列存储则需要去每个聚集的字段找到对应的每个列的值，行存储只需要找到其中一个值，其余的值都在相邻地方，所以此时行存储查询的速度更快。

列存储的特点：因为每个字段的数据聚集存储，在查询只需要少数几个字段的时候，能大大减少读取的数据量；每个字段的数据类型一定是相同的，列式存储可以针对性的设计更好的设计压缩算法。

默认格式，行式存储。可结合Gzip、Bzip2使用(系统自动检查，执行查询时自动解压)，但使用这种方式，hive不会对数据进行切分，从而无法对数据进行并行操作。并且反序列化过程中，必须逐个字符判断是不是分隔符和行结束符，性能较差。

使用ORC文件格式可以提高hive读、写和处理数据的能力。ORCFile是RCFile的升级版。

在ORC格式的hive表中，数据按行分块，每块按列存储。结合了行存储和列存储的优点。记录首先会被横向的切分为多个stripes，然后在每一个stripe内数据以列为单位进行存储，所有列的内容都保存在同一个文件中。

每个stripe的默认大小为256MB，相对于RCFile每个4MB的stripe而言，更大的stripe使ORC可以支持索引，数据读取更加高效。

结论：
- 不同存储格式类型的查询时间比较
  
  textFile > parquet > ORC 、
创建一个SNAPPY压缩的ORC存储方式

create table log_orc_snappy(track_time string,url string,session_id string,referer string,ip string,end_user_id string,city_id string)ROW FORMAT DELIMITED FIELDS TERMINATED BY '\t'STORED AS orc tblproperties ("orc.compress"="SNAPPY");

最终结论：

一般情况下，数据仓库采用的存储格式是 ORC 格式，默认的 zlib 压缩比比较高，但是读取相对较慢，一般情况下不使用 ORC 默认的zlib压缩/解压缩存储方式；
会使用 ORC （存储格式）+ Snappy（压缩的编解码方式）来进行数据仓库的建设。
在查询数据的过程中， map 端和 reduce 端使用压缩方案。

关注