Hive实践分享之存储和压缩的坑

最新推荐文章于 2024-01-05 00:55:21 发布

尖叫大数据

最新推荐文章于 2024-01-05 00:55:21 发布

阅读量227

点赞数

分类专栏：大数据组件文章标签： hadoop 大数据开发 hive spark etl、

本文链接：https://blog.csdn.net/siqing6995/article/details/85173231

版权

本文分享了在Hive中遇到的Parquet文件和Snappy压缩格式的问题，包括如何创建Parquet表、确认存储格式、解决Snappy压缩数据的分析难题，以及如何通过配置Hive的压缩格式来导出.gz数据。总结了从应用层和底层维护角度考虑数据存储和压缩的重要性。

摘要由CSDN通过智能技术生成

大家都知道，由于集群资源有限，我们一般都会针对数据文件的「存储结构」和「压缩形式」进行配置优化。在我实际查看以后，发现集群的文件存储格式为Parquet，一种列式存储引擎，类似的还有ORC。而文件的压缩形式为Snappy。具体的操作形式如下：
在这里插入图片描述
① 创建Parquet结构的表(Hive 0.13 and later)：

CREATE TABLE CRM.DEMO(A INT) STORED AS PARQUET ;

② 确认表的文件存储格式：

desc formatted crm.demo;

结果输出如下

# Storage Information              
 
SerDe Library:          org.apache.hadoop.hive.ql.io.parquet.serde.ParquetHiveSerDe       
 
InputFormat:                 org.apache.hadoop.hive.ql.io.parquet.MapredParquetInputFormat      
 
OutputFormat:               org.apache.hadoop.hive.ql.io.parquet.MapredParquetOutputFormat

③ 创建Snappy压缩格式的Parquet结构的表(待考察)：