大数据之Hive实践分享之存储和压缩问题的详解

最新推荐文章于 2022-08-11 23:16:01 发布

xinxindsj

最新推荐文章于 2022-08-11 23:16:01 发布

阅读量271

点赞数

分类专栏：互联网人工智能大数据文章标签： hive 大数据大数据开发大数据分析大数据入门

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/xinxindsj/article/details/103821922

版权

大数据同时被 3 个专栏收录

40 篇文章 2 订阅

订阅专栏

33 篇文章 0 订阅

订阅专栏

33 篇文章 0 订阅

订阅专栏

给大家分享一篇关于Hive实践分享之存储和压缩的坑详解，首先大多数同学在学习大数据技术的过程中，Hive是非常重要的技术之一，但我们在项目上经常会遇到一些存储和压缩的坑，本文通过大数据的武老师整理，分享给大家。

扣丁学堂大数据培训之Hive实践分享之存储和压缩问题的详解

大家都知道，由于集群资源有限，我们一般都会针对数据文件的「存储结构」和「压缩形式」进行配置优化。在我实际查看以后，发现集群的文件存储格式为Parquet，一种列式存储引擎，类似的还有ORC。而文件的压缩形式为Snappy。具体的操作形式如下：

①创建Parquet结构的表(Hive0.13andlater)：

②确认表的文件存储格式：

结果输出如下

③创建Snappy压缩格式的Parquet结构的表(待考察)：

或，写入时

回到最初的问题，如果是按Snappy压缩的格式，这份用户行为数据没办法分析了，因此有两种办法去解决：

①安装Snappy的解压工具

可自行百度，由于没有权限，所以这条路行不通;

②更改数据的压缩格式可以

最初我试了一下更改Parquet格式表的压缩格式，但是没有用!因为我最后是需要将查询数据导出到本地文件系统，如下语句所示：

所以，通过这样的形式得到的数据，压缩格式依然是.Snappy。因此，这里就需要配置Hive执行过程中的中间数据和最终数据的压缩格式。

如MapReduce的shuffle阶段对mapper产生的中间结果数据压缩：

如对最终生成的Hive表的数据压缩：

这里，我们要设置结果表数据的压缩格式，语句如下：

最终的结果就是.gz的压缩格式

最后，我们直接下载到电脑本地，直接解压就可以通过Excel分析用户行为路径数据了。从Hive应用层的角度来说，关于数据文件的「存储结构」和「压缩形式」，这两个点我们不需要关心，只是在导出数据的时候需要结合文件大小，以及数据类型去设置合适的压缩格式。不过从Hive底层维护的角度来说，涉及到各种各样的「存储结构」和「压缩形式」，都需要开发者去研究和调整，这样才能保证集群上的文件在「时间」和「空间」上相对平衡。

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
大数据之Hive实践分享之存储和压缩问题的详解

给大家分享一篇关于Hive实践分享之存储和压缩的坑详解，首先大多数同学在学习大数据技术的过程中，Hive是非常重要的技术之一，但我们在项目上经常会遇到一些存储和压缩的坑，本文通过大数据的武老师整理，分享给大家。大家都知道，由于集群资源有限，我们一般都会针对数据文件的「存储结构」和「压缩形式」进行配置优化。在我实际查看以后，发现集群的文件存储格式为Parquet，一种列式存储引擎，类似的还有...
复制链接

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。