大数据开发面试：Impala和hive的比较（完整版）

最新推荐文章于 2024-06-29 22:47:17 发布

道法—自然

最新推荐文章于 2024-06-29 22:47:17 发布

阅读量1.4k

点赞数

本文链接：https://blog.csdn.net/wyqwilliam/article/details/81073381

版权

本文对比分析了Impala和Hive在大数据查询中的异同。Impala以其快速查询性能，不依赖MapReduce，使用LLVM优化执行效率，以及支持多种存储格式等优势，成为实时数据分析的良好选择。然而，它不支持UDF和查询期间的容错，对内存要求较高。Hive则更适合复杂的批处理任务。两者在数据存储、元数据、SQL处理上存在共性，但在执行计划、数据流、内存使用和调度策略上有显著差异。

摘要由CSDN通过智能技术生成

Impala和hive的比较（完整版）

Impala是Cloudera公司主导开发的新型查询系统，它提供SQL语义，能查询存储在Hadoop的HDFS和HBase中的PB级大数据。已有的Hive系统虽然也提供了SQL语义，但由于Hive底层执行使用的是MapReduce引擎，仍然是一个批处理过程，难以满足查询的交互性。相比之下，Impala的最大特点也是最大卖点就是它的快速。

Impala相对于Hive所使用的优化技术

没有使用MapReduce进行并行计算，虽然MapReduce是非常好的并行计算框架，但它更多的面向批处理模式，而不是面向交互式的SQL执行。与MapReduce相比：Impala把整个查询分成一执行计划树，而不是一连串的MapReduce任务，在分发执行计划后，Impala使用拉式获取数据的方式获取结果，把结果数据组成按执行树流式传递汇集，减少了把中间结果写入磁盘的步骤，再从磁盘读取数据的开销。Impala使用服务的方式避免每次执行查询都需要启动的开销，即相比Hive没了MapReduce启动时间。

使用LLVM产生运行代码，针对特定查询生成特定代码，同时使用Inline的方式减少函数调用的开销，加快执行效率。

充分利用可用的硬件指令（2）。
更好的IO调度，Impala知道数据块所在的磁盘位置能够更好的利用多磁盘的优势，同时Impala支持直接数据块读取和本地代码计算checksum。
通过选择合适的数据存储格式可以得到最好的性能（Impala支持多种存储格式）。
最大使用内存，中间结果不写磁盘，及时通过网络以stream的方式传递。

Impala与Hive的异同

相同点：

数据存储：使用

最低0.47元/天解锁文章

道法—自然

关注

0
点赞
踩
4

收藏

觉得还不错? 一键收藏
0
评论
大数据开发面试：Impala和hive的比较（完整版）

Impala和hive的比较（完整版）Impala是Cloudera公司主导开发的新型查询系统，它提供SQL语义，能查询存储在Hadoop的HDFS和HBase中的PB级大数据。已有的Hive系统虽然也提供了SQL语义，但由于Hive底层执行使用的是MapReduce引擎，仍然是一个批处理过程，难以满足查询的交互性。相比之下，Impala的最大特点也是最大卖点就是它的快速。 Impala相...
复制链接

扫一扫