Impala中的invalidate metadata 和refrsh

最新推荐文章于 2024-03-08 20:00:00 发布

MrZhangBaby

最新推荐文章于 2024-03-08 20:00:00 发布

阅读量1k

点赞数 1

分类专栏：谈笑间学会大数据 Hive 文章标签：大数据 hadoop hive impala

本文链接：https://blog.csdn.net/MrZhangBaby/article/details/108322152

版权

Impala中的invalidate metadata 和refrsh

Impala是啥子？

Impala是基于Hive的大数据实时分析查询引擎，直接使用Hive的元数据库Metadata,意味着impala元数据都存储在Hive的metastore中。并且impala兼容Hive的sql解析，实现了Hive的SQL语义的子集，功能还在不断的完善中。

Impala的优点有哪些？

Impala不需要把中间结果写入磁盘，省掉了大量的I/O开销。
省掉了MapReduce作业启动的开销。MapReduce启动task的速度很慢（默认每个心跳间隔是3秒钟），Impala直接通过相应的服务进程来进行作业调度，速度快了很多。
Impala完全抛弃了MapReduce这个不太适合做SQL查询的范式，而是像Dremel一样借鉴了MPP并行数据库的思想另起炉灶，因此可做更多的查询优化，从而省掉不必要的shuffle、sort等开销。
通过使用LLVM来统一编译运行时代码，避免了为支持通用编译而带来的不必要开销。
用C++实现，做了很多有针对性的硬件优化，例如使用SSE指令。
使用了支持Data locality的I/O调度机制，尽可能地将数据和计算分配在同一台机器上进行，减少了网络开销。

Impala功能有哪些？

Impala可以根据Apache许可证作为开源免费提供。
Impala支持内存中数据处理，它访问/分析存储在Hadoop数据节点上的数据，而无需数据移动。
使用类SQL查询访问数据。
Impala为HDFS中的数据提供了更快的访问。
可以将数据存储在Impala存储系统中，如Apache HBase和Amazon s3。
Impala支持各种文件格式，如LZO，序列文件，Avro，RCFile和Parquet。

Impala与Hive有什么关系?

Impala 与Hive都是构建在Hadoop之上的数据查询工具各有不同的侧重适应面，但从客户端使用来看Impala与Hive有很多的共同之处，如数据表元数据、ODBC/JDBC驱动、SQL语法、灵活的文件格式、存储资源池等。Impala与Hive在Hadoop中的关系如下图所示。Hive适合于长时间的批处理查询分析，而Impala适合于实时交互式SQL查询，Impala给数据分析人员提供了快速实验、验证想法的大数据分析工具。可以先使用hive进行数据转换处理，之后使用Impala在Hive处理后的结果数据集上进行快速的数据分析。

最低0.47元/天解锁文章

MrZhangBaby

关注

1
点赞
踩
3

收藏

觉得还不错? 一键收藏
打赏
0
评论
Impala中的invalidate metadata 和refrsh

Impala中的invalidate metadata 和refrshimpala是啥子？Impala是基于Hive的大数据实时分析查询引擎，直接使用Hive的元数据库Metadata,意味着impala元数据都存储在Hive的metastore中。并且impala兼容Hive的sql解析，实现了Hive的SQL语义的子集，功能还在不断的完善中。Impala与Hive有什么关系?Impala 与Hive都是构建在Hadoop之上的数据查询工具各有不同的侧重适应面，但从客户端使用来看Impala与Hi
复制链接

扫一扫