网上学习资料一大堆,但如果学到的知识不成体系,遇到问题时只是浅尝辄止,不再深入研究,那么很难做到真正的技术提升。
一个人可以走的很快,但一群人才能走的更远!不论你是正从事IT行业的老鸟或是对IT行业感兴趣的新人,都欢迎加入我们的的圈子(技术交流、学习资源、职场吐槽、大厂内推、面试辅导),让我们一起学习成长!
Impalad是Impala的核心进程,运行在所有的数据节点上,可以读写数据,并接收客户端的查询请求,并行执行来自集群中其他节点的查询请求,将中间结果返回给调度节点。调用节点将结果返回给客户端。用户在Impala集群上的某个节点提交数据处理请求 则该节点称为coordinator node(协调器节点),其他的集群节点传输其中的处理的部分数据到该coordinator node,coordinator node负责构建最终的结果数据返回给用户。
Impala 支持在提交任务的时候(采用JDBC ,ODBC 方式) 采用round-robin算法来实现负载均衡,将任务提交到不同的节点上
Impalad 进程通过持续的和statestore 通信来确认自己所在的节点是否健康 和是否可以接受新的任务请求
- Impala Statestore(主要优化点,线程数)
状态管理进程,定时检查The Impala Daemon的健康状况,协调各个运行Impalad的实例之间的信息关系,Impala正是通过这些信息去定位查询请求所要的数据,进程名叫作 statestored,在集群中只需要启动一个这样的进程,如果Impala节点由于物理原因、网络原因、软件原因或者其他原因而下线,Statestore会通知其他节点,避免查询任务分发到不可用的节点上。
- Impala Catalog Service(元数据管理和元存储)
元数据管理服务,进程名叫做catalogd,将数据表变化的信息分发给各个进程。接收来自statestore的所有请求 ,每个Impala节点在本地缓存所有元数据。 当处理极大量的数据和/或许多分区时,获得表特定的元数据可能需要大量的时间。 因此,本地存储的元数据缓存有助于立即提供这样的信息。当表定义或表数据更新时,其他Impala后台进程必须通过检索最新元数据来更新其元数据缓存,然后对相关表发出新查询。
- 其他组件列表
Impala client:将HiveQL请求送给Impalad,并等待结果返回给用户
Impalad:
Planner > FE(JAVA):负责解析查询请求,并生成执行计划树(Query Plan Tree)。
Coordinator > BE(C++):拆解请求(Fragment),负责定位数据位置,并发送请求到Exec Engine,汇聚请求结果上报。
Exec Engine > BE(C++):执行Fragment子查询,比如scan,Aggregation,Merge etc。
statestore server:维护Impalad的伙伴关系,负责通知伙伴关系变化,类似于仪表盘的zk的故障监控功能。
meta server:
Hive Meta Storage:用户维护表的schema信息等元数据(存在于一个关系型数据库)。
NameNode of HDFS:用于定位hdfs的数据位置。
HMaster of HBase:用于定位HBase的数据的位置。
storage server:
HDFS:HDFS的DataNode服务。
HBASE:HBase的RegionServer服务。
四、Impala的优缺点
- Impala的优点
-
Impala不需要把中间结果写入磁盘,省掉了大量的I/O开销。
-
省掉了MapReduce作业启动的开销。MapReduce启动task的速度很慢(默认每个心跳间隔是3秒钟),Impala直接通过相应的服务进程来进行作业调度,速度快了很多。
-
Impala完全抛弃了MapReduce这个不太适合做SQL查询的范式,而是像Dremel一样借鉴了MPP并行数据库的思想另起炉灶,因此可做更多的查询优化,从而省掉不必要的shuffle、sort等开销。
-
通过使用LLVM来统一编译运行时代码,避免了为支持通用编译而带来的不必要开销。
-
用C++实现,做了很多有针对性的硬件优化,例如使用SSE指令。
-
使用了支持Data locality的I/O调度机制,尽可能地将数据和计算分配在同一台机器上进行,减少了网络开销
- Impala的缺点
-
Impala不提供任何对序列化和反序列化的支持。
-
Impala只能读取文本文件,而不能读取自定义二进制文件。
-
每当新的记录/文件被添加到HDFS中的数据目录时,该表需要被刷新
五、Impala的功能
1.Impala可以根据Apache许可证作为开源免费提供。
2.Impala支持内存中数据处理,它访问/分析存储在Hadoop数据节点上的数据,而无需数据移动。
3.Impala为HDFS中的数据提供了更快的访问。
4.可以将数据存储在Impala存储系统中,如Apache HBase和Amazon s3。
5.Impala支持各种文件格式,如LZO,序列文件,Avro,RCFile和Parquet。
6.使用Impala,您可以使用传统的SQL知识以极快的速度处理存储在HDFS中的数据。
7.由于在数据驻留(在Hadoop集群上)时执行数据处理,因此在使用Impala时,不需要对存储在Hadoop上的数据进行数据转换和数据移动。
8.使用Impala,您可以访问存储在HDFS,HBase和Amazon s3中的数据,而无需了解Java(MapReduce作业)。您可以使用SQL查询的基本概念访问它们。
9.为了在业务工具中写入查询,数据必须经历复杂的提取 - 变换负载(ETL)周期。但是,使用Impala,此过程缩短了。加载和重组的耗时阶段通过新技术克服,如探索性数据分析和数据发现,使过程更快。
六、Hive、SparkSQL、Impala性能对比
参照cloudera公司做的性能基准对比测试,所有测试都运行在一个完全相同的21节点集群上,每个节点只配有64G内存。之所以内存不配大,就是为了消除人们对于Impala只有在非常大的内存上才有好性能的错误认识。
配置:
- 双物理CPU,每个12核,Intel Xeon CPU E5-2630L 0 at 2.00GHz
- 12个磁盘驱动器,每个磁盘932G,1个用作OS,其它用作HDFS
- 每节点64G内存
对比产品:
- Impala
既有适合小白学习的零基础资料,也有适合3年以上经验的小伙伴深入学习提升的进阶课程,涵盖了95%以上大数据知识点,真正体系化!
由于文件比较多,这里只是将部分目录截图出来,全套包含大厂面经、学习笔记、源码讲义、实战项目、大纲路线、讲解视频,并且后续会持续更新
%以上大数据知识点,真正体系化!**
由于文件比较多,这里只是将部分目录截图出来,全套包含大厂面经、学习笔记、源码讲义、实战项目、大纲路线、讲解视频,并且后续会持续更新