大数据最新大数据技术入门:impala查询引擎(1),2024年最新大数据开发开发基础入门

img
img
img

既有适合小白学习的零基础资料,也有适合3年以上经验的小伙伴深入学习提升的进阶课程,涵盖了95%以上大数据知识点,真正体系化!

由于文件比较多,这里只是将部分目录截图出来,全套包含大厂面经、学习笔记、源码讲义、实战项目、大纲路线、讲解视频,并且后续会持续更新

需要这份系统化资料的朋友,可以戳这里获取

===================================================================

  • 基于内存进行计算(即计算过程中没有中间数据落盘),能够对 PB 级数据进行交互式实时查询、分析

  • 无需转换为 MR,直接读取 HDFS 及 Kudu 数据 ,从而大大降低了延迟。

  • Impala 没有 MapReduce批处理,而是通过使用与商用并行关系数据库中类似的分布式查询引擎(由 Query Planner、Query Coordinator 和Query Exec Engine 三部分组成)

  • 前端 java、后端 C++ 编写,使用 LLVM 框架统一编译运行(区别于 GCC)

  • 兼容 HiveSQL

  • 支持 Hive 基本的一些查询等,Hive 中的一些复杂结构是不支持的

  • 具有数据仓库的特性,可对 Hive 数据直接做数据分析

三、功能特性

===================================================================

  • Impala支持内存中数据处理,它访问/分析存储在Hadoop数据节点上的数据,而无需数据移动。

  • 使用类SQL查询访问数据。

  • Impala为HDFS中的数据提供了更快的访问。

  • 可以将数据存储在Impala存储系统中,如Apache HBase和Amazon s3。

  • Impala支持各种文件格式,如LZO,序列文件,Avro,RCFile和Parquet。

四、Impala 工作原理

==========================================================================

在这里插入图片描述

Impalad:

Impala 核心组件,运行在各个数据节点上面, 守护进程 Impala daemon,它负责接收从 impala-shell、Hue、JDBC、ODBC 等接口发送的查询语句,解析 SQL 语句并执行查询任务,任务完成返回结果给到客户端。Impalad 内部是由 Query Planner、Query Coordinator 和 Query Executor 三部分组成:。

State Store:

负责检查集群各个节点上 Impala daemon 的健康状态,同时不间断地将结果反馈给各个 Impala daemon。守护进程 :statestored,整个集群只运行一个进程。

Catalogd

负责元数据管理,可以从 Hive 元数据库中提取更新元数据给其他组件,也能将元数据变化通知给集群的各个节点,

五、日常运维指令

=====================================================================

连接 Impala


impala-shell  -i data -s xxx -d rawdata -k




-d:指定数据库登录

-i:指定 impalad 登录,这个一般在 元数据节点连接 impala 的时候,要指定

-k:如果启用 kerberos,则需要指定

-s:指定 kerberos 登录的账号,如果不指定,默认账号是 “impala” ,如果混部 kerberos 场景下,客户给我们的 principal 是 sa_cluster,那就要指定 -s 为 sa_cluster

-q:直接执行 sql 语句,不用进入  impala-shell 环境

-o:查询结果输出到指定文件



在这里插入图片描述

img
img
img

既有适合小白学习的零基础资料,也有适合3年以上经验的小伙伴深入学习提升的进阶课程,涵盖了95%以上大数据知识点,真正体系化!

由于文件比较多,这里只是将部分目录截图出来,全套包含大厂面经、学习笔记、源码讲义、实战项目、大纲路线、讲解视频,并且后续会持续更新

需要这份系统化资料的朋友,可以戳这里获取

、学习笔记、源码讲义、实战项目、大纲路线、讲解视频,并且后续会持续更新**

需要这份系统化资料的朋友,可以戳这里获取

  • 5
    点赞
  • 5
    收藏
    觉得还不错? 一键收藏
  • 1
    评论
大数据开发工程师需要掌握以下知识: 1. 大数据技术栈:熟悉Hadoop、Spark、Flink等大数据处理框架,了解它们的原理和使用方式。 2. 数据存储和处理:掌握分布式文件系统(如HDFS)、NoSQL数据库(如HBase、Cassandra)、列式数据库(如Hive、Impala)等数据存储和处理技术。 3. 数据清洗和处理:熟悉ETL(Extract-Transform-Load)过程,了解数据清洗、转换和加载的常用工具和技术。 4. 分布式计算:了解分布式计算的基本概念和原理,掌握分布式计算框架(如MapReduce、Spark)的使用。 5. 数据可视化:熟悉数据可视化工具(如Tableau、Power BI)的使用,能够将处理后的数据以直观的方式展示。 6. 数据安全和隐私保护:了解数据安全和隐私保护的基本原理和方法,熟悉常见的数据安全技术。 7. 编程语言:熟练掌握至少一门编程语言,如Java、Python或Scala,能够使用它们进行大数据开发。 8. 数据挖掘和机器学习:了解基本的数据挖掘和机器学习算法,能够使用相关工具进行数据挖掘和模型构建。 9. 数据仓库设计和建模:了解数据仓库设计的基本原理和方法,掌握数据建模工具和技术。 10. 高可用和容错性:了解大数据系统的高可用性和容错性设计,能够进行故障排除和性能优化。 这些是大数据开发工程师应该掌握的基本知识,不同公司和项目可能还有一些特定的需求,需要根据实际情况做进一步的学习和了解。

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论 1
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值