Flink1.10集成Hive快速入门

最新推荐文章于 2025-05-09 18:24:41 发布

大数据技术与数仓

最新推荐文章于 2025-05-09 18:24:41 发布

阅读量2.3k

点赞数 1

分类专栏： Flink 文章标签： flink

本文链接：https://blog.csdn.net/jmx_bigdata/article/details/105244676

版权

本文介绍了如何在Flink 1.10中集成Hive，包括添加依赖、构建程序和使用Flink SQL Client配置HiveCatalog。通过实操演示，展示了如何解决HiveTableSink不支持流式写入的问题，并提供了启动Flink SQL CLI执行SQL命令的步骤。文章最后对Flink未来对Hive的支持表达了期待。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

Hive 是大数据领域最早出现的 SQL 引擎，发展至今有着丰富的功能和广泛的用户基础。之后出现的 SQL 引擎，如 Spark SQL、Impala 等，都在一定程度上提供了与 Hive 集成的功能，从而方便用户使用现有的数据仓库、进行作业迁移等。

Flink从1.9开始支持集成Hive，不过1.9版本为beta版，不推荐在生产环境中使用。在最新版Flink1.10版本，标志着对 Blink的整合宣告完成，随着对 Hive 的生产级别集成，Hive作为数据仓库系统的绝对核心，承担着绝大多数的离线数据ETL计算和数据管理，期待Flink未来对Hive的完美支持。

而 HiveCatalog 会与一个 Hive Metastore 的实例连接，提供元数据持久化的能力。要使用 Flink 与 Hive 进行交互，用户需要配置一个 HiveCatalog，并通过 HiveCatalog 访问 Hive 中的元数据。

添加依赖

要与Hive集成，需要在Flink的lib目录下添加额外的依赖jar包，以使集成在Table API程序或SQL Client中的SQL中起作用。或者，可以将这些依赖项放在文件夹中，并分别使用Table API程序或SQL Client 的-C 或-l选项将它们添加到classpath中。本文使用第一种方式，即将jar包直接复制到$FLINK_HOME/lib目录下。本文使用的Hive版本为2.3.4(对于不同版本的Hive，可以参照官网选择不同的jar包依赖)，总共需要3个jar包，如下：

flink-connector-hive_2.11-1.10.0.jar
flink-shaded-hadoop-2-uber-2.7.5-8.0.jar
hive-exec-2.3.4.jar

其中hive-exec-2.3.4.jar在hive的lib文件夹下，另外两个需要自行下载，下载地址：flink-connector-hive_2.11-1.10.0.jar，flink-shaded-hadoop-2-uber-2.7.5-8.0.jar
在这里插入图片描述

切莫拔剑四顾心茫然，话不多说，直接上代码。

构建程序

添加Maven依赖

<!-- Flink Dependency -->
<dependency>
  <groupId>org.apache.flink</groupId>
  <artifactId>flink-connector-hive_2.11</artifactId>
  <version>1.10.0</version>
  <scope>provided</scope>
</dependency>

<dependency>
  <group

最低0.47元/天解锁文章