SPARK

最新推荐文章于 2025-04-22 11:39:47 发布

Gae Immortal

最新推荐文章于 2025-04-22 11:39:47 发布

阅读量316

点赞数 5

文章标签： spark

本文链接：https://blog.csdn.net/2502_90678279/article/details/147277448

版权

Spark-SQL连接Hive

Apache Hive 是 Hadoop 上的 SQL 引擎，Spark SQL 编译时可以包含 Hive 支持，也可以不包含。包含 Hive 支持的 Spark SQL 可以支持 Hive 表访问、UDF (用户自定义函数)、Hive 查询语言（HQL）等。需要强调的一点是，如果要在 Spark SQL 中包含Hive 的库，并不需要事先安装 Hive。一般来说，最好还是在编译 Spark SQL 时引入 Hive支持，这样就可以使用这些特性了。

使用方式分为内嵌Hive、外部Hive、Spark-SQL CLI、Spark beeline 以及代码操作。

内嵌的 HIVE

如果使用 Spark 内嵌的 Hive, 则什么都不用做, 直接使用即可。但是在实际生产活动当中，几乎没有人去使用内嵌Hive这一模式。

数据加载与保存：

通用方式：

SparkSQL 提供了通用的保存数据和数据加载的方式。这里的通用指的是使用相同的API，根据不同的参数读取和保存不同格式的数据，SparkSQL 默认读取和保存的文件格式为parquet

df.write.save 是保存数据的通用方法。如果保存不同格式的数据，可以对不同的数据格式进行设定。

df.write.format("…")[.option("…")].save("…")

➢ format("…")：指定保存的数据类型，包括"csv"、"jdbc"、"json"、"orc"、"parquet"和

"textFile"。

➢ save ("…")：在"csv"、"orc"、"parquet"和"textFile"格式下需要传入保存数据的路径。

➢ option("…")：在"jdbc"格式下需要传入 JDBC 相应参数，url、user、password 和 dbtable