使用Spark操作Hudi表详细教程_spark读取hudi_sparksql 建hudi内表 load-CSDN博客

本文链接：https://blog.csdn.net/2401_84181731/article/details/137505179

–conf ‘spark.serializer=org.apache.spark.serializer.KryoSerializer’

执行作业前建议导入如下：

import org.apache.hudi.QuickstartUtils._
import scala.collection.JavaConversions._
import org.apache.spark.sql.SaveMode._
import org.apache.hudi.DataSourceReadOptions._
import org.apache.hudi.DataSourceWriteOptions._
import org.apache.hudi.config.HoodieWriteConfig._

插入数据

import org.apache.spark.sql._
import org.apache.spark.sql.types._
val fields = Array(
StructField(“id”, IntegerType, true),
StructField(“name”, StringType, true),
StructField(“price”, DoubleType, true),
StructField(“ts”, LongType, true)
)
val simpleSchema = StructType(fields)
val data = Seq(Row(2, “a2”, 200.0, 100L))
val df = spark.createDataFrame(data, simpleSchema)
df.write.format(“hudi”).
option(PRECOMBINE_FIELD_OPT_KEY, “ts”).
option(RECORDKEY_FIELD_OPT_KEY, “id”).
option(TABLE_NAME, “hudi_mor_tbl_shell”).
option(TABLE_TYPE_OPT_KEY, “MERGE_ON_READ”).
mode(Append).
save(“hdfs:///hudi/hudi_mor_tbl_shell”)

验证：

val df = spark.
read.
format(“hudi”).
load(“hdfs:///hudi/hudi_mor_tbl_shell”)
df.createOrReplaceTempView(“hudi_mor_tbl_shell”)

spark.sql(“select * from hudi_mor_tbl_shell”).show()

普通查询

val df = spark.
read.
format(“hudi”).
load(“hdfs:///hudi/hudi_mor_tbl_shell”)
df.createOrReplaceTempView(“hudi_mor_tbl_shell”)

spark.sql(“select * from hudi_mor_tbl_shell”).show()

增量查询

首先再插入/修改一条数据，参见插入/修改数据。然后执行：

spark.
read.
format(“hudi”).
load(“hdfs:///hudi/hudi_mor_tbl_shell”).
createOrReplaceTempView(“hudi_mor_tbl_shell”)

val commits = spark.sql(“select distinct(_hoodie_commit_time) as commitTime from hudi_mor_tbl_shell order by commitTime desc”).map(k => k.getString(0)).take(50)
val beginTime = commits(commits.length - 1)

val idf = spark.read.format(“hudi”).
option(QUERY_TYPE_OPT_KEY, QUERY_TYPE_INCREMENTAL_OPT_VAL).
option(BEGIN_INSTANTTIME_OPT_KEY, beginTime).
load(“hdfs:///hudi/hudi_mor_tbl_shell”)
idf.createOrReplaceTempView(“hudi_mor_tbl_shell_incremental”)

spark.sql(“select \_hoodie\_commit\_time, id, name, price, ts from hudi_mor_tbl_shell_incremental”).show()

发现只取出了最近插入/修改后的数据。

修改数据

df.write.format(“hudi”).
option(PRECOMBINE_FIELD_OPT_KEY, “ts”).
option(RECORDKEY_FIELD_OPT_KEY, “id”).
option(TABLE_NAME, “hudi_mor_tbl_shell”).
option(TABLE_TYPE_OPT_KEY, “MERGE_ON_READ”).
mode(Append).
save(“hdfs:///hudi/hudi_mor_tbl_shell”)

验证方法使用普通查询。

Insert overwrite

df.write.format(“hudi”).
option(OPERATION.key(),“insert_overwrite”).
option(PRECOMBINE_FIELD.key(), “ts”).
option(RECORDKEY_FIELD.key(), “id”).
option(TBL_NAME.key(), “hudi_mor_tbl_shell”).
option(TABLE_TYPE_OPT_KEY, “MERGE_ON_READ”).
mode(Append).
save(“hdfs:///hudi/hudi_mor_tbl_shell”)

验证方法使用普通查询。发现只有新增的这一条数据。

删除数据

df.write.format(“hudi”).
option(OPERATION_OPT_KEY,“delete”).
option(PRECOMBINE_FIELD_OPT_KEY, “ts”).
option(RECORDKEY_FIELD_OPT_KEY, “id”).
option(TABLE_NAME, “hudi_mor_tbl_shell”).
mode(Append).
save(“hdfs:///hudi/hudi_mor_tbl_shell”)

验证方法使用普通查询。

Spark SQL方式

启动Hudi spark sql的方法：

./spark-sql
–master yarn
–conf ‘spark.serializer=org.apache.spark.serializer.KryoSerializer’
–conf ‘spark.sql.extensions=org.apache.spark.sql.hudi.HoodieSparkSessionExtension’
–conf ‘spark.sql.catalog.spark_catalog=org.apache.spark.sql.hudi.catalog.HoodieCatalog’

如果使用Hudi的版本为0.11.x，需要执行：

./spark-sql
–master yarn
–conf ‘spark.serializer=org.apache.spark.serializer.KryoSerializer’
–conf ‘spark.sql.extensions=org.apache.spark.sql.hudi.HoodieSparkSessionExtension’

创建表：

create table hudi_mor_tbl (
id int,
name string,
price double,
ts bigint
) using hudi
tblproperties (
type = ‘mor’,
primaryKey = ‘id’,
preCombineField = ‘ts’
)
location ‘hdfs:///hudi/hudi_mor_tbl’;

验证：

show tables;