从hdfs读取csv文件并转化为hudi表并将元数据同步到hivemetestore

最新推荐文章于 2023-04-25 21:32:18 发布

chriszzww

最新推荐文章于 2023-04-25 21:32:18 发布

阅读量1.3k

点赞数

文章标签： hdfs 大数据 spark

本文链接：https://blog.csdn.net/zhu2525wei/article/details/127515788

版权

spark、hudi

摘要由CSDN通过智能技术生成

1、hadoop-3.2.2、spark-3.2.1-bin-hadoop3.2和apache-hive-3.1.2已经安装好，并且hivemetestore和thrift服务已经启动
2、执行spark shell登录

spark-shell \
  --packages org.apache.hudi:hudi-spark3.2-bundle_2.12:0.12.0 \
  --conf 'spark.serializer=org.apache.spark.serializer.KryoSerializer' \
  --conf 'spark.sql.catalog.spark_catalog=org.apache.spark.sql.hudi.catalog.HoodieCatalog' \
  --conf 'spark.sql.extensions=org.apache.spark.sql.hudi.HoodieSparkSessionExtension'

3、执行从hdfs读取csv文件转换为hudi表

import scala.collection.JavaConversions._
import org.apache.spark.sql.SaveMode._
import org.apache.hudi.DataSourceReadOptions._
import org.apache.hudi.DataSourceWriteOptions._
import org.apache.hudi.config.HoodieWriteConfig._
import spark.implicits._

case class Peoplest(id:Int,name:String,ts:Long,dt:String,hh:String)
val rdd = sc.textFile("/tmp/huditestdata2/Huditestdata.txt",2)
val