大数据最佳实践-基于Spark的ETL开发

本文介绍了使用Spark进行大数据ETL处理的最佳实践,包括RDBMS到RDBMS、Hive到Hive、RDBMS到Hive、Hive到RDBMS的数据同步,以及HDFS数据监控和文件到HBase的同步操作。
摘要由CSDN通过智能技术生成

数据同步 RDMBS to RDMBS

package com.sutpc.bigdata.sync

import java.util.Properties

import org.apache.log4j.{
   Level, Logger}
import org.apache.spark.sql.SparkSession

/**
  * <p>Description:TODO  </p>
  * <p>Copyright: Copyright (c) 2019</p>
  * <p>Company: 深圳市城市交通规划研究中心</p>
  *
  * @author zhangyongtian
  * @version 1.0.0
  *          date 2019/10/18  9:50
  */
object DataSync {
   

  def main(args: Array[String]): Unit = {
   

    val app = s"${this.getClass.getSimpleName}".filter(!_.equals('$'))

    Logger.getLogger("org").setLevel(Level.ERROR)


    val spark: SparkSession = SparkSession.builder
      .appName(app)
      .master("local[*]")
      .config("spark.shuffle.consolidateFiles", "true")
      .config("spark.serializer", "org.apache.spark.serializer.KryoSerializer")
      .config("spark.streaming.kafka.maxRatePerPartition", "500")
      .config("spark.streaming.stopGracefullyOnShutdown", "true")
      .config("spark.network.timeout", "600")
      .config("spark.streaming.kafka.consumer.poll.ms", "60000")
      .config("spark.core.connection.ack.wait.timeout", "900")
      .config("spark.rpc.message.maxSize", "50")
      .config("spark.akka.timeout", "900")
      .getOrCreate()

    //数据源
    val transpass_url = s"jdbc:postgresql://10.10.201.28:5432/postgres"
    val transpass_prop = new Properties()
    transpass_prop.put("user", "postgres")
    transpass_prop.put("password", "123456")
    transpass_prop.put("driver", "org.postgresql.Driver")

    //目标 5432
    val key_url = s"jdbc:postgresql://10.10.201.50:54320/vehicle"
    val key_prop = new Properties()
    key_prop.put("user", "postgres")
    key_prop.put("password", "123456")
    key_prop.put("driver", "org.postgresql.Driver")

    import spark.implicits._
    spark.read.jdbc(transpass_url, "public.huangpu_road", transpass_prop).write.jdbc(key_url, "public.huangpu_road", key_prop)


  }

}

数据同步 Hive to Hive

object SparkHive2Hive {
   

  def main(args: Array[String]): Unit = {
   
    val startTime = DateTime.now()

    val app = s"${this.getClass.getSimpleName}".filter(!_.equals('$'))

    Logger.getLogger("org").setLevel(Level.ERROR)


    //TODO:spark初始化
    val spark = SparkSession
      .builder()
      .master("local[*]")
      .appName(app)
      .config("spark.sql.parquet.writeLegacyFormat", true)
      //      .enableHiveSupport()
      .getOrCreate()

    //      .write.json("/import/transpaas_data/t_phone_home_distribute_json")

    //hive强制分桶
    //    spark.sql("set hive.enforce.bucketing=true")
    //    spark.sqlContext.setConf("spark.sql.hive.convertMetastoreParquet", "false")
    //    spark.read.json("/import/transpaas_data/t_phone_home_distribute_json")


    //开启动态分区
    //    spark.sql("set hive.exec.dynamic.partition.mode=nonstrict")
    spark.sql("set spark.hadoop.hive.exec.dynamic.partition.mode=nonstrict")
    spark.read.parquet("/import/transpaas_data/t_phone_home_distribute")
      .write
      .mode("append")
      .format("Hive")
      .partitionBy("source", "city", "year", "month", "day")
      .saveAsTable("transpaas_tag.t_phone_home_distribute")

    spark.sql("set spark.hadoop.hive.exec.dynamic.partition.mode=nonstrict")
    spark.read.parquet("/import/transpaas_data/t_phone_home_work_rela")
      .write
      .mode("append")
      .format("Hive")
      .partitionBy("source", "year", "month", "day")
      .saveAsTable("transpaas_tag.t_phone_home_work_rela")

    spark.sql("set spark.hadoop.hive.exec.dynamic.partition.mode=nonstrict")
    spark.read.parquet("/import/transpaas_data/t_phone_home_work_rela")
      .write
      .mode("append")
      .format("Hive")
      .partitionBy("source", "year", "month", "day")
      .saveAsTable("transpaas_tag.t_phone_home_work_rela")

    spark.sql("set spark.hadoop.hive.exec.dynamic.partition.mode=nonstrict")
    spark.read.parquet("/import/transpaas_data/t_phone_work_distribute")
      .write
      .mode
  • 0
    点赞
  • 2
    收藏
    觉得还不错? 一键收藏
  • 打赏
    打赏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

猿与禅

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值