scala代码整理- sparkStream消费kafka数据代码

最新推荐文章于 2024-07-10 17:19:01 发布

荩辞

最新推荐文章于 2024-07-10 17:19:01 发布

阅读量452

点赞数

分类专栏：代码整理文章标签： scala

本文链接：https://blog.csdn.net/zlmldylinke/article/details/115492016

版权

代码整理专栏收录该内容

2 篇文章 0 订阅

订阅专栏

pom-xml 配置

        <dependency>
            <groupId>org.apache.spark</groupId>
            <artifactId>spark-streaming_2.12</artifactId>
        </dependency>

        <dependency>
            <groupId>org.apache.kafka</groupId>
            <artifactId>kafka-clients</artifactId>
            <version>2.4.1</version>
        </dependency>

        <dependency>
            <groupId>org.apache.spark</groupId>
            <artifactId>spark-streaming-kafka-0-10_2.12</artifactId>
            <!--spark-streaming里面包含kafka-clients-->
        </dependency>

scala代码

//import java.util.Properties

import org.apache.kafka.clients.consumer.ConsumerRecord
import org.apache.kafka.common.serialization.StringDeserializer
import org.apache.spark.streaming.StreamingContext
import org.apache.spark.streaming.dstream.InputDStream
import org.apache.spark.streaming.kafka010.{ConsumerStrategies, KafkaUtils, LocationStrategies}

/**
 * @subject
 * @author internationale
 * @create 2021-03-30-17:35    
 */
object MyKafkaUtil {
  //1.创建配置信息对象
  //private val properties: Properties = PropertiesUtil.load("config.properties")

  //2.用于初始化链接到集群的地址
  ///*private*/ val broker_list: String = properties.getProperty("kafka.broker.list")
val broker_list: String = "hadoop102:9092"
  //3.kafka消费者配置  -- todo ??
  val kafkaParam = Map(
    "bootstrap.servers" -> broker_list,
    // todo 生产者 序列化 消费者 反序列化
    "key.deserializer" -> classOf[StringDeserializer],
    "value.deserializer" -> classOf[StringDeserializer],
    //消费者组
    "group.id" -> "bigdata1109",
    //如果没有初始化偏移量或者当前的偏移量不存在任何服务器上，可以使用这个配置属性
    //可以使用这个配置，latest自动重置偏移量为最新的偏移量
    "auto.offset.reset" -> "latest",
    //如果是true，则这个消费者的偏移量会在后台自动提交,但是kafka宕机容易丢失数据
    //如果是false，会需要手动维护kafka偏移量
    "enable.auto.commit" -> (true: java.lang.Boolean)
  )

  // 创建DStream，返回接收到的输入数据
  // LocationStrategies：根据给定的主题和集群地址创建consumer
  // LocationStrategies.PreferConsistent：持续的在所有Executor之间分配分区
  // ConsumerStrategies：选择如何在Driver和Executor上创建和配置Kafka Consumer
  // ConsumerStrategies.Subscribe：订阅一系列主题
  def getKafkaStream(topic: String, ssc: StreamingContext): InputDStream[ConsumerRecord[String, String]] = {

    val dStream: InputDStream[ConsumerRecord[String, String]] = KafkaUtils.createDirectStream[String, String](
      ssc,
      LocationStrategies.PreferConsistent,
      ConsumerStrategies.Subscribe[String, String](Array(topic), kafkaParam))

    dStream
  }

}

荩辞

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
scala代码整理- sparkStream消费kafka数据代码

pom-xml 配置 <dependency> <groupId>org.apache.spark</groupId> <artifactId>spark-streaming_2.12</artifactId> </dependency> <dependency> <groupId>org
复制链接

扫一扫