SparkStreaming+kafka 外部数据源保存offset实例（MySQL）

最新推荐文章于 2023-05-16 16:20:20 发布

kaloKu

最新推荐文章于 2023-05-16 16:20:20 发布

阅读量391

点赞数

分类专栏： Spark

本文链接：https://blog.csdn.net/qq_31622585/article/details/94394340

版权

本文介绍了如何在SparkStreaming中结合Kafka，利用MySQL存储消费的offset，确保数据仅处理一次。首先在MySQL创建存储offset的表格，接着引入必要的Maven依赖。实现思路是通过自定义工具类和配置文件来管理和读取offset。具体代码包括SparkStreaming的主体部分、ValueUtils工具类、application.conf配置和自定义kafka producer。在测试过程中，通过启动kafka服务，产生并消费数据，观察MySQL中offset表的变化，验证了offset的正确保存和读取。

摘要由CSDN通过智能技术生成

MySQL创建存储offset的表格

mysql> use test
mysql> create table hlw_offset(
        topic varchar(32),
        groupid varchar(50),
        partitions int,
        fromoffset bigint,
        untiloffset bigint,
        primary key(topic,groupid,partitions)
        );

Maven依赖包

<scala.version>2.11.8</scala.version>
<spark.version>2.3.1</spark.version>
<scalikejdbc.version>2.5.0</scalikejdbc.version>
--------------------------------------------------
<dependency>
    <groupId>org.scala-lang</groupId>
    <artifactId>scala-library</artifactId>
    <version>${
   scala.version}</version>
</dependency>
<dependency>
    <groupId>org.apache.spark</groupId>
    <artifactId>spark-core_2.11</artifactId>
    <version>${
   spark.version}</version>
</dependency>
<dependency>
    <groupId>org.apache.spark</groupId>
    <artifactId>spark-sql_2.11</artifactId>
    <version>${
   spark.version}</version>
</dependency>
<dependency>
    <groupId>org.apache.spark</groupId>
    <artifactId>spark-streaming_2.11</artifactId>
    <version>${
   spark.version}</version>
</dependency>
<dependency>
    <groupId>org.apache.spark</groupId>
    <artifactId>spark-streaming-kafka-0-8_2.11</artifactId>
    <version>${
   spark.version}</version>
</dependency>
<dependency>
    <groupId>mysql</groupId>
    <artifactId>mysql-connector-java</artifactId>
    <version>5.1.27</version>
</dependency>
<!-- https://mvnrepository.com/artifact/org.scalikejdbc/scalikejdbc -->
<dependency>
    <groupId>org.