Window Operations on Event Time

最新推荐文章于 2024-08-10 21:38:29 发布

qq_25866555

最新推荐文章于 2024-08-10 21:38:29 发布

阅读量118

点赞数

分类专栏：大数据文章标签： spark 分布式计算大数据

本文链接：https://blog.csdn.net/qq_25866555/article/details/108060105

版权

大数据专栏收录该内容

5 篇文章 0 订阅

订阅专栏

在一个滑动的事件时间上进行聚合操作(spark3.0.0)
完整demo：

package structured_streaming

import java.sql.Timestamp
import java.util.Date

import org.apache.spark.sql.SparkSession
import org.apache.spark.sql.functions.{count, current_timestamp, window}

object WordCount2 {
  def main(args: Array[String]): Unit = {
    System.setProperty("HADOOP_USER_NAME", "hdfs")
    val spark=SparkSession.builder()
      .appName("WordCount")
      .master("local")
      .getOrCreate()

    val socket=spark.readStream.format("socket")
      .option("host","127.0.0.1")
      .option("port","9998")
      .load()
    socket.isStreaming

    import spark.implicits._

    val words=socket.map(row=>(new Timestamp(new Date().getTime),row.getString(0).split(" ")))
    val df=words.toDF("timestamp","word")
    val windowedCounts = df.groupBy(
      window($"timestamp", "10 minutes", "5 minutes"),
      $"word"
    ).count()

    val query =windowedCounts.writeStream
      .outputMode("complete")
      .format("console")
      .start()
    query.awaitTermination()
  }
}

运行结果：

+--------------------+----+-----+
|              window|word|count|
+--------------------+----+-----+
|[2020-08-17 16:55...| [r]|    1|
|[2020-08-17 16:50...| [e]|    2|
|[2020-08-17 16:50...|[aa]|    1|
|[2020-08-17 16:50...|[55]|    1|
|[2020-08-17 17:00...| [r]|    1|
|[2020-08-17 16:45...|[aa]|    1|
|[2020-08-17 16:45...|[55]|    1|
|[2020-08-17 16:55...| [e]|    2|
+--------------------+----+-----+

qq_25866555

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
Window Operations on Event Time

在一个滑动的事件时间上进行聚合操作(spark3.0.0)完整demo：package structured_streamingimport java.sql.Timestampimport java.util.Dateimport org.apache.spark.sql.SparkSessionimport org.apache.spark.sql.functions.{count, current_timestamp, window}object WordCount2 { de
复制链接

扫一扫

专栏目录