干货 | 深入理解 Spark Structured Streaming

最新推荐文章于 2022-05-27 21:53:38 发布

Hadoop技术博文

最新推荐文章于 2022-05-27 21:53:38 发布

阅读量1.1k

点赞数

本 PPT 资料来自于 2018年05月12日在杭州进行的第六次 Spark & Flink Meetup。会议详情请参加《免费活动 | Spark & Flink Meetup 6 @Hangzhou》文章的介绍。

范文臣 Apache Spark Committer, Spark SQL 开发团队的一员。2013年从浙江大学毕业后，一直在进行分布式系统相关的工作。2014年开始接触 Spark，并成为最活跃的代码贡献者之一。2015年正式加入 Databricks，目前在杭州以远程协作的模式参与 Spark，主要是 SQL 模块的开发。

在 Apache Spark 2.0 中，社区扩展了 Apache Spark 中的 DataFrames 和 Datasets 以处理流式数据。流式数据集不仅为批量和流式数据提供单一编程抽象，而且还支持基于事件时间的处理，无序/延迟数据，会话以及与非流式数据源和接收器的紧密集成。本文深入地探讨 Structured Streaming 概念、设计详情、容错处理以及 2.3 加入的连续流。

本文 PPT 下载地址：(点击下面阅读原文即可获取)

https://www.iteblog.com/A_Deep_Dive_into_Structured_Streaming.pdf

http://cdn.iteblog.com/A_Deep_Dive_into_Structured_Streaming.pdf

猜你喜欢

欢迎关注本公众号：iteblog_hadoop:

0、回复 电子书 获取 本站所有可下载的电子书

1、Apache Spark 统一内存管理模型详解

2、HDFS 副本存放磁盘选择策略详解

3、盘点2017年晋升为Apache TLP的大数据相关项目

4、干货 | Spark SQL：过去，现在以及未来

5、Apache Spark 黑名单(Blacklist)机制介绍

6、Kafka 在华泰证券的探索与实践