本 PPT 资料来自于 2018年05月12日在杭州进行的第六次 Spark & Flink Meetup。会议详情请参加《免费活动 | Spark & Flink Meetup 6 @Hangzhou》文章的介绍。
范文臣 Apache Spark Committer, Spark SQL 开发团队的一员。2013年从浙江大学毕业后,一直在进行分布式系统相关的工作。2014年开始接触 Spark,并成为最活跃的代码贡献者之一。2015年正式加入 Databricks,目前在杭州以远程协作的模式参与 Spark,主要是 SQL 模块的开发。
在 Apache Spark 2.0 中,社区扩展了 Apache Spark 中的 DataFrames 和 Datasets 以处理流式数据。 流式数据集不仅为批量和流式数据提供单一编程抽象,而且还支持基于事件时间的处理,无序/延迟数据,会话以及与非流式数据源和接收器的紧密集成。 本文深入地探讨 Structured Streaming 概念、设计详情、容错处理以及 2.3 加入的连续流。
本文 PPT 下载地址:(点击下面阅读原文 即可获取)
https://www.iteblog.com/A_Deep_Dive_into_Structured_Streaming.pdf
http://cdn.iteblog.com/A_Deep_Dive_into_Structured_Streaming.pdf
欢迎关注本公众号:iteblog_hadoop:
0、回复 电子书 获取 本站所有可下载的电子书
3、盘点2017年晋升为Apache TLP的大数据相关项目
5、Apache Spark 黑名单(Blacklist)机制介绍
7、Apache CarbonData里程碑式版本1.3发布,多个重要新特性
8、干货 | Apache Spark 2.0 作业优化技巧
10、干货 | 如何使用功能强大的 Apache Flink SQL
11、更多大数据文章欢迎访问https://www.iteblog.com及本公众号(iteblog_hadoop) 12、Flink中文文档:http://flink.iteblog.com 13、Carbondata 中文文档 : http://flink.iteblog.com