Spark Streaming总结

本文深入探讨Spark Streaming的本质,阐述其与Spark Core的关系,详细解析Spark Streaming的系统架构,包括系统组件、作业提交流程及窗口操作,并分析了Spark Streaming的容错机制,特别是Worker和Driver的容错策略。
摘要由CSDN通过智能技术生成

一、本质

Spark Streaming是Spark核心API的一个扩展,可以实现高吞吐量的、具备容错机制的实时流数据的处理

二、Spark Streaming和Spark Core

2.1 逻辑关系:

2.2 物理关系:

1) DStream:Spark Streaming提供了表示连续数据流的、高度抽象的被称为离散流的DStream

2) 任何对DStream的操作都会转变为对底层RDD的操作。

2.3 算子关系:

1) Spark Streaming 算子分为TransformationOutput

2) Transformation包括Spark中的Transform和部分的Action(Reduce、Count等)

3) Output:

• Print

• saveAsObjectFile、saveAsTextFile、saveAsHadoopFiles:将一批数据输出到Hadoop文件系统中,用批量数据的开始时间戳来命名

• forEachRDD:允许用户对DStream的每一批量数据对应的RDD本身做任意操作

2.4 DAG和DStream Gra

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值