什么是DStream
- Discretized Stream(离散型数据流)是Spark Streaming的基础抽象, 代表持续性的数据流和经过各种Spark算子操作后的结果数据流.
- 在内部实现实现上, DStream是一系列连续的RDD来表示, 每个RDD含有一段时间间隔内的数据(相对于一个算子不同时间段的数据).
- 对数据的操作也是按照RDD为单位来进行的
- Spark Streaming使用数据源产生的数据流创建DStream, 也可以在已有的DStream上使用一些操作来创建新的DStream.
- 它的工作流程像下面的图所示一样,接受到实时数据后, 给数据分批次, 然后传给Spark Engine处理最后生成该批次的结果.