SparkRDD

最新推荐文章于 2024-07-06 17:44:31 发布

karanz

最新推荐文章于 2024-07-06 17:44:31 发布

阅读量146

点赞数 1

分类专栏： spark 文章标签： spark

本文链接：https://blog.csdn.net/baidu_40619129/article/details/104443009

版权

Spark的RDD是分布式数据集，具有弹性、容错性和高效的血缘关系。RDD的特性包括分区、依赖和计算函数。Spark通过内存和磁盘的自动切换以及血缘关系的重计算实现容错。checkpoint用于减少长时间迭代的血缘链长度。transformations算子如map、filter和groupByKey，actions算子如collect、count和saveAsTextFile。RDD的持久化与检查点不同，checkpoint会保存到HDFS，消除血缘关系。

摘要由CSDN通过智能技术生成

Spark为什么比MapReduce快
MapReduce计算中的中间结果是落地到磁盘中的，Spark中的中间结果可以保存在内存中基于内存进行数据交换，但是如果DAG计算模型中有shuffle也是会保存到磁盘的。

RDD叫做分布式数据集，是Spark中最基本的数据抽象，它代表一个不可变、可分区、里面的元素可并行计算的集合。

RDD属性

一组分片（Partition），即数据集的基本组成单位。对于RDD来说，每个分片都会被一个计算任务处理，并决定并行计算的粒度。用户可以在创建RDD时指定RDD的分片个数，如果没有指定，那么就会采用默认值。默认值就是程序所分配到的CPU Core的数目。
一个计算每个分区的函数。Spark中RDD的计算是以分片为单位的，每个RDD都会实现compute函数以达到这个目的。compute函数会对迭代器进行复合，不需要保存每次计算的结果。
RDD之间的依赖关系。RDD的每次转换都会生成一个新的RDD，所以RDD之间就会形成类似于流水线一样的前后依赖关系。在部分分区数据丢失时，Spark可以通过这个依赖关系重新计算丢失的分区数据，而不是对RDD的所有分区进行重新计算。
一个Partitioner，即RDD的分片函数。当前Spark中实现了两种类型的分片函数，一个是基于哈希的HashPartitioner，另外一个是基于范围的RangePartitioner。只有对于于key-value的RDD，才会有Partitioner，非key-value的RDD的Parititioner的值是None。Partitioner函数不但决定了RDD本身的分片数量，也决定了parent RDD Shu

最低0.47元/天解锁文章

karanz

关注

1
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
SparkRDD

RDD叫做分布式数据集，是Spark中最基本的数据抽象，它代表一个不可变、可分区、里面的元素可并行计算的集合。RDD属性一组分片（Partition），即数据集的基本组成单位。对于RDD来说，每个分片都会被一个计算任务处理，并决定并行计算的粒度。用户可以在创建RDD时指定RDD的分片个数，如果没有指定，那么就会采用默认值。默认值就是程序所分配到的CPU Core的数目。一个计算每个分...
复制链接

扫一扫