(Resilient Distributed Dateset),弹性分布式数据集
1. RDD由一系列的partition组成,有多少个partition就有多少个task;
2. 函数作用在每个partition(split)上;
3. RDD有一系列的依赖关系; 子RDD的数据来源为父RDD
4. 分区器作用在(K,V)键值对的RDD上;
5. RDD提供一系列的最佳计算位置
注意:
textFile方法底层封装的是读取MR读取文件的方式,读取文件之前先split,默认split大小是一个block大小。
什么是K,V格式的RDD?
如果RDD里面存储的数据都是二元组对象,那么这个RDD我们就叫做K,V格式的RDD。
哪里体现RDD的弹性(容错)?
partition数量,大小没有限制,体现了RDD的弹性。
RDD之间依赖关系,可以基于上一个RDD重新计算出RDD。
哪里体现RDD的分布式?
RDD是由Partition组成,partition是分布在不同节点上的。
RDD提供计算最佳位置,体现了数据本地化。体现了大数据中“计算移动数据不移动”的理念。