1).什么是RDD?
弹式分布数据集(Resilient Distributed Dataset)
2).RDD的五大特性?
1.RDD是由一系列的partition组成的
2.RDD之间具有依赖关系
3.RDD作用在partition是上
4.partition作用在具有(k,v)格式的数据集
5.partition对外提供最佳计算位置,利于数据本地化的处理
3).Spark RDD需要注意的问题
1.textFile方法底层封装的是读取方法和MR读取文件的方式一样,读取文件之前先split,默认split大小是一个block大小。
2.RDD**实际上不存储数据(partition其实也不存储数据),
3.什么是K,V格式的RDD?
Ø 如果RDD里面存储的数据都是二元组对象,那么这个RDD我们就叫做K,V格式的RDD。
4. 哪里体现RDD的弹性(容错)?
Ø partition数量,可多可少,体现了RDD的弹性。
Ø RDD之间具有依赖关系,可以基于上一个RDD重新计算出RDD。
5.哪里体现RDD的分布式?
Ø RDD是由Partition组成,partition是分布在不同节点上的。