Spark中的RDD是什么,有哪些特性?

1).什么是RDD?

       弹式分布数据集(Resilient Distributed Dataset

2).RDD的五大特性?

       1.RDD是由一系列的partition组成的

       2.RDD之间具有依赖关系

       3.RDD作用在partition是上

       4.partition作用在具有(k,v)格式的数据集

       5.partition对外提供最佳计算位置,利于数据本地化的处理

3).Spark RDD需要注意的问题

       1.textFile方法底层封装的是读取方法和MR读取文件的方式一样,读取文件之前先split,默认split大小是一个block大小。

       2.RDD**实际上不存储数据(partition其实也不存储数据),

       3.什么是K,V格式的RDD?

              Ø 如果RDD里面存储的数据都是二元组对象,那么这个RDD我们就叫做K,V格式的RDD。

       4. 哪里体现RDD的弹性(容错)?

              Ø partition数量,可多可少,体现了RDD的弹性。

              Ø RDD之间具有依赖关系,可以基于上一个RDD重新计算出RDD。

       5.哪里体现RDD的分布式?

              Ø RDD是由Partition组成,partition是分布在不同节点上的。

  • 1
    点赞
  • 4
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值