spark中RDD,DataSet,DataFrame的区别

接触到spark不可避免的会接触spark的Api;

          rdd,DataFrame,DataSet,

接下来就大致说一下他们的有点以及各自的区别;

首先DataFrame,DataSet是基于RDD之上的,而且可以通过简单的api调用进行无缝切换。

RDD的优点;

1;相对比与传统的MapReduce框架,spark的RDD中内置了很多函数操作,map,flatMap,filter等算子,方便处理结构化和非结构化的数据。

2;面向对象编程,直接存储java对象,类型转化也很安全。

RDD的缺点;

1;存在大量的序列化和反序列化的性能开销,因为无论是集群间通信还是IO操作都是需要进行序列化和反序列化的。

2;并没有对特殊场景进行优化,比如对于结构化数据,以及sql的操作就很乏力。

3;GC性能的开销,基于内存计算,频繁的创建和销毁对象,势必会增加GC。

接下来说DataFrame

优点;

1;DataFrame是sparkSql的APi,在RDD的基础之上又引入了schema和off-heap;

schema;RDD中的每一行的数据,结构都是一样的,这个结构就存储在schema中,spark通过schema就可以读懂数据,因此在通信和IO的过程中只需要进行序列化和反序列化,而结构的部分就可以省略了。

off-heap;意味着开始使用堆外内存,这些内存直接受操作系统管理,而不是由jvm管理

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值