RDD、DataFrame、DataSet的概念、区别联系、相互转换操作

本文介绍了Spark中的三种数据抽象:RDD、DataFrame和DataSet,它们都是分布式弹性数据集,用于处理大规模数据。RDD是最基础的数据抽象,不包含数据结构;DataFrame拥有结构信息,便于SQL操作;DataSet则结合了数据和类型信息,提供了编译时类型检查。三者之间可以通过特定操作相互转换,共同点包括惰性计算、共享内存机制、分区概念等。
摘要由CSDN通过智能技术生成

目录

一,概念

1.RDD:

2.DataFrame:

3.DateSet:

二,区别

RDD:

DataFrame:

DataSet

三,联系

四,相互转换作用

一,概念

    RDD、DataFrame、Dataset都是spark平台下的分布式弹性数据集,为处理超大型数据提供便利。RDD,作为Spark的核心数据抽象,是Spark当中不可或缺的存在,而在SparkSQL中,Spark为我们提供了两个新的抽象,分别是DataFrame和DataSet。

三者的概念分别为:

1.RDD:

全称Resilient Distributed Dataset,弹性分布式数据集,Spark中最基础的数据抽象,特点是RDD只包含数据本身,没有数据结构

2.DataFrame:

一个分布式数据容器,除数据本身,还记录了数据的结构信息,即schema;结构信息便于Spark知道该数据集中包含了哪些列,每一列的类型和数据是什么

3.DateSet:

评论 1
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值