RDD、DataFrame与DataSet|Spark常用算子

最新推荐文章于 2023-03-07 18:03:45 发布

K. Bob

最新推荐文章于 2023-03-07 18:03:45 发布

阅读量946

点赞数

分类专栏： Spark 文章标签： DataSet DataFrame RDD

本文链接：https://blog.csdn.net/ThreeAspects/article/details/103518135

版权

RDD、DataFrame与DataSet区别

RDD

RDD弹性分布式数据集。与DataFrame，DataSet不同，RDD不支持Spark SQL。

DataFrame

在Spark中，DataFrame是一种以RDD为基础的分布式数据集，类似于传统数据库中的二维表格。与RDD和Dataset不同，DataFrame每一行的类型固定为Row，只有通过解析才能获取各个字段的值，每一列的值没法直接访问。DataFrame与Dataset均支持SparkSQL操作，比如select、groupby等

testDF.foreach{
   
  line =>
    val col1=line.getAs[String]("col1")
    val col2=line.getAs[String]("col2")
}

DataFrame与RDD的主要区别：DataFrame带有schema元信息，即DataFrame所表示的二维表数据集的每一列都带有名称和类型。

DataSet

Dataset是一个由特定领域的对象组成强类型（typedrel）集合，可以使用函数（DSL）或关系运算（SQL）进行并行的转换操作。每个Dataset 还有一个称为“DataFrame”的无类型（untypedrel）视图，它是[[Row]]的数据集。

RDD和Dataset
区别：
Dataset不使用Java序列化或Kryo，而是使用专用的Encoder编码器来序列化对象以便通过网络进行处理或传输。虽然Encoder编码器和标准序列化都负责将对象转换为字节，但Encoder编码器是动态生成的代码，并使用一种格式，允许Spark执行许多操作，如过滤，排序和散列，而无需将字节反序列化为对象

Dataset和DataFrame
区别：
Dataset是强类型typedrel的，会在编译的时候进行类型检测；而DataFrame是弱类型untypedrel的，在执行的时候进行类型检测；Dataset是通过Encoder进行序列化，支持动态的生成代码，直接在bytes的层面进行排序，过滤等的操作；而DataFrame是采用可选的java的标准序列化或是kyro进行序列化

联系：
DataFrame是Dataset中每一个元素为Row类型的特殊情况。DataFrame和Dataset实质上都是一个逻辑计划，并且是懒加载的，都包含着scahema信息，只有到数据要读取的时候，才会将逻辑计划进行分析和优化，并最终转化为RDD。

RDD、DataFrame与DataSet转化

DataFrame/Dataset转RDD：

val rdd1=testDF.rdd
val rdd2=testDS.rdd

RDD转DataFrame：

import spark.implicits._
val testDF = rdd.map {
   line=>
      (line._1,line._2

最低0.47元/天解锁文章

K. Bob

关注

0
点赞
踩
5

收藏

觉得还不错? 一键收藏
0
评论
RDD、DataFrame与DataSet|Spark常用算子

DataFrame是spark1.3.0版本提出来的，spark1.6.0版本又引入了DateSet的。DataFrame、DataSet是基于RDD的，三者之间可以通过简单的API调用进行无缝切换。RDD、DataFrame与DataSet区别RDDRDD一般和spark mlib同时使用RDD不支持sparksql操作DataFrame 在Spark中，DataFrame...
复制链接

扫一扫