SparkSQL-数据模型DataFrame&DataSet

最新推荐文章于 2024-04-25 22:33:20 发布

祝我好运！！

最新推荐文章于 2024-04-25 22:33:20 发布

阅读量846

点赞数

分类专栏：大数据生态文章标签：大数据 spark 分布式

本文链接：https://blog.csdn.net/qq_53914420/article/details/127856192

版权

大数据生态专栏收录该内容

3 篇文章 0 订阅

订阅专栏

数据模型DataFrame

1. DataFrame是什么

在 Spark 中，DataFrame 是一种以 RDD 为基础的分布式数据集，类似于传统数据库中的二维表格。DataFrame 与 RDD 的主要区别在于，前者带有 schema 元信息，即 DataFrame 所表示的二维表数据集的每一列都带有名称和类型。这使得 Spark SQL 得以洞察更多的结构信息，从而对藏于 DataFrame 背后的数据源以及作用于 DataFrame 之上的变换进行了针对性的优化，最终达到大幅提升运行时效率的目标。反观 RDD，由于无从得知所存数据元素的具体内部结构，Spark Core 只能在 stage 层面进行简单、通用的流水线优化。

同时，与Hive 类似，DataFrame 也支持嵌套数据类型（struct、array 和 map）。从 API 易用性的角度上看，DataFrame API 提供的是一套高层的关系操作，比函数式的 RDD API 要更加友好，门槛更低。

DataFrame 和 RDD 的区别

2. DataSet是什么

DataSet 是分布式数据集合。DataSet 是Spark 1.6 中添加的一个新抽象，是DataFrame的一个扩展。它提供了RDD 的优势（强类型，使用强大的 lambda 函数的能力）以及SparkSQL 优化执行引擎的优点。DataSet 也可以使用功能性的转换（操作 map，flatMap，filter等等）。