17 Spark on SQL

最新推荐文章于 2022-12-20 16:33:31 发布

lucklilili

最新推荐文章于 2022-12-20 16:33:31 发布

阅读量79

点赞数

分类专栏： Apache Spark 文章标签： spark sql 大数据

本文链接：https://blog.csdn.net/lucklilili/article/details/122330658

版权

Apache Spark 专栏收录该内容

31 篇文章 3 订阅

订阅专栏

Spark中的DataFrame和DataSet是高效处理数据的抽象。DataFrame是带schema的分布式数据集，类似数据库表格，提供优化的执行引擎和丰富的SQL操作。DataSet结合了RDD的强类型和SparkSQL的优化，支持函数式转换。示例展示了如何通过`spark.read.json()`创建DataFrame并显示数据。

摘要由CSDN通过智能技术生成

DataFrame

在 Spark 中，DataFrame 是一种以 RDD 为基础的分布式数据集，类似于传统数据库中的二维表格。DataFrame 与 RDD 的主要区别在于，前者带有 schema 元信息，即 DataFrame所表示的二维表数据集的每一列都带有名称和类型。这使得 Spark SQL 得以洞察更多的结构信息，从而对藏于 DataFrame 背后的数据源以及作用于 DataFrame 之上的变换进行了针对性的优化，最终达到大幅提升运行时效率的目标。反观 RDD，由于无从得知所存数据元素的具体内部结构，Spark Core 只能在 stage 层面进行简单、通用的流水线优化。同时，与 Hive 类似，DataFrame 也支持嵌套数据类型（struct、array 和 map）。从 API 易用性的角度上看，DataFrame API 提供的是一套高层的关系操作，比函数式的 RDD API 要更加友好，门槛更低。

DataSet

DataSet 是分布式数据集合。DataSet 是 Spark 1.6 中添加的一个新抽象，是 DataFrame的一个扩展。它提供了 RDD 的优势（强类型，使用强大的 lambda 函数的能力）以及 Spark SQL 优化执行引擎的优点。DataSet 也可以使用功能性的转换（操作 map，flatMap，filter等等）。

创建DataFrame

spark.read.json("/Users/liyapeng/Desktop/data.json")

res1.show()

+---+--------+
|age|username|
+---+--------+
| 20|zhangsan|
+---+--------+

lucklilili

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
17 Spark on SQL

DataFrame在Spark中，DataFrame是一种以RDD为基础的分布式数据集，类似于传统数据库中的二维表格。DataFrame与RDD的主要区别在于，前者带有schema元信息，即DataFrame所表示的二维表数据集的每一列都带有名称和类型。这使得Spark SQL得以洞察更多的结构信息，从而对藏于DataFrame背后的数据源以及作用于DataFrame之上的变换进行了针对性的优化，最终达到大幅提升运行时效率的目标。反观RDD，由于无从...
复制链接

扫一扫

专栏目录