Spark SQL2.4.8 Load和Save函数

最新推荐文章于 2023-05-08 20:17:49 发布

若兰幽竹

最新推荐文章于 2023-05-08 20:17:49 发布

阅读量388

点赞数 1

分类专栏： Spark 文章标签： spark

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/sujiangming/article/details/120757496

版权

Spark 专栏收录该内容

34 篇文章 14 订阅

订阅专栏

本文详细介绍了SparkSQL2.4.8中如何使用Load和Save函数处理Parquet和JSON文件。通过实例展示了读取Parquet文件、查询数据、保存结果到Parquet格式的过程。同时，讲解了存储模式（SaveModes），包括Append、Overwrite、ErrorIfExists和Ignore四种模式，并提供了具体示例。

摘要由CSDN通过智能技术生成

Spark SQL2.4.8 Load和Save函数

一、测试数据

users.parquet
点击下载

people.json

{"name":"Michael"}
{"name":"Andy", "age":30}
{"name":"Justin", "age":19}

二、通用的Load/Save函数

什么是parquet文件？
Parquet是列式存储格式的一种文件类型，列式存储有以下的核心：
- 可以跳过不符合条件的数据，只读取需要的数据，降低IO数据量。
- 压缩编码可以降低磁盘存储空间。由于同一列的数据类型是一样的，可以使用更高效的压缩编码（例如Run Length Encoding和Delta Encoding）进一步节约存储空间。
- 只读取需要的列，支持向量运算，能够获取更好的扫描性能。
- Parquet格式是Spark SQL的默认数据源，可通过spark.sql.sources.default配置
通用的Load/Save函数
- 读取Parquet文件
  val usersDF = spark.read.load("/root/resources/users.parquet")
- 查询Schema和数据
- 查询用户的name和喜爱颜色，并保存
  usersDF.select($"name",$"favorite_color").write.save("/root/result/parquet")
- 结果验证：

显式指定文件格式：加载json格式

直接加载：

val usersDF = spark.read.format("json").load("/root/resources/people.json")

三、存储模式（Save Modes）

可以采用SaveMode执行存储操作，SaveMode定义了对数据的处理模式。需要注意的是，这些保存模式不使用任何锁定，不是原子操作。此外，当使用Overwrite方式执行时，在输出新数据之前原数据就已经被删除。SaveMode详细介绍如下表：

Demo：
usersDF.select($"name").write.mode("overwrite").save("/root/result/parquet1")

将结果保存为表
usersDF.select($"name").write.saveAsTable("table1")

也可以进行分区、分桶等操作：partitionBy、bucketBy

关注

1
点赞
踩
0

收藏

觉得还不错? 一键收藏
打赏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

打赏作者

若兰幽竹 你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20

扫码支付：¥1

获取中

扫码支付

您的余额不足，请更换扫码支付或充值

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。