Spark SQL数据源 - Parquet文件

吃嘎嘎丶

于 2023-06-15 13:57:23 发布

阅读量505

点赞数

文章标签： java 开发语言

本文链接：https://blog.csdn.net/lxq1145371298/article/details/131226272

版权

一、Parquet概述

Apache Parquet是Hadoop生态系统中任何项目都可以使用的列式存储格式，不受数据处理框架、数据模型和编程语言的影响。Spark SQL支持对Parquet文件的读写，并且可以自动保存源数据的Schema。当写入Parquet文件时，为了提高兼容性，所有列都会自动转换为“可为空”状态。

二、读取和写入Parquet的方法

加载和写入Parquet文件时，除了可以使用load()方法和save()方法外，还可以直接使用Spark SQL内置的parquet()方法

（一）利用parquet()方法读取parquet文件
1.读取parquet文件

执行命令：val usersdf = spark.read.parquet("hdfs://master:9000/input/users.parquet")

2.显示数据帧内容
执行命令：usersdf.show()

（二）利用parquet()方法写入parquet文件
1、写入parquet文件
执行命令：usersdf.select("name", "favorite_color").write.parquet("hdfs://master:9000/result")

报错说/result目录已经存在，有两种解决问题的方式，一个是删除result目录，一个是修改命令，设置覆盖模式
导入SaveMode类后，执行命令：usersdf.select("name", "favorite_color").write.mode(SaveMode.Overwrite)parquet("hdfs://master:9000/result")
2、查看生成的parquet文件
在slave1虚拟机上执行命令：hdfs dfs -ls /result

三、Schema合并
（一）Schema合并概述
与Protocol Buffer、Avro和Thrift一样，Parquet也支持Schema合并。刚开始可以先定义一个简单的Schema，然后根据业务需要逐步向Schema中添加更多的列，最终会产生多个Parquet文件，各个Parquet文件的Schema不同，但是相互兼容。对于这种情况，Spark SQL读取Parquet数据源时可以自动检测并合并所有Parquet文件的Schema。
（二）开启Schema合并功能
由于Schema合并是一个相对耗时的操作，并且在多数情况下不是必需的，因此从Spark 1.5.0开始默认将Schema自动合并功能关闭，可以通过两种方式开启。
1、利用option()方法设置
读取Parquet文件时，通过调用option()方法将数据源的属性mergeSchema设置为true
val mergedDF = spark.read.option("mergeSchema", "true").parquet("hdfs://master:9000/students")
1
2、利用config()方法设置
构建SparkSession对象时，通过调用config()方法将全局SQL属性spark.sql.parquet.mergeSchema设置为true
val spark = SparkSession.builder()
.appName("SparkSQLDataSource")
.config("spark.sql.parquet.mergeSchema", true)
.master("local[*]")
.getOrCreate()
1
2
3
4
5

吃嘎嘎丶

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
Spark SQL数据源 - Parquet文件

对于这种情况，Spark SQL读取Parquet数据源时可以自动检测并合并所有Parquet文件的Schema。导入SaveMode类后，执行命令：usersdf.select("name", "favorite_color").write.mode(SaveMode.Overwrite)parquet("hdfs://master:9000/result")加载和写入Parquet文件时，除了可以使用load()方法和save()方法外，还可以直接使用Spark SQL内置的parquet()方法。
复制链接

扫一扫