Spark SQL性能调优(Spark2.3.2)

最新推荐文章于 2023-06-08 23:45:53 发布

大数据技术与数仓

最新推荐文章于 2023-06-08 23:45:53 发布

阅读量1.1k

点赞数

分类专栏： Spark SQL Spark

Spark 同时被 2 个专栏收录

22 篇文章 2 订阅

订阅专栏

Spark SQL

4 篇文章 2 订阅

订阅专栏

对于某些工作负载，可以通过在内存中缓存数据或打开一些实验选项来提高性能。

1.在内存中缓存数据

Spark SQL可以通过调用spark.catalog.cacheTable("tableName")或dataFrame.cache()使用内存中的列式格式来缓存表。然后，Spark SQL将仅扫描所需的列，并自动调整压缩以最小化内存使用和GC压力。您可以调用spark.catalog.uncacheTable("tableName")从内存中删除表。

可以通过SparkSession使用SQL setConf上的方法或通过SQL命令行使用SET key=value来完成内存中缓存的配置

2.其他配置选项

以下选项也可用于调整查询执行的性能。由于更多优化会自动执行，因此在将来的版本中可能会弃用这些选项。

3.SQL查询的Broadcast Hint

当表之间进行join时，Broadcast Hint会指导spark广播某个具体的表，当Spark决定join方式的时，会优先使用
broadcast hash join(BHJ),即便是统计信息（statistics，衡量表的大小)超过spark.sql.autoBroadcastJoinThreshold配置的阈值(默认10M)。当join的两张表确定时，Spark会广播统计信息（statistics）较小的那张表(小表)。注意，Spark并不是总是选择BHJ的join方式，因为并不是所有的情况(比如全连接)都支持BHJ。当选择广播嵌套循环join时，我们仍然遵循提示(Broadcast Hint)。

import org.apache.spark.sql.functions.broadcast
broadcast(spark.table("src")).join(spark.table("records"), "key").show()

参考：http://spark.apache.org/docs/latest/sql-programming-guide.html#performance-tuning

大数据技术与数仓

关注

0
点赞
踩
3

收藏

觉得还不错? 一键收藏
0
评论
Spark SQL性能调优(Spark2.3.2)

对于某些工作负载，可以通过在内存中缓存数据或打开一些实验选项来提高性能。1.在内存中缓存数据Spark SQL可以通过调用spark.catalog.cacheTable("tableName")或dataFrame.cache()使用内存中的列式格式来缓存表。然后，Spark SQL将仅扫描所需的列，并自动调整压缩以最小化内存使用和GC压力。您可以调用spark.catalog.unca...
复制链接

扫一扫