Spark SQL性能调优(Spark2.3.2)

对于某些工作负载,可以通过在内存中缓存数据或打开一些实验选项来提高性能。

1.在内存中缓存数据

Spark SQL可以通过调用spark.catalog.cacheTable("tableName")或dataFrame.cache()使用内存中的列式格式来缓存表。然后,Spark SQL将仅扫描所需的列,并自动调整压缩以最小化内存使用和GC压力。您可以调用spark.catalog.uncacheTable("tableName")从内存中删除表。

可以通过SparkSession使用SQL setConf上的方法或通过SQL命令行使用SET key=value来完成内存中缓存的配置

2.其他配置选项

以下选项也可用于调整查询执行的性能。由于更多优化会自动执行,因此在将来的版本中可能会弃用这些选项。

3.SQL查询的Broadcast Hint

当表之间进行join时,Broadcast Hint会指导spark广播某个具体的表,当Spark决定join方式的时,会优先使用    
broadcast hash join(BHJ),即便是统计信息(statistics,衡量表的大小)超过spark.sql.autoBroadcastJoinThreshold配置的阈值(默认10M)。当join的两张表确定时,Spark会广播统计信息(statistics)较小的那张表(小表)。注意,Spark并不是总是选择BHJ的join方式,因为并不是所有的情况(比如全连接)都支持BHJ。当选择广播嵌套循环join时,我们仍然遵循提示(Broadcast Hint)。

import org.apache.spark.sql.functions.broadcast
broadcast(spark.table("src")).join(spark.table("records"), "key").show()

参考:http://spark.apache.org/docs/latest/sql-programming-guide.html#performance-tuning

  • 0
    点赞
  • 3
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值