重要 | Spark分区并行度决定机制

最新推荐文章于 2023-09-21 10:37:54 发布

大数据学习与分享

最新推荐文章于 2023-09-21 10:37:54 发布

阅读量1.1k

点赞数 2

分类专栏：大数据 Spark 文章标签： spark

本文链接：https://blog.csdn.net/qq_42164977/article/details/105257234

版权

本文探讨了Spark中影响分区并行度的因素，包括coalesce、repartition、union和cartesian算子的作用。理解这些机制有助于优化Spark作业的性能。Spark默认并行度由`spark.default.parallelism`参数决定，而数据源加载时的分区数可能受HDFS块大小影响。coalesce在不触发shuffle时减小分区数，repartition用于增加或减少分区并触发shuffle。union根据父RDD的分区器和数量决定结果分区。cartesian算子的分区数是父RDD分区数的乘积。

摘要由CSDN通过智能技术生成

最近经常有小伙伴留言，核心问题都比较类似，就是虽然接触Spark有一段时间了，但是搞不明白一个问题，为什么我从HDFS上加载不同的文件时，打印的分区数不一样，并且好像spark.default.parallelism这个参数时不是一直起作用？其实笔者之前的文章已有相关介绍，想知道为什么，就必须了解Spark在加载不同的数据源时分区决定机制以及调用不用算子时并行度决定机制以及分区划分。

其实之前的文章《Spark的分区》、《通过spark.default.parallelism谈Spark并行度》已有所介绍，笔者今天再做一次详细的补充，建议大家在对Spark有一定了解的基础上，三篇文章结合一起看。

大家都知道Spark job中最小执行单位为task，合理设置Spark job每个stage的task数是决定性能好坏的重要因素之一，但是Spark自己确定最佳并行度的能力有限，这就要求我们在了解其中内在机制的前提下，去各种测试、计算等来最终确定最佳参数配比。
Spark任务在执行时会将RDD划分为不同的stage，一个stage中task的数量跟最后一个RDD的分区数量相同。之前已经介绍过，stage划分的关键是宽依赖，而宽依赖往往伴随着shuffle操作。对于一个stage接收另一个stage的输入，这种操作通常都会有一个参数numPartitions来显示指定分区数。最典型的就是一些ByKey算子，比如groupByKey(numPartitions: Int)，但是这个分区数需要多次测试来确定合适的值。首先确定父RDD中的分区数（通过rdd.partitions().size()可以确定RDD的分区数），然后在此基础上增加分区数，多次调试直至在确定的资源任务能够平稳、安全的运行。
对于没有父RDD的RDD，比如通过加载HDFS上的数