Spark RDD的aggregate算子

aggregate算子签名:

  def aggregate[U: ClassTag](zeroValue: U)(seqOp: (U, T) => U, combOp: (U, U) => U): U = withScope 


zeroValue是一个初始值,seqOp对每一个分区操作的函数,combOp对每一个分区结果进行操作的函数。 zeroValue在seqOp的每一次调用中都会参与函数计算,最后也参与combOp函数的计算
    


例如:

 def seqOP(a: Int, b: Int): Int = {
      println("seqOp: " + a + "\t" + b)
      math.min(a, b)
    }

    def combOp(a: Int, b: Int): Int = {
      println("combOp: " + a + "\t" + b)
      a + b
    }

计算:

    println(sc.parallelize(List(1, 2, 3, 4, 5, 6, 7, 8), 2).aggregate(3)(seqOP, combOp))

    println(sc.parallelize(List(1, 2, 3, 4, 5, 6, 7, 8, 9, 10, 11,12), 2).aggregate(3)(seqOP, combOp))

两个结果输出都是:7,接下来我们分析一下执行过程:

sc.parallelize(List(1, 2, 3, 4, 5, 6, 7, 8,1), 2).aggregate(3)(seqOP, combOp)执行过程:首先是对序列生成两个分区的RDD,对每一个分区RDD计算最小值,在计算1,2,3,4时候,zeaoValue=3参与求最小值,所以此时最小值是1,对于5,6,7,8计算最小值时候3也参与计算最小值,所以此时最小值为3.最后调用combOp函数时候3再一次参与计算所以最后结果为1+3+3=7。(注意此处分区的划分是Spark按照List的顺序均分为“指定分区数”个分区,具体可以参见Spark源码)!


sc.parallelize(List(1, 2, 3, 4, 5, 6, 7, 8, 9, 10, 11,12), 2).aggregate(3)(seqOP, combOp)执行过程:1, 2, 3, 4, 5, 6,划分为一个分区,划分为第二个分区:7, 8, 9, 10, 11,12

所以seqOP函数在第一个分区与3同时求最小值为1,第二个分区求最小值为3,最后comOp计算为1+3+3=7.


如果zeroValue=9的话,此时sc.parallelize(List(1, 2, 3, 4, 5, 6, 7, 8), 2).aggregate(9)(seqOP, combOp)=15,赐一个最小值是1,第二个最小值是5,最后1+5+9=15


拓展:spark对序列分区划分原理:

sc.parallelize(List(1, 2, 3, 4, 5, 6, 7, 8), 2)

划分函数:org.apache.spark.rdd.ParallelCollectionRDD#slice源码:

def slice[T: ClassTag](seq: Seq[T], numSlices: Int): Seq[Seq[T]] = {
    if (numSlices < 1) {
      throw new IllegalArgumentException("Positive number of slices required")
    }
    // Sequences need to be sliced at the same set of index positions for operations
    // like RDD.zip() to behave as expected
    def positions(length: Long, numSlices: Int): Iterator[(Int, Int)] = {
      (0 until numSlices).iterator.map { i =>
        val start = ((i * length) / numSlices).toInt
        val end = (((i + 1) * length) / numSlices).toInt
        (start, end)
      }
    }
    seq match {
      case r: Range =>
        positions(r.length, numSlices).zipWithIndex.map { case ((start, end), index) =>
          // If the range is inclusive, use inclusive range for the last slice
          if (r.isInclusive && index == numSlices - 1) {
            new Range.Inclusive(r.start + start * r.step, r.end, r.step)
          }
          else {
            new Range(r.start + start * r.step, r.start + end * r.step, r.step)
          }
        }.toSeq.asInstanceOf[Seq[Seq[T]]]
      case nr: NumericRange[_] =>
        // For ranges of Long, Double, BigInteger, etc
        val slices = new ArrayBuffer[Seq[T]](numSlices)
        var r = nr
        for ((start, end) <- positions(nr.length, numSlices)) {
          val sliceSize = end - start
          slices += r.take(sliceSize).asInstanceOf[Seq[T]]
          r = r.drop(sliceSize)
        }
        slices
      case _ =>
        val array = seq.toArray // To prevent O(n^2) operations for List etc
        positions(array.length, numSlices).map { case (start, end) =>
            array.slice(start, end).toSeq
        }.toSeq
    }
  }

中核心代码:

    def positions(length: Long, numSlices: Int): Iterator[(Int, Int)] = {
      (0 until numSlices).iterator.map { i =>
        val start = ((i * length) / numSlices).toInt
        val end = (((i + 1) * length) / numSlices).toInt
        (start, end)
      }
    }

可知是平均划分的,例如当我们将6个元素划分2个分区的话,positions函数的输出结果为:

(0,3)和(3,6)


Spark RDD(弹性分布式数据集)是Spark中最基本的数据抽象,它代表了一个不可变、可分区、可并行计算的数据集合。转换算子是用于对RDD进行转换操作的方法,可以通过转换算子RDD进行各种操作和变换,生成新的RDD。 以下是一些常见的Spark RDD转换算子: 1. map(func):对RDD中的每个元素应用给定的函数,返回一个新的RDD,新RDD中的每个元素都是原RDD中元素经过函数处理后的结果。 2. filter(func):对RDD中的每个元素应用给定的函数,返回一个新的RDD,新RDD中只包含满足条件的元素。 3. flatMap(func):对RDD中的每个元素应用给定的函数,返回一个新的RDD,新RDD中的每个元素都是原RDD中元素经过函数处理后生成的多个结果。 4. union(other):返回一个包含原RDD和另一个RDD中所有元素的新RDD。 5. distinct():返回一个去重后的新RDD,其中不包含重复的元素。 6. groupByKey():对键值对RDD进行分组,返回一个新的键值对RDD,其中每个键关联一个由具有相同键的所有值组成的迭代器。 7. reduceByKey(func):对键值对RDD中具有相同键的值进行聚合操作,返回一个新的键值对RDD,其中每个键关联一个经过聚合函数处理后的值。 8. sortByKey():对键值对RDD中的键进行排序,返回一个新的键值对RDD,按照键的升序排列。 9. join(other):对两个键值对RDD进行连接操作,返回一个新的键值对RDD,其中包含两个RDD中具有相同键的所有元素。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值