SparkRDD算子--mapPartitions算子

最新推荐文章于 2022-09-21 18:50:54 发布

寒暄

最新推荐文章于 2022-09-21 18:50:54 发布

阅读量727

点赞数

分类专栏： # ---Spark-Core Spark-MLlib 文章标签： spark scala

本文链接：https://blog.csdn.net/qq_41106844/article/details/107670383

版权

---Spark-Core Spark-MLlib 专栏收录该内容

50 篇文章 5 订阅

订阅专栏

语法

val newRdd = oldRdd.mapPartitions(oldSet => {func})

源码

def mapPartitions[U](f : scala.Function1[scala.Iterator[T], scala.Iterator[U]], preservesPartitioning : scala.Boolean = { /* compiled code */ })(implicit evidence$6 : scala.reflect.ClassTag[U]) : org.apache.spark.rdd.RDD[U] = { /* compiled code */ }

作用

类似于map，但独立地在RDD的每一个分片上运行，因此在类型为T的RDD上运行时，func的函数类型必须是Iterator[T] => Iterator[U]。假设有N个元素，有M个分区，那么map的函数的将被调用N次,而mapPartitions被调用M次,一个函数一次处理所有分区。

例子

package com.day1

import org.apache.spark.rdd.RDD
import org.apache.spark.{SparkConf, SparkContext}

object oper {
    def main(args: Array[String]): Unit = {
        val config:SparkConf = new SparkConf().setMaster("local[*]").setAppName("wordCount")

        // 创建上下文对象
        val sc = new SparkContext(config)

        // mapPartitions算子
        val listRdd:RDD[Int] = sc.makeRDD(1 to 10)

        val mapPartitionsRdd:RDD[Int] = listRdd.mapPartitions(datas => {
            datas.map(date=>date*2)
        })

        mapPartitionsRdd.collect().foreach(println)
    }
}
input:
1 2 3 4 5 6 7 8 9 10
output:
2 4 6 8 10 12 14 16 18 20