spark transform系列__cogroup

最新推荐文章于 2021-09-02 13:55:47 发布

隔壁老杨hongs

最新推荐文章于 2021-09-02 13:55:47 发布

阅读量1.9k

点赞数 1

文章标签： spark 源代码 spark-transform

本文链接：https://blog.csdn.net/u014393917/article/details/50602461

版权

本文详细介绍了 Spark 的 Cogroup 函数，它用于将两个 RDD 中相同 key 的元素进行合并，返回的 RDD 的 value 是一个 Pair，包含了两个 Iterable 的值。在执行 Cogroup 操作时，可能需要进行 shuffle，具体取决于输入 RDD 是否已经 shuffle 过以及 partitioner 是否相同。文中还深入解析了 CoGroupedRDD 的关键代码，包括 getDependencies、compute 函数以及 ExternalAppendOnlyMap 在合并过程中的作用。

摘要由CSDN通过智能技术生成

Cogroup

cogroup的函数实现:

这个实现根据两个要进行合并的两个RDD操作,生成一个CoGroupedRDD的实例,这个RDD的返回结果是把相同的key中两个RDD分别进行合并操作,最后返回的RDD的value是一个Pair的实例,这个实例包含两个Iterable的值,第一个值表示的是RDD1中相同KEY的值,第二个值表示的是RDD2中相同key的值.

由于做cogroup的操作,需要通过partitioner进行重新分区的操作,因此,执行这个流程时,需要执行一次shuffle的操作(如果要进行合并的两个RDD的都已经是shuffle后的rdd,同时他们对应的partitioner相同时,就不需要执行shuffle,)

def cogroup[W](other: RDD[(K, W)], partitioner: Partitioner)
    : RDD[(K, (Iterable[V], Iterable[W]))] = self.withScope {
  if (partitioner.isInstanceOf[HashPartitioner] && keyClass.isArray) {
    throw new SparkException("Default partitioner cannot partition array keys.")
  }

生成CoGroupedRDD的实例,并根据这个实例执行mapValues的操作.这个的结果是一个Pair的实例,

Pair._1是左RDD对应key的结果集,Pair._2是右RDD对应key的结果集.
  val cg = new CoGroupedRDD[K](Seq(self, other), partitioner)
  cg.mapValues { case Array(vs, w1s) =>
    (vs.asInstanceOf[Iterable[V]], w1s.asInstanceOf[Iterable[W]])
  }
}