窄依赖是指父RDD的每个分区只被子RDD的一个分区所使用,子RDD分区通常对应常数个父RDD分区。这其中又分两种情况:1个子RDD分区对应1个父RDD分区(如map、filter等算子),1个子RDD分区对应N个父RDD分区(如co-paritioned(协同划分)过的Join)。
宽依赖是指父RDD的每个分区都可能被多个子RDD分区所使用,子RDD分区通常对应所有的父RDD分区。这其中又分两种情况:1个父RDD对应所有子RDD分区(未经协同划分的Join)或者1个父RDD对应非全部的多个RDD分区(如groupByKey)。
窄依赖相对宽依赖有2点优势:
(1) 宽依赖会产生shuffle,会跨网络拉取数据,窄依赖在一个节点内就可以完成转换。
(2) 当RDD需要时,当子RDD需要重算的时候会将所有父RDD的数据重算一遍,这样出现多余计算情况,而窄依赖时,子RDD需要重算时只需要重算对应的一个父RDD即可。
窄依赖的算子:map、flatMap、filter、mapPartitions
宽依赖的算子:groupByKey、reduceByKey、combineByKey