Spark宽依赖与窄依赖的区别

窄依赖是指父RDD的每个分区只被子RDD的一个分区所使用,子RDD分区通常对应常数个父RDD分区。这其中又分两种情况:1个子RDD分区对应1个父RDD分区(如map、filter等算子),1个子RDD分区对应N个父RDD分区(如co-paritioned(协同划分)过的Join)。
宽依赖是指父RDD的每个分区都可能被多个子RDD分区所使用,子RDD分区通常对应所有的父RDD分区。这其中又分两种情况:1个父RDD对应所有子RDD分区(未经协同划分的Join)或者1个父RDD对应非全部的多个RDD分区(如groupByKey)。
窄依赖相对宽依赖有2点优势:
(1) 宽依赖会产生shuffle,会跨网络拉取数据,窄依赖在一个节点内就可以完成转换。
(2) 当RDD需要时,当子RDD需要重算的时候会将所有父RDD的数据重算一遍,这样出现多余计算情况,而窄依赖时,子RDD需要重算时只需要重算对应的一个父RDD即可。

窄依赖的算子:map、flatMap、filter、mapPartitions
宽依赖的算子:groupByKey、reduceByKey、combineByKey

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值