黑猴子的家：Spark RDD 依赖关系

最新推荐文章于 2022-06-20 11:45:45 发布

黑猴子的家

最新推荐文章于 2022-06-20 11:45:45 发布

阅读量118

点赞数

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/qq_28652401/article/details/92993136

版权

RDD和它依赖的父RDD（s）的关系有两种不同的类型，即窄依赖（narrow dependency）和宽依赖（wide dependency）

1、窄依赖

窄依赖指的是，每一个父RDD的Partition最多被子RDD的一个Partition使用
总结：窄依赖我们形象的比喻为独生子女（不引起Shuffle过程）

2、宽依赖

宽依赖指的是，多个子RDD的Partition会依赖同一个父RDD的Partition，会引起shuffle
总结：宽依赖我们形象的比喻为超生，或者说，父RDD的一个分区被多个子RDD的分区所使用。（会引起shuffle过程），类似**ByKey基本上都会引起Shuffle。

3、Lineage

RDD只支持粗粒度转换，即在大量记录上执行的单个操作。将创建RDD的一系列Lineage（即血统）记录下来，以便恢复丢失的分区。RDD的Lineage会记录RDD的元数据信息和转换行为，当该RDD的部分分区数据丢失时，它可以根据这些信息来重新运算和恢复丢失的数据分区。

scala> val textRDD = sc.textFile("./README.md")
textRDD: org.apache.spark.rdd.RDD[String] 
            = ./README.md MapPartitionsRDD[1] at textFile at <console>:24

scala> val words = textRDD.flatMap(_.split(" "))
words: org.apache.spark.rdd.RDD[String] 
            = MapPartitionsRDD[2] at flatMap at <console>:26

scala> val mapRDD = words.map((_,1))
mapRDD: org.apache.spark.rdd.RDD[(String, Int)] 
            = MapPartitionsRDD[4] at map at <console>:28

scala> val resultRDD = mapRDD.reduceByKey(_+_)
resultRDD: org.apache.spark.rdd.RDD[(String, Int)] 
            = ShuffledRDD[5] at reduceByKey at <console>:30

scala> resultRDD.dependencies
res1: Seq[org.apache.spark.Dependency[_]] 
            = List(org.apache.spark.ShuffleDependency@14726e69)

scala> mapRDD.dependencies
res2: Seq[org.apache.spark.Dependency[_]] 
            = List(org.apache.spark.OneToOneDependency@a638f45)

黑猴子的家

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

黑猴子的家 CSDN认证博客专家 CSDN认证企业博客

码龄9年

1543: 原创

3万+: 周排名

98万+: 总排名

71万+: 访问

: 等级

5322: 积分

443: 粉丝

176: 获赞

112: 评论

678: 收藏

私信

关注

热门文章

分类专栏

最新评论

黑猴子的家：华为 OpenEuler-20.03-LTS 配置UKUI图形化界面
cqwuliu: 远程有界面吗
黑猴子的家：Centos 7.x gcc 4.8.5 升级到 gcc 4.9.4
m0_75017410: make install也是报错。 [root@localhost build]# make install make[1]: 进入目录“/root/software/gcc-4.9.0/build” /bin/sh ../mkinstalldirs /usr/local /usr/local make[2]: 进入目录“/root/software/gcc-4.9.0/build/fixincludes” make[2]: *** 没有规则可以创建目标“install”。停止。 make[2]: 离开目录“/root/software/gcc-4.9.0/build/fixincludes” make[1]: *** [install-fixincludes] 错误 2 make[1]: 离开目录“/root/software/gcc-4.9.0/build” make: *** [install] 错误 2 [root@localhost build]#
黑猴子的家：Centos 7.x gcc 4.8.5 升级到 gcc 4.9.4
m0_75017410: 为什么 make -j4后会出现以下情况。 ranlib .libs/libgmp.a rm -fr .libs/libgmp.lax creating libgmp.la (cd .libs && rm -f libgmp.la && ln -s ../libgmp.la libgmp.la) make[5]: 离开目录“/root/software/gcc-4.9.0/build/gmp” make[4]: 离开目录“/root/software/gcc-4.9.0/build/gmp” make[3]: 离开目录“/root/software/gcc-4.9.0/build/gmp” make[2]: 离开目录“/root/software/gcc-4.9.0/build” make[1]: *** [stage1-bubble] 错误 2 make[1]: 离开目录“/root/software/gcc-4.9.0/build” make: *** [all] 错误 2 [root@localhost build]#
黑猴子的家：Centos 7.x gcc 4.8.5 升级到 gcc 4.9.4
ironSid: 得到子目录是吗
黑猴子的家：Centos 7.x gcc 4.8.5 升级到 gcc 4.9.4
MoXiaoJie_55: me too

最新文章

目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。