【Spark】【RDD】从内存（集合）创建RDD

最新推荐文章于 2022-11-15 16:51:59 发布

萌狼蓝天

最新推荐文章于 2022-11-15 16:51:59 发布

阅读量701

点赞数

文章标签：大数据 spark java python hadoop

原创文章谢绝转载！不允许搬运！不授权任何人！

本文链接：https://blog.csdn.net/ks2686/article/details/124031490

版权

val list = List(1,2,3)
var rdd = sc.parallelize(list)
rdd.partitions.size

通过调用SparkContext的parallelize方法，在一个已经存在的Scala集合上创建的(一个Seq对象)。
集合的对象将会被拷贝，创建出一个可以被并行操作的分布式数据集。

一旦分布式数据集(distData)被创建好，它们将可以被并行操作。
例如，我们可以调用distData.reduce(lambda a, b: a + b)来将数组的元素相加。

并行集合的一个重要参数是slices，表示数据集切分的份数。
Spark将会在集群上为每一份数据起一个任务。
典型地，你可以在集群的每个CPU上分布2-4个slices.
一般来说，Spark会尝试根据集群的状况，来自动设定slices的数目

然而，你也可以通过传递给parallelize的第二个参数来进行手动设置。
(例如:sc.parallelize(data,10)).

[本段为引用，作者信息如下]
作者：追赶的程序猿
链接：https://www.jianshu.com/p/c688b8856dd8
来源：简书

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
打赏
0
评论
【Spark】【RDD】从内存（集合）创建RDD

val list = List(1,2,3)var rdd = sc.parallelize(list)rdd.partitions.size通过调用SparkContext的parallelize方法，在一个已经存在的Scala集合上创建的(一个Seq对象)。集合的对象将会被拷贝，创建出一个可以被并行操作的分布式数据集。一旦分布式数据集(distData)被创建好，它们将可以被并行...
复制链接

扫一扫

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

打赏作者

萌狼蓝天 你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20

扫码支付：¥1

获取中

扫码支付

您的余额不足，请更换扫码支付或充值

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。