Spark06：【案例】创建RDD：使用集合创建RDD、使用本地文件和HDFS文件创建RDD

最新推荐文章于 2024-01-15 15:12:13 发布

做一个有趣的人Zz

最新推荐文章于 2024-01-15 15:12:13 发布

阅读量1.5k

点赞数 3

分类专栏： spark 文章标签： hdfs scala spark

本文链接：https://blog.csdn.net/weixin_40612128/article/details/123332912

版权

spark 专栏收录该内容

19 篇文章 0 订阅 ¥39.90 ¥99.00

订阅专栏

一、创建RDD

RDD是Spark编程的核心，在进行Spark编程时，首要任务是创建一个初始的RDD
这样就相当于设置了Spark应用程序的输入源数据
然后在创建了初始的RDD之后，才可以通过Spark 提供的一些高阶函数，对这个RDD进行操作，来获取其它的RDD

Spark提供三种创建RDD方式：集合、本地文件、HDFS文件

1、使用程序中的集合创建RDD，主要用于进行测试，可以在实际部署到集群运行之前，自己使用集合构造一些测试数据，来测试后面的spark应用程序的流程。
2、使用本地文件创建RDD，主要用于临时性地处理一些存储了大量数据的文件
3、使用HDFS文件创建RDD，是最常用的生产环境的处理方式，主要可以针对HDFS上存储的数据，进行离线批处理操作。

二、使用集合创建RDD

首先来看一下如何使用集合创建RDD
如果要通过集合来创建RDD，需要针对程序中的集合，调用SparkContext的parallelize()方法。Spark会将集合中的数据拷贝到集群上，形成一个分布式的数据集合，也就是一个RDD。
相当于，集合中的部分数据会到一个节点上，而另一部分数据会到其它节点上。然后就可以用并行的方式来操作这个分布式数据集合了。

调用parallelize()时，有一个重要的参数可以指定，就是将集合切分成多少个partition。
Spark会为每一个partition运行一个task来进行处理。
Spark默认会根据集群的配置来设置partition的数量。我们也可以在调用parallelize()方法时，传入第二个参数，来设置RDD的partition

了解本专栏

做一个有趣的人Zz

关注

3
点赞
踩
4

收藏

觉得还不错? 一键收藏
打赏
0
评论
Spark06：【案例】创建RDD：使用集合创建RDD、使用本地文件和HDFS文件创建RDD

一、创建RDDRDD是Spark编程的核心，在进行Spark编程时，首要任务是创建一个初始的RDD这样就相当于设置了Spark应用程序的输入源数据然后在创建了初始的RDD之后，才可以通过Spark 提供的一些高阶函数，对这个RDD进行操作，来获取其它的RDDSpark提供三种创建RDD方式：集合、本地文件、HDFS文件1、使用程序中的集合创建RDD，主要用于进行测试，可以在实际部署到集群运行之前，自己使用集合构造一些测试数据，来测试后面的spark应用程序的流程。2、使用本地文件创建RDD，主要
复制链接

扫一扫