使用scala语言编写Spark独立应用程序合并两个文件

最新推荐文章于 2023-12-19 16:55:55 发布

Yannick Li

最新推荐文章于 2023-12-19 16:55:55 发布

阅读量2.8k

点赞数 1

分类专栏： Hadoop Linux 大数据文章标签： spark scala big data

本文链接：https://blog.csdn.net/qq_45102251/article/details/122376448

版权

Hadoop 同时被 3 个专栏收录

12 篇文章 1 订阅

订阅专栏

大数据

12 篇文章 1 订阅

订阅专栏

Linux

11 篇文章 0 订阅

订阅专栏

该博客介绍了如何使用Scala和Spark编写一个独立程序，将两个输入文件A和B合并，并去除重复内容，生成新的输出文件C。程序通过读取指定路径的文件，使用distinct()方法消除重复项，然后将结果保存到指定位置。最后，利用sbt工具打包为jar文件，并通过spark-submit提交到Spark集群执行。

摘要由CSDN通过智能技术生成

实验内容：
对于两个输入文件A和B，编写Spark独立程序，对两个文件进行合并，并剔除其中重复的内容，得到一个新文件C。下面是输入文件和输出文件的样例：
输入文件A的样例如下：
20170101 x
20170102 y
20170103 x
20170104 y
20170105 z
20170106 z
输入文件B的样例如下：
20170101 y
20170102 y
20170103 x
20170104 z
20170105 y
根据输入的文件A和B合并得到的输出文件C的样例如下：
20170101 x
20170101 y
20170102 y
20170103 x
20170104 y
20170104 z
20170105 y
20170105 z
20170106 z

通过使用sbt工具将整个应用程序打包成jar包，并将jar包通过spark-submit提交到spark中运行。

代码：

import org.apache.spark.SparkContext
import org.apache.spark.SparkContext._
import org.apache.spark.SparkConf
import org.apache.spark.HashPartitioner
object FileMerge{
    def main(args: Array[String]) {
	val logFile = "file:///home/hadoop/A.txt,file:///home/hadoop/B.txt"
        val conf = new SparkConf().setAppName("FileMerge")
        val sc = new SparkContext(conf)
        val logData = sc.textFile(logFile,2)
	val res = logData.distinct()
	res.saveAsTextFile("/home/hadoop/C.txt")
    }
}

simple.sbt

name :="Simple Project"
version := "1.0"
scalaVersion := "2.12.10"
libraryDependencies += "org.apache.spark" %% "spark-core" % "3.1.2"

打包运行：

# /usr/local/sbt/sbt package
# spark-submit --class "FileMerge" ./target/scala-2.12/simple-project_2.12-1.0.jar

Yannick Li

关注

1
点赞
踩
14

收藏

觉得还不错? 一键收藏
0
评论
使用scala语言编写Spark独立应用程序合并两个文件

实验内容：对于两个输入文件A和B，编写Spark独立程序，对两个文件进行合并，并剔除其中重复的内容，得到一个新文件C。下面是输入文件和输出文件的样例：输入文件A的样例如下：20170101 x20170102 y20170103 x20170104 y20170105 z20170106 z输入文件B的样例如下：20170101 y20170102 y20170103 x20170104 z20170105 y根
复制链接

扫一扫

专栏目录