sbt 编译spark 的wordcount 程序

最新推荐文章于 2018-03-26 23:19:16 发布

xiewenbo

最新推荐文章于 2018-03-26 23:19:16 发布

阅读量935

点赞数

分类专栏： scala

scala 专栏收录该内容

14 篇文章 0 订阅

订阅专栏

直接执行 sbt 会在当前目录下面创建 target 目录
sbt 的目录格局一般为 lib/ (该目录下存储与编译相关的 jar 文件)
project/ src/main/scala/ src/main/test/scala
复制 jar 文件 spark-assembly *hadoop2.5.1.jar 到 lib 目录下

[root@localhost word]# find ../spark -name “spark*jar” |grep assem
../spark/assembly/target/scala-2.10/spark-assembly-1.1.2-SNAPSHOT-hadoop2.5.1.jar
../spark/dist/lib/spark-assembly-1.1.2-SNAPSHOT-hadoop2.5.1.jar
[root@localhost word]# cp ../spark/dist/lib/spark-assembly-1.1.2-SNAPSHOT-hadoop2.5.1.jar lib/
[root@localhost word]# ls lib
spark-assembly-1.1.2-SNAPSHOT-hadoop2.5.1.jar

编辑 wordcount.scala

import org.apache.spark.{SparkContext, SparkConf}
import org.apache.spark.SparkContext._
object wordCount{

def main(args: Array[String]){
    if (args.length == 0) {
    System.err.println("Usage bin/spark-submit [options] --class wordCount wordCount.jar <file1:URI>")
    System.err.println("Usage bin/spark-submit [options] --class wordCount wordCount.jar hdfs://172.16.1.141:9000/test.txt")
    System.exit(1);
}
    val conf = new SparkConf().setAppName("WordCount")
    val sc = new SparkContext(conf)
    val doc = sc.textFile(args(0))
    doc.cache()
    val words = doc.flatMap(_.split(""))
    val pairs = words.map( x=> (x,1))
    val res = pairs.reduceByKey(_+_)
    res.collect().foreach(println)
    sc.stop()
}

}

编辑 build.sbt

[root@localhost word]# cat build.sbt
name := “wordCount”
[blank line]
version := “1.0”
[blank line]
scalaVersion := “2.11.4”
6 . 编译打包成 jar 文件
```
[root@localhost word]# sbt package  -Dsbt.ivy.home=/root/.ivy2
```
[info] Set current project to wordCount (in build file:/opt/htt/temp_20140611/java/word/)
[info] Updating {file:/opt/htt/temp_20140611/java/word/}word…
[info] Resolving jline#jline;2.12 …
[info] Done updating.
[info] Compiling 2 Scala sources to /opt/htt/temp_20140611/java/word/target/scala-2.11/classes…
[warn] Multiple main classes detected. Run 'show discoveredMainClasses' to see the list
[info] Packaging /opt/htt/temp_20140611/java/word/target/scala-2.11/wordcount_2.11-1.0.jar …
[info] Done packaging.
[success] Total time: 11 s, completed Jan 5, 2015 8:37:38 AM
[root@localhost word]#
1. 编译 class 文件到当前目录
scalac src/main/scala/wordCount.scala -cp lib/spark-assembly-1.1.2-SNAPSHOT-hadoop2.5.1.jar
调用spark 执行

../spark/bin/spark-submit –class wordCount target/scala-2.11/wordcount_2.11-1.0.jar hdfs://172.16.1.141:9000/opt/old/htt/test/test.txt

参考文章： http://www.aboutyun.com/thread-8587-1-1.html

sbt介绍
sbt是一个代码编译工具，是scala界的mvn，可以编译scala，java等，需要java1.6以上。

sbt项目环境建立
sbt编译需要固定的目录格式，并且需要联网，sbt会将依赖的jar包下载到用户home的.ivy2下面，目录结构如下：

|--build.sbt
|--lib
|--project
|--src
| |--main
| | |--scala
| |--test
| |--scala
|--sbt
|--target

复制代码

以上建立目录如下：

mkdir -p ~/spark_wordcount/lib
mkdir -p ~/spark_wordcount/project
mkdir -p ~/spark_wordcount/src/main/scala
mkdir -p ~/spark_wordcount/src/test/scala
mkdir -p ~/spark_wordcount/target

复制代码

然后拷贝spark安装目录的sbt目录的 sbt脚本和sbt的jar包

cp /path/to/spark/sbt/sbt* ~/spark_wordcount/

复制代码

由于spark的sbt脚本默认查找./sbt目录，修改如下

JAR=sbt/sbt-launch-${SBT_VERSION}.jar
to
JAR=sbt-launch-${SBT_VERSION}.jar

复制代码

拷贝spark的jar包到，sbt的lib目录

cp /path/to/spark/assembly/target/scala-2.10/spark-assembly_2.10-0.9.0-incubating-hadoop2.2.0.jar \
> ~/spark_wordcount/lib/

复制代码

建立build.sbt配置文件,各行需要有一个空行分割

name := "WordCount"
[this is bank line]
version := "1.0.0"
[this is bank line]
scalaVersion := "2.10.3"

复制代码

由于spark的sbt脚本需要到project的build.properties文件找sbt的版本号，我们建立该文件，增加如下内容：

sbt.version=0.12.4

复制代码

Spark WordCount程序编写及编译
建立WordCount.scala源文件，假设需要包为spark.example

mkdir -p ~/spark_wordcount/src/main/scala/spark/example
vi -p ~/spark_wordcount/src/main/scala/spark/example/WordCount.scala

复制代码

添加具体的程序代码，并保存

package spark.example
import org.apache.spark._
import SparkContext._
object WordCount {
def main(args: Array[String]) {
//命令行参数个数检查
if (args.length == 0) {
System.err.println("Usage: spark.example.WordCount <input> <output>")
System.exit(1)
}
//使用hdfs文件系统
val hdfsPathRoot = "hdfshost:9000"
//实例化spark的上下文环境
val spark = new SparkContext(args(0), "WordCount",
System.getenv("SPARK_HOME"),SparkContext.jarOfClass(this.getClass))
//读取输入文件
val inputFile = spark.textFile(hdfsPathRoot + args(1))
//执行WordCount计数
//读取inputFile执行方法flatMap，将每行通过空格分词
//然后将该词输出该词和计数的一个元组，并初始化计数
//为 1，然后执行reduceByKey方法，对相同的词计数累
//加
val countResult = inputFile.flatMap(line => line.split(" "))
.map(word => (word, 1))
.reduceByKey(_ + _)
//输出WordCount结果到指定目录
countResult.saveAsTextFile(hdfsPathRoot + args(2))
}
}

复制代码

到spark_wordcount目录，执行编译：

cd ~/spark_wordcount/
./sbt compile

复制代码

打成jar包

./sbt package

复制代码

编译过程，sbt需要上网下载依赖工具包，jna，scala等。编译完成后可以在target/scala-2.10/目录找到打包好的jar

[root@bd001 scala-2.10]# pwd
/usr/local/hadoop/spark_wordcount/target/scala-2.10
[root@bd001 scala-2.10]# ls
cache classes wordcount_2.10-1.0.0.jar

复制代码

WordCount执行
可以参考Spark分布式运行于hadoop的yarn上的方法，写一个执行脚本

#!/usr/bin/env bash
SPARK_JAR=./assembly/target/scala-2.10/spark-assembly_2.10-0.9.0-incubating-hadoop2.2.0.jar \
./bin/spark-class org.apache.spark.deploy.yarn.Client \
--jar ~/spark_wordcount/target/scala-2.10/wordcount_2.10-1.0.0.jar \
--class spark.example.WordCount \
--args yarn-standalone \
--args /testWordCount.txt \
--args /resultWordCount \
--num-workers 3 \
--master-memory 4g \
--worker-memory 2g \
--worker-cores 2

复制代码

然后，拷贝一个名为testWordCount.txt的文件进hdfs

hdfs dfs -copyFromLocal ./testWordCount.txt /testWordCount.txt

复制代码

然后执行脚本，过一会就可以看到结果了

xiewenbo

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
sbt 编译spark 的wordcount 程序

直接执行 sbt 会在当前目录下面创建 target 目录sbt 的目录格局一般为 lib/ (该目录下存储与编译相关的 jar 文件) project/ src/main/scala/ src/main/test/scala复制 jar 文件 spark-assembly *hadoop2.5.1.jar 到 lib 目录下[root@localhost wo
复制链接

扫一扫

专栏目录