Spark 安装及运行第一个程序遇到问题总结

最新推荐文章于 2022-03-31 07:00:00 发布

zhouyu7373

最新推荐文章于 2022-03-31 07:00:00 发布

阅读量1k

点赞数 1

分类专栏：大数据文章标签： spark scala

本文链接：https://blog.csdn.net/zhouyu7373/article/details/50772588

版权

大数据专栏收录该内容

3 篇文章 0 订阅

订阅专栏

这里只说明一下单节点怎么配置，集群scp拷贝过去，配置一下启动节点就可以了

1、下载scala2.11.4版本下载地址为：http://www.scala-lang.org/download/2.11.4.html

2、解压和安装（自己随便找个目录）：解压：[spark@S1PA11 scala]$ tar -xvf scala-2.11.4.tgz

3、编辑 ~/.bash_profile（这是修改当前用户的环境变量，也可以直接编辑 vim /etc/profile）文件增加SCALA_HOME环境变量配置，
export SCALA_HOME=/home/spark/opt/scala-2.11.4
PATH=$PATH:$HOME/bin:$JAVA_HOME/bin:${SCALA_HOME}/bin

立即生效 bash_profile ，[spark@S1PA11 scala]$ source ~/.bash_profile （改哪个刷哪个）

4、验证scala：[spark@S1PA11 scala]$ scala -version
Scala code runner version 2.11.4 -- Copyright 2002-2013, LAMP/EPFL

5、下载spark，wget http://d3kbcqa49mib13.cloudfront.net/spark-1.2.0-bin-hadoop2.4.tgz

6、在master主机配置spark ：将下载的文件解压 tar -xvf spark-1.2.0-bin-hadoop2.4.tgz

7、配置环境变量SPARK_HOME 和 PATH

export SPARK_HOME=/home/spark/opt/spark-1.2.0-bin-hadoop2.4
PATH=$PATH:$HOME/bin:$JAVA_HOME/bin:${SCALA_HOME}/bin:${SPARK_HOME}/bin:${HADOOP_HOME}/bin

刷新 source ~/.bash_profile （改哪个刷哪个）

8、进入 spark conf目录：

配置spark-env.sh

首先把spark-env.sh.template copy spark-env.sh

vi spark-env.sh文件在最下面增加：

export JAVA_HOME=/home/spark/opt/java/jdk1.6.0_37
export SCALA_HOME=/home/spark/opt/scala-2.11.4
export SPARK_MASTER_IP=10.58.44.47
export SPARK_WORKER_MEMORY=2g
export HADOOP_CONF_DIR=/home/spark/opt/hadoop-2.6.0/etc/hadoop

9、进入sbin 目录启动 ./start-all.sh

启动成功主节点会多两个进程

[spark@S1PA11 sbin]$ jps
31233 ResourceManager
27201 Jps
30498 NameNode
30733 SecondaryNameNode
5648 Worker
5399 Master
15888 JobHistoryServer

启动成功访问一下链接：http://192.168.159.144:8080/

换成自己服务器的IP

10、启动时遇到的报错情况

会有一个找不到主函数的情况

找不到 org.apache.spark.launcher.Main ，因为我的JDK用的1.6的查了一下资料1.5以后就不支持1.6的版本了可以选择修改JDK版本或者降spark版本到1.5以下

运行第一个程序：

1、进入bin目录下运行 ./spark-shell

2、接下来，我们读取“README.md”这个文件：

var file = sc.textFile("file:///export/servers/spark-1.4.1-bin-hadoop1/README.md")

var sparks = file.filter(line => line.contains("Spark"))

sparks.count

三步命令

第二个图上的命令可能会出现异常

Input path does not exist: hdfs://sandbox:9000/user/root/README.md

可以用图上的命令也可以用 var file = sc.textFile("file:///export/servers/spark-1.4.1-bin-hadoop1/README.md")

zhouyu7373

关注

1
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

专栏目录