这里只说明一下单节点怎么配置,集群scp拷贝过去,配置一下启动节点就可以了
1、下载scala2.11.4版本 下载地址为:http://www.scala-lang.org/download/2.11.4.html
2、解压和安装(自己随便找个目录): 解压 :[spark@S1PA11 scala]$ tar -xvf scala-2.11.4.tgz
3、编辑 ~/.bash_profile(这是修改当前用户的环境变量,也可以直接编辑 vim /etc/profile)文件 增加SCALA_HOME环境变量配置,
export SCALA_HOME=/home/spark/opt/scala-2.11.4
PATH=$PATH:$HOME/bin:$JAVA_HOME/bin:${SCALA_HOME}/bin
立即生效 bash_profile ,[spark@S1PA11 scala]$ source ~/.bash_profile (改哪个刷哪个)
4、验证scala:[spark@S1PA11 scala]$ scala -version
Scala code runner version 2.11.4 -- Copyright 2002-2013, LAMP/EPFL
5、下载spark,wget http://d3kbcqa49mib13.cloudfront.net/spark-1.2.0-bin-hadoop2.4.tgz
6、在master主机配置spark :将下载的文件解压 tar -xvf spark-1.2.0-bin-hadoop2.4.tgz
7、配置环境变量SPARK_HOME 和 PATH
export SPARK_HOME=/home/spark/opt/spark-1.2.0-bin-hadoop2.4
PATH=$PATH:$HOME/bin:$JAVA_HOME/bin:${SCALA_HOME}/bin:${SPARK_HOME}/bin:${HADOOP_HOME}/bin
刷新 source ~/.bash_profile (改哪个刷哪个)
8、进入 spark conf目录:
配置spark-env.sh
首先把spark-env.sh.template copy spark-env.sh
vi spark-env.sh文件 在最下面增加:
export JAVA_HOME=/home/spark/opt/java/jdk1.6.0_37export SCALA_HOME=/home/spark/opt/scala-2.11.4
export SPARK_MASTER_IP=10.58.44.47
export SPARK_WORKER_MEMORY=2g
export HADOOP_CONF_DIR=/home/spark/opt/hadoop-2.6.0/etc/hadoop
9、进入sbin 目录启动 ./start-all.sh
启动成功主节点会多两个进程
[spark@S1PA11 sbin]$ jps
31233 ResourceManager
27201 Jps
30498 NameNode
30733 SecondaryNameNode
5648 Worker
5399 Master
15888 JobHistoryServer
启动成功访问一下链接:http://192.168.159.144:8080/
换成自己服务器的IP
10、启动时遇到的报错情况
会有一个找不到主函数的情况
找不到 org.apache.spark.launcher.Main ,因为我的JDK用的1.6的查了一下资料1.5以后就不支持1.6的版本了可以选择修改JDK版本或者降spark版本到1.5以下
运行第一个程序:
1、进入bin目录下运行 ./spark-shell
2、接下来,我们读取“README.md”这个文件:
var file = sc.textFile("file:///export/servers/spark-1.4.1-bin-hadoop1/README.md")
var sparks = file.filter(line => line.contains("Spark"))
sparks.count
三步命令
第二个图上的命令可能会出现异常
Input path does not exist: hdfs://sandbox:9000/user/root/README.md
可以用图上的命令 也可以用 var file = sc.textFile("file:///export/servers/spark-1.4.1-bin-hadoop1/README.md")