Spark 2.0分布式集群环境搭建

最新推荐文章于 2023-12-30 22:30:49 发布

IT雪

最新推荐文章于 2023-12-30 22:30:49 发布

阅读量218

点赞数

分类专栏： Spark

本文链接：https://blog.csdn.net/qq_38709565/article/details/88760954

版权

Spark 专栏收录该内容

3 篇文章 0 订阅

订阅专栏

1、安装Hadoop并搭建好Hadoop集群环境

1、安装Hadoop并搭建好Hadoop集群环境

Spark分布式集群的安装环境，需要事先配置好Hadoop的分布式集群环境。

2、安装Spark

这里采用3台机器（节点）作为实例来演示如何搭建Spark集群，其中1台机器（节点）作为Master节点，另外两台机器（节点）作为Slave节点（即作为Worker节点），主机名分别为Slave01和Slave02。
在Master节点机器上，访问Spark官方下载地址，按照如下图下载。
20161205_010
下载完成后，执行如下命令：

sudo tar -zxf ~/下载/spark-2.0.2-bin-without-hadoop.tgz -C /usr/local/
cd /usr/local
sudo mv ./spark-2.0.2-bin-without-hadoop/ ./spark
sudo chown -R hadoop ./spark

3、配置环境变量

在Mster节点主机的终端中执行如下命令：

vim ~/.bashrc

在.bashrc添加如下配置：

export SPARK_HOME=/usr/local/spark
export PATH=$PATH:$SPARK_HOME/bin:$SPARK_HOME/sbin

执行如下命令使得配置立即生效：

source ~/.bashrc

4、Spark配置

在Master节点主机上进行如下操作：

配置slaves文件
将 slaves.template 拷贝到 slaves

cd /usr/local/spark/
cp ./conf/slaves.template ./conf/slaves

slaves文件设置Worker节点。编辑slaves内容,把默认内容localhost替换成如下内容：

slave01
slave02

配置spark-env.sh文件
将 spark-env.sh.template 拷贝到 spark-env.sh

cp ./conf/spark-env.sh.template ./conf/spark-env.sh

编辑spark-env.sh,添加如下内容：

export SPARK_DIST_CLASSPATH=$(/usr/local/hadoop/bin/hadoop classpath)
export HADOOP_CONF_DIR=/usr/local/hadoop/etc/hadoop
export SPARK_MASTER_IP=192.168.1.104

SPARK_MASTER_IP 指定 Spark 集群 Master 节点的 IP 地址；

配置好后，将Master主机上的/usr/local/spark文件夹复制到各个节点上。在Master主机上执行如下命令：

cd /usr/local/
tar -zcf ~/spark.master.tar.gz ./spark
cd ~
scp ./spark.master.tar.gz slave01:/home/hadoop
scp ./spark.master.tar.gz slave02:/home/hadoop

在slave01,slave02节点上分别执行下面同样的操作：

sudo rm -rf /usr/local/spark/
sudo tar -zxf ~/spark.master.tar.gz -C /usr/local
sudo chown -R hadoop /usr/local/spark

5、启动Spark集群

启动Spark集群前，要先启动Hadoop集群。在Master节点主机上运行如下命令：

cd /usr/local/hadoop/
sbin/start-all.sh

启动Master节点
在Master节点主机上运行如下命令：

cd /usr/local/spark/
sbin/start-master.sh

在Master节点上运行jps命令，可以看到多了个Master进程：

15093 Jps
14343 SecondaryNameNode
14121 NameNode
14891 Master
14509 ResourceManager

启动所有Slave节点
在Master节点主机上运行如下命令：

sbin/start-slaves.sh

分别在slave01、slave02节点上运行jps命令，可以看到多了个Worker进程

37553 DataNode
37684 NodeManager
37876 Worker
37924 Jps

3、在浏览器上查看Spark独立集群管理器的集群信息
在master主机上打开浏览器，访问http://master:8080,如下图：

20161205_010

6、关闭Spark集群

1、关闭Master节点

sbin/stop-master.sh

2、关闭Worker节点

sbin/stop-slaves.sh

3、关闭Hadoop集群

cd /usr/local/hadoop/
sbin/stop-all.sh

IT雪

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
Spark 2.0分布式集群环境搭建

目录1、安装Hadoop并搭建好Hadoop集群环境2、安装Spark3、配置环境变量4、Spark配置5、启动Spark集群6、关闭Spark集群1、安装Hadoop并搭建好Hadoop集群环境Spark分布式集群的安装环境，需要事先配置好Hadoop的分布式集群环境。2、安装Spark这里采用3台机器（节点）作为实例来演示如何搭建Spark集群，...
复制链接

扫一扫