Spark编译

Spark编译准备

分布式计算框架
1.首先安装好maven(3.3.9)和scala(2.11.8)

2.安装 Git(建议安装一下,编译的时候可能用到,脚本里有提:
sudo yum install git

本文档spark版本:2.2.0
建议不要用最后一个是0的,因为没有修复过bug,最后一位代表修改过bug的版本。

官网building spark地址:http://spark.apache.org/docs/latest/building-spark.html
老版本地址(比如) : http://spark.apache.org/docs/2.2.2/building-spark.html

spark源码编译(mvn命令直接编译)

先修改编译时的内存(在spark解压的目录(未编译的目录)下执行):
export MAVEN_OPTS="-Xmx2g --XX:ReserveDCodeCacheSize=512m"

./build/mvn -DskipTests clean package (跳过测试,打包)(可以找maven文档看看)

./build/mvn -Pyarn -Phive -Phive-thriftserver -Phadoop-2.7 -Dhadoop.version=2.7.3 -DskipTests clean package

报zinc错误的话,jps查看进程,把一个nicgun什么东西kill掉。

Spark编译(使用自带的脚本编译)

可以生成可运行的包,可以查看make-distribution.sh来
./dev/make-distribution.sh
–name 2.7.3 --tgz
-Phadoop-2.7 -Dhadoop.version=2.7.3
-Phive -Phive-thriftserver -Pyarn

执行会很慢,因为要检测版本,所以可以修改make-distribution.sh把检测版本的注释掉,然后加上:
VERSION=2.2.0
SCALA_VERSION=2.11
SPARK_HADOOP_VERSION=2.7.3
SPARK_HIVE=1

然后再次编译。

最后在spark根目录下出现了一个tgz的包,名字是spark-2.2.0-bin-2.7.3.tgz
名字来源在make-distribution.sh里面(最后面)

解压spark-2.2.0-bin-2.7.3.tgz后,目录结构:
bin 存放客户端相关的脚本
conf 存放配置文件
data 存放测试数据
examples Spark自带的测试用例 *****这些代码,多看看,多学学
jars 存放Spark相应的jar包
sbin 存放服务相关的脚本:启停集群。。。
yarn 存放yarn相关的jar

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
### 回答1: Hive on Spark是一种将Hive与Spark结合起来使用的方式,可以提高数据处理的效率和性能。下面是配置Hive on Spark的步骤: 1. 配置Maven 首先需要安装Maven,并配置好环境变量。可以在Maven官网下载最新版本的Maven。 2. 编译Spark 下载Spark源码,使用Maven编译Spark。在Spark源码目录下执行以下命令: mvn -DskipTests clean package 编译完成后,在target目录下可以找到编译好的Spark包。 3. 配置Hive 下载Hive源码,使用Maven编译Hive。在Hive源码目录下执行以下命令: mvn clean package -DskipTests -Pspark 编译完成后,在packaging/target目录下可以找到编译好的Hive包。 4. 配置Spark和Hive的环境变量 在.bashrc或.bash_profile文件中添加以下环境变量: export SPARK_HOME=/path/to/spark export HIVE_HOME=/path/to/hive 5. 配置Hive on Spark 在Hive的conf目录下创建hive-site.xml文件,并添加以下配置: <property> <name>hive.execution.engine</name> <value>spark</value> </property> 6. 启动Hive on Spark 使用以下命令启动Hive on Spark: $HIVE_HOME/bin/hive --service sparkthriftserver 启动成功后,可以使用JDBC连接到Hive on Spark,并执行SQL语句。 ### 回答2: Hive on Spark是将Hive与Spark结合起来使用的一种方式,通过Hive on Spark可以在Spark执行引擎上执行Hive的SQL语句,实现更好的性能和可伸缩性。在使用Hive on Spark之前,需要先进行一些配置和编译工作。 首先是配置Maven,需要在pom.xml文件中添加Spark和Hive on Spark的依赖。在配置Spark时,需要注意Spark的版本与Hive on Spark的版本的匹配,以避免出现兼容性问题。接下来需要在Spark和Hive的配置文件中,分别配置Spark的Master地址和Hive的元数据存储地址。 然后进行Spark编译工作,可以通过maven命令将spark源代码打包成jar文件。在编译过程中,需要根据实际情况添加必要的Spark插件和依赖项,以确保编译成功并与Hive on Spark兼容。 最后进行Hive的配置工作,需要在hive-site.xml文件中配置Hive on Spark的参数,如spark.master,spark.executor.memory等参数,以达到最优的运行效果。 总之,Hive on Spark的配置涉及多个方面,需要正确配置Maven依赖、Spark和Hive配置、进行Spark编译和进行Hive的参数配置,才能使Hive on Spark正常运行。配置过程中需要注意兼容性问题,以避免出现不必要的错误。 ### 回答3: Hive on Spark是基于Apache Spark的开源数据处理平台。用于支持对Hive进行实时查询和复杂分析的工具。为了配置Hive on Spark,需要以下步骤: 1.配置Maven 在进行Hive on Spark配置之前,需要先安装Maven。Maven是一个用于管理Java项目的构建工具,它可以轻松地管理spark-core和spark-sql等包,从而方便Hive on Spark的使用。 2.编译SparkSpark官网下载源代码后,运行以下命令进行编译: ``` build/mvn -DskipTests clean package ``` 以上命令会跳过所有测试,并将代码打包成可执行的JAR文件。 3.配置Hive 在进行Hive on Spark配置前,需要先安装Hadoop和Hive。安装好后,进行以下配置: 在hive-site.xml文件中添加以下配置: ``` <property> <name>hive.execution.engine.spark</name> <value>true</value> </property> <property> <name>spark.master</name> <value>local[*]</value> </property> <property> <name>spark.executor.memory</name> <value>2g</value> </property> ``` 4.将Spark包添加到Hive中 在Hive服务器上,进入Hive源代码目录,执行以下命令来将Spark包添加到Hive中: ``` ./build/dist/bin/addSbtPlugin.sh ``` 运行上述命令后,Spark包将被添加到Hive中。 5.使用Hive on Spark 现在,可以启动Hive并开始使用Hive on Spark。运行以下命令: ``` hive --hiveconf hive.execution.engine=spark ``` 以上就是Hive on Spark配置的过程。Maven管理Spark编译过程的包便于Hive on Spark使用和扩展。通过这些步骤,您可以轻松地开始使用Hive on Spark,从而帮助您更好地分析和管理数据。

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值