windows下IDEA使用spark连接hive

1、前言

 由于需要在本地环境连接测试集群相关的一些数据,传统方式需要先打jar包,然后再放在集群上使用spark-submit,这样非常麻烦,所以在网上找了下开发环境使用sparksql连接hive的方法,经过许久的折腾,总算弄成功了,特此记录一下。

2、准备

 A、配置文件
把集群上的hadoop etc/hadoop目录下的core-site.xml   hdfs-site.xml  (读取hdfs上的文件必须)
hive的配置文件 hive-site.xml(读取hive必须)拷贝到resources目录下,

在这里插入图片描述

 B、hadoop相关配置文件

在这里插入图片描述

下载windows下的hadoop winutils插件,https://github.com/steveloughran/winutils
按照自己的版本来,然后配置环境变量
HADOOP_HOME=
HADOOP_USER=

在这里插入图片描述
在这里插入图片描述

3、pom.xml引入依赖包

  <dependencies>
    <dependency>
      <groupId>org.apache.hadoop</groupId>
      <artifactId>hadoop-common</artifactId>
      <version>2.7.2</version>
    </dependency>

    <!-- https://mvnrepository.com/artifact/org.apache.hadoop/hadoop-mapreduce-client-core -->
    <dependency>
      <groupId>org.apache.hadoop</groupId>
      <artifactId>hadoop-mapreduce-client-core</artifactId>
      <version>2.7.2</version>
    </dependency>

    <dependency>
      <groupId>org.apache.spark</groupId>
      <artifactId>spark-repl_2.11</artifactId>
      <version>${spark.version}</version>
    </dependency>

    <dependency>
      <groupId>org.apache.spark</groupId>
      <artifactId>spark-hive_2.11</artifactId>
      <version>${spark.version}</version>
    </dependency>

    <dependency>
      <groupId>mysql</groupId>
      <artifactId>mysql-connector-java</artifactId>
      <version>8.0.21</version>
    </dependency>
    <dependency>
      <groupId>org.apache.spark</groupId>
      <artifactId>spark-core_2.11</artifactId>
      <version>${spark.version}</version>
    </dependency>
    <dependency>
      <groupId>org.apache.spark</groupId>
      <artifactId>spark-sql_2.11</artifactId>
      <version>${spark.version}</version>
      <scope>compile</scope>
    </dependency>

  </dependencies>


4、测试代码

package org;
import org.apache.spark.sql.*;

public class SparkToCSVJava {

    public static void main(String[] args) throws ParseException {

        SparkSession spark = SparkSession.builder()
                .appName("ParseCSV")
                .master("local[2]")
                .config("spark.executor.cores", "1")
                .config("spark.executor.memory", "1G")
                .config("hive.exec.dynamic.partition", "true")
                .config("spark.serializer", "org.apache.spark.serializer.KryoSerializer")
                .config("hive.exec.dynamic.partition.mode", "nonstrict")
                .config("spark.sql.sources.partitionOverwriteMode", "dynamic")
                .config("hive.metastore.uris", "thrift://hadoop103:9083")
                .enableHiveSupport()
                .getOrCreate();

        Dataset df=spark.sql("show databases");

        df.show();
    }
}

在这里插入图片描述

  • 1
    点赞
  • 6
    收藏
    觉得还不错? 一键收藏
  • 2
    评论
### 回答1: 在Windows使用IntelliJ IDEA连接SparkHive,需要进行以下步骤: 1. 安装Java和Spark:首先需要安装Java和Spark,并设置环境变量。 2. 下载Hive JDBC驱动:从Apache Hive官网下载Hive JDBC驱动,并将其添加到Spark的classpath。 3. 创建SparkSession:在Java代码创建SparkSession对象,并设置连接Hive的参数,如下所示: ``` SparkSession spark = SparkSession.builder() .appName("SparkHiveExample") .config("spark.sql.warehouse.dir", "/user/hive/warehouse") .config("hive.metastore.uris", "thrift://localhost:9083") .enableHiveSupport() .getOrCreate(); ``` 其,`spark.sql.warehouse.dir`指定Hive的数据仓库目录,`hive.metastore.uris`指定Hive的元数据存储地址。 4. 执行Hive查询:使用SparkSession对象执行Hive查询,如下所示: ``` Dataset<Row> result = spark.sql("SELECT * FROM mytable"); result.show(); ``` 其,`mytable`是Hive的表名。 通过以上步骤,就可以在Windows使用IntelliJ IDEA连接SparkHive了。 ### 回答2: 在Windows操作系统下,使用IntelliJ IDEA连接Apache Spark到Apache Hive需要以下步骤: 1. 安装Spark<br> 首先需要安装Apache Spark,并将路径添加到系统环境变量。建议使用最新版本的Spark,因为这些版本支持最新版本的Hive。 2. 安装Hadoop<br> 要访问Hive,需要安装Hadoop并将路径添加到系统环境变量Spark使用Hadoop API访问HDFS,并通过Hive Metastore来访问Hive表。 3. 添加Spark样例库<br> 在IntelliJ IDEA打开菜单“文件/设置”,然后在左侧窗格选择“Libraries”。点击“+”图标,选择“Java”,然后选择Spark样例库的路径,然后点击“OK”。 4. 连接Hive<br> 创建一个Scala或Java项目。然后在IDEA打开窗口“View”菜单下的“Tool Windows”,然后单击“Database”。 在“Database”窗口,单击“+”图标,然后选择“Data Source” -> “Hive”。输入Hive Metastore的URL、用户名和密码,然后单击“Test Connection”以测试连接是否正常。 5. 创建连接<br> 在“Database”窗口,单击“+”图标,然后选择“Data Source” -> “Spark SQL”。输入Spark Master的URL,单击“Test Connection”以测试连接是否正常。 6. 创建Spark应用<br> 创建一个新的Scala或Java类,并添加以下依赖项: ``` "org.apache.spark" %% "spark-core" % "2.4.7" "org.apache.spark" %% "spark-sql" % "2.4.7" % "provided" ``` 编写Spark应用程序来连接Hive表,例如: ```scala val spark = SparkSession.builder() .appName("Hive Spark Connection") .config("hive.metastore.uris", "thrift://localhost:9083") .enableHiveSupport() .getOrCreate() val df = spark.sql("select * from testdb.testtable") df.show() ``` 7. 运行应用程序<br> 如果应用程序没有运行,可以单击“Run”按钮,或使用命令行运行程序: ```bash spark-submit --class com.example.MyApp --master local[*] myapp.jar ``` 这就是使用IntelliJ IDEASpark连接Hive的基本步骤。通过这种方法可以方便地使用SparkHive进行大数据处理。 ### 回答3: 在Windows使用IDEA连接SparkHive,需要准备以下环境: 1.安装Java JDK和Hadoop 首先需要安装Java JDK和Hadoop。建议使用Java 8版本,同时要确保Hadoop已经正确安装。在Windows下安装Hadoop,可以参考官方文档或者其他教程。 2.安装SparkHive组件 接下来需要安装SparkHive组件。可以直接在官方网站上下载安装包进行安装,或者使用Maven进行自动化管理。 3.配置IDEA开发环境 在IDEA,需要添加SparkHive相关依赖的jar包。可以在POM文件添加依赖,也可以手动添加Jar包。 同时,还需要配置SparkHive的配置参数,主要包括以下内容: (1)Spark的Master和AppName (2)Hive Thrift Server的地址和端口 (3)Hive的JDBC驱动程序 (4)Hive的用户名和密码 (5)Hive的默认数据库名称 上述配置可以在IDEA的“Run Configuration”进行设置。 4.编写代码连接SparkHiveIDEA,可以使用Scala或Java编写代码连接SparkHive。示例代码如下: ```scala import org.apache.spark.sql.SparkSession val spark = SparkSession.builder.appName("connectHive").master("local").getOrCreate() val df = spark.read.format("jdbc").option("url", "jdbc:hive2://hive-server:10000/default").option("driver", "org.apache.hive.jdbc.HiveDriver").option("user", "hive").option("password", "hive").option("dbtable", "mytable").load() df.show() ``` 在这个示例代码,首先创建了一个Spark Session,并指定Master和AppName。然后使用Spark SQL的API连接Hive,通过HiveServer2访问Hive的“mytable”表,最后展示查询结果。 总之,在Windows使用IDEA连接SparkHive,需要安装Java JDK、Hadoop、SparkHive组件,配置IDEA开发环境,然后使用Scala或Java编写连接代码。
评论 2
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值