Sqoop导入数据库数据到Hive的两种方式

javastart

已于 2022-04-17 09:38:09 修改

阅读量3.3k

点赞数

CC 4.0 BY-SA版权

文章标签： sqoop

于 2022-04-17 09:33:53 首次发布

本文链接：https://blog.csdn.net/javastart/article/details/124225095

本文详细介绍了使用Sqoop的两种方式将关系型数据库数据导入Hive，包括基本命令和注意事项。对比了SqoopAPI和HCatalogAPI的区别，如数据格式支持、数据增加形式以及字段处理方式。 Sqoop方式支持的数据格式较少，允许数据覆盖，而HCatalog则支持更多格式且不允许覆盖，要求源表和目标表字段名相同。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

通过Sqoop将关系型数据库数据到Hive有两种方式，一种是Sqoop API，一种是使用HCatalog API。两种方式略有不同，各有优缺点，这里主要介绍两者的区别与共同点。

一、Sqoop方式
Sqoop方式基本的命令如下：

sqoop import \
--hive-import \
--connect 'jdbc:mysql://localhost:3306/test' \
--username 'root' \
--password '123456789' \
--query " select order_no from driver_action where \$CONDITIONS" \
--hive-database test \
--hive-table driver_action \
--hive-partition-key pt \
--hive-partition-value 20190901 \
--null-string '' \
--null-non-string '' \
--num-mappers 1 \
--target-dir /tmp/test \
--delete-target-dir

通过–query选项中"where $CONDITIONS"是必须带，否者会报错，如下：

19/08/30 11:02:24 ERROR tool.ImportTool: Encountered IOException running import job: java.io.IOException: Query [SELECT * FROM t_passenger ] must contain '$CONDITIONS' in WHERE clause.
   at org.apache.sqoop.manager.ConnManager.getColumnTypes(ConnManager.java:300)
   at org.apache.sqoop.orm.ClassWriter.getColumnTypes(ClassWriter.java:1833)
   at org.apache.sqoop.orm.ClassWriter.generate(ClassWriter.java:1645)
   at org.apache.sqoop.tool.CodeGenTool.generateORM(CodeGenTool.java:107)
   at org.apache.sqoop.tool.ImportTool.importTable(ImportTool.java:478)
   at org.apache.sqoop.tool.ImportTool.run(ImportTool.java:605)
   at org.apache.sqoop.Sqoop.run(Sqoop.java:143)
   at org.apache.hadoop.util.ToolRunner.run(ToolRunner.java:70)
   at org.apache.sqoop.Sqoop.runSqoop(Sqoop.java:179)
   at org.apache.sqoop.Sqoop.runTool(Sqoop.java:218)
   at org.apache.sqoop.Sqoop.runTool(Sqoop.java:227)
   at org.apache.sqoop.Sqoop.main(Sqoop.java:236)

通过–query可以实现复杂的数据抽取，简单的数据抽取可以使用下面方式：

sqoop import \
--hive-import \
--connect 'jdbc:mysql://localhost:3306/test' \
--table driver_action \
--username 'root' \
--password '123456789' \
--columns " order_no" \
--where "where order_no is not null" \
--hive-database test \
--hive-table driver_action \
--hive-partition-key pt \
--hive-partition-value 20190901 \
--null-string '' \
--null-non-string '' \
--num-mappers 1 \
--target-dir /tmp/test \
--delete-target-dir

二、HCatalog方式

HCatalog方式基本的命令如下：

sqoop import \
--connect jdbc:mysql://localhost:3306/test\
--username 'root' \
--password 'root' \
--query "SELECT order_no FROM driver_action WHERE \$CONDITIONS" \
--hcatalog-database test \
--hcatalog-table driver_action \
--hcatalog-partition-keys pt \
--hcatalog-partition-values 20200104 \
--hcatalog-storage-stanza 'stored as orc tblproperties ("orc.compress"="SNAPPY")' \
--num-mappers 1

或

sqoop import \
--connect jdbc:mysql://localhost:3306/test\
--username 'root' \
--password 'root' \
--table driver_action \
--columns " order_no" \
--where "where order_no is not null" \
--hcatalog-database test \
--hcatalog-table driver_action \
--hcatalog-partition-keys pt \
--hcatalog-partition-values 20200104 \
--hcatalog-storage-stanza 'stored as orc tblproperties ("orc.compress"="SNAPPY")' \
--num-mappers 1

三、区别

HCatalog方式与Sqoop方式的参数基本都是相同，只是个别不一样，都是可以实现Sqoop将数据抽取到Hive，下面主要介绍一下两者的区别：
数据格式
Sqoop方式支持的数据格式较少，HCatalog支持的较多，比如Sqoop方式不支持ORC格式的表，但是HCatalog支持。

数据增加形式
Sqoop方式允许数据覆盖，HCatalog不允许数据覆盖，每次都只是追加。

字段
Sqoop方式比较随意，不要求源表和目标表字段相同(字段名称和个数都可以不相同)，它抽取的方式是将字段按顺序插入，比如目标表有3个字段，源表有一个字段，它会将数据插入到Hive表的第一个字段，其余字段为NULL。但是HCatalog不同，源表和目标表字段名需要相同，字段个数可以不相等，如果字段名不同，抽取数据的时候会报NullPointerException错误。HCatalog抽取数据时，会将字段对应到相同字段名的字段上，哪怕字段个数不相等。

针对不同字段名，想要使用HCatalog方式将数据插入，可以使用下面的方式：

sqoop import \
--connect jdbc:mysql://localhost:3306/test\
--username 'root' \
--password 'root' \
--query "SELECT order_no_src as order_no_target FROM driver_action WHERE \$CONDITIONS" \
--hcatalog-database test \
--hcatalog-table driver_action \
--hcatalog-partition-keys pt \
--hcatalog-partition-values 20200104 \
--hcatalog-storage-stanza 'stored as orc tblproperties ("orc.compress"="SNAPPY")' \
--num-mappers 1