sqoop将mysql数据库导入hive_用sqoop将mysql的数据导入到hive表中

最新推荐文章于 2023-04-16 16:45:27 发布

公孙珣

最新推荐文章于 2023-04-16 16:45:27 发布

阅读量482

点赞数

文章标签： sqoop将mysql数据库导入hive

本文链接：https://blog.csdn.net/weixin_36255893/article/details/114000620

版权

本文详细介绍了如何使用sqoop将mysql数据库中的数据导入到hdfs，然后进一步导入到hive表中，包括使用--direct选项提高效率，以及直接通过sqoop将mysql数据导入hive的步骤。

摘要由CSDN通过智能技术生成

1：先将mysql一张表的数据用sqoop导入到hdfs中

准备一张表

需求将 bbs_product 表中的前100条数据导导出来只要id brand_id和 name 这3个字段

数据存在 hdfs 目录 /user/xuyou/sqoop/imp_bbs_product_sannpy_ 下

bin/sqoop import\--connect jdbc:mysql://172.16.71.27:3306/babasport \

--username root \--password root \--query 'select id, brand_id,name from bbs_product where $CONDITIONS LIMIT 100'\--target-dir /user/xuyou/sqoop/imp_bbs_product_sannpy_ \--delete-target-dir \--num-mappers 1\--compress \--compression-codec org.apache.hadoop.io.compress.SnappyCodec \--fields-terminated-by '\t'

ps：如果导出的数据库是mysql 则可以添加一个属性 --direct

1 bin/sqoop import\2 --connect jdbc:mysql://172.16.71.27:3306/babasport \

3 --username root \4 --password root \5 --query 'select id, brand_id,name from bbs_product where $CONDITIONS LIMIT 100'\6 --target-dir /user/xuyou/sqoop/imp_bbs_product_sannpy_ \7 --delete-target-dir \8 --num-mappers 1\9 --compress \10 --compression-codec org.apache.hadoop.io.compress.SnappyCodec \11 --direct \12 --fields-terminated-by '\t'

加了 direct 属性在导出mysql数据库表中的数据会快一点执行的是mysq自带的导出功能

第一次执行所需要的时间

第二次执行所需要的时间 (加了direct属性)

执行成功

2：启动hive 在hive中创建一张表

1 drop table if exists default.hive_bbs_product_snappy ;2 create table default.hive_bbs_product_snappy(3 　id int,4 　brand_id int,5 name string6 )7 ROW FORMAT DELIMITED FIELDS TERMINATED BY '\t' ;

3：将hdfs中的数据导入到hive中

1 load data inpath '/user/xuyou/sqoop/imp_bbs_product_sannpy_' into table default.hive_bbs_product_snappy ;

4：查询 hive_bbs_product_snappy 表

1 select * from hive_bbs_product_snappy;

此时hdfs 中原数据没有了

然后进入hive的hdfs存储位置发现

注意：sqoop 提供了直接将mysql数据导入 hive的功能底层步骤就是以上步骤

创建一个文件 touch test.sql 编辑文件 vi test.sql

1 use default;2 drop table if exists default.hive_bbs_product_snappy ;3 create table default.hive_bbs_product_snappy(4 id int,5 brand_id int,6 name string7 )8 ROW FORMAT DELIMITED FIELDS TERMINATED BY '\t' ;

在启动hive的时候执行 sql脚本

bin/hive -f /opt/cdh-5.3.6/sqoop-1.4.5-cdh5.3.6/test.sql

执行sqoop直接导入hive的功能

1 bin/sqoop import\2 --connect jdbc:mysql://172.16.71.27:3306/babasport \

3 --username root \4 --password root \5 --table bbs_product \6 --fields-terminated-by '\t'\7 --delete-target-dir \8 --num-mappers 1\9 --hive-import\10 --hive-database default\11 --hive-table hive_bbs_product_snappy

看日志输出可以看出在执行map任务之后又执行了load data

查询 hive 数据

公孙珣

关注

0
点赞
踩
3

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫