Sqoop之快速入门


一、简介

Sqoop是一款开源的工具,主要用于在Hadoop(Hive)与传统的数据库(mysql、postgresql…)间进行数据的传递,可以将一个关系型数据库(例如 : MySQL ,Oracle ,Postgres等)中的数据导进到Hadoop的HDFS中,也可以将HDFS的数据导进到关系型数据库中。

二、原理

将导入或导出命令翻译成mapreduce程序来实现。在翻译出的mapreduce中主要是对inputformat和outputformat进行定制。

三、同步案例

3.1、导入数据

3.1.1、RDBMS到HDFS

1、全部导入

bin/sqoop import \
--connect jdbc:mysql://主机名:3306/数据库 \
--username 用户名 \
--password 密码 \
--table 表名 \
--target-dir HDFS路径 \
--delete-target-dir \
--num-mappers 1 \
--fields-terminated-by "\t"

2、查询导入

bin/sqoop import \
--connect jdbc:mysql://主机名:3306/数据库 \
--username 用户名 \
--password 密码 \
--target-dir HDFS路径 \
--delete-target-dir \
--num-mappers 1 \
--fields-terminated-by "\t" \
--query 'select 字段.. from 表名 where id <=1 and $CONDITIONS;'

3、导入指定列

bin/sqoop import \
--connect jdbc:mysql://主机名:3306/数据库 \
--username 用户名 \
--password 密码 \
--target-dir HDFS路径 \
--delete-target-dir \
--num-mappers 1 \
--fields-terminated-by "\t" \
--table 表名 \
--columns 列名1,列名2...

4、where过滤导入

bin/sqoop import \
--connect jdbc:mysql://主机名:3306/数据库 \
--username 用户名 \
--password 密码 \
--target-dir HDFS路径 \
--delete-target-dir \
--num-mappers 1 \
--fields-terminated-by "\t" \
--table 表名 \
--where "表字段过滤条件"

3.1.2、RDBMS到Hive

bin/sqoop import \
--connect jdbc:mysql://主机名:3306/数据库 \
--username 用户名 \
--password 密码 \
--table 表名 \
--num-mappers 1 \
--hive-import \
--fields-terminated-by "\t" \
--hive-overwrite \
--hive-table hive表名

3.1.3、RDBMS到Hbase

bin/sqoop import \
--connect jdbc:mysql://主机名:3306/数据库 \
--username 用户名 \
--password 密码 \
--table 表名 \
--columns "列名1,列名2.." \
--column-family "hbase列簇名" \
--hbase-create-table \
--hbase-row-key "mysql指定那列为rowkey" \
--hbase-table "hbase中表名" \
--num-mappers 1 \
--split-by 切分键,对应表中的列,和rowkey对应

3.2、导出数据

3.2.1、HIVE/HDFS到RDBMS

bin/sqoop export \
--connect jdbc:mysql://主机名:3306/数据库 \
--username 用户名 \
--password 密码 \
--table 表名 \
--num-mappers 1 \
--export-dir HDFS导出的文件路径 \
--input-fields-terminated-by "\t"

3.3、脚本打包

3.3.1、创建一个.opt文件

mkdir opt
touch opt/job_HDFS2RDBMS.opt

3.3.2、编写sqoop脚本

编辑文件:vi opt/job_HDFS2RDBMS.opt
bin/sqoop export \
--connect jdbc:mysql://主机名:3306/数据库 \
--username 用户名 \
--password 密码 \
--table 表名 \
--num-mappers 1 \
--export-dir HDFS导出的文件路径 \
--input-fields-terminated-by "\t"

3.3.3、执行脚本

bin/sqoop --options-file opt/job_HDFS2RDBMS.opt
  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值