.1
下载并解压
1
)下载地址:
http://mirrors.hust.edu.cn/apache/sqoop/1.4.6/
2
)上传安装包
sqoop-1.4.6.bin__hadoop-2.0.4-alpha.tar.gz
到
hadoop102
的
/opt/software
路径中
3
)解压
sqoop
安装包到指定目录,如:
[atguigu@hadoop102 software]$ tar -zxf sqoop-1.4.6.bin__hadoop-
2.0.4-alpha.tar.gz -C /opt/module/
4
)解压
sqoop
安装包到指定目录,如:
[atguigu@hadoop102 module]$ mv sqoop-1.4.6.bin__hadoop-2.0.4-
alpha/ sqoop
2.3.2
修改配置文件
1)
进入到
/opt/module/sqoop/conf
目录,重命名配置文件
[atguigu@hadoop102 conf]$ mv sqoop-env-template.sh sqoop-env.sh
2)
修改配置文件
[atguigu@hadoop102 conf]$ vim sqoop-env.sh
增加如下内容
export HADOOP_COMMON_HOME=/opt/module/hadoop-3.1.3
export HADOOP_MAPRED_HOME=/opt/module/hadoop-3.1.3
export HIVE_HOME=/opt/module/hive
export ZOOKEEPER_HOME=/opt/module/zookeeper-3.5.7
export ZOOCFGDIR=/opt/module/zookeeper-3.5.7/conf
2.3.3
拷贝
JDBC
驱动
1
)将
mysql-connector-java-5.1.48.jar
上传到
/opt/software
路径
2
)进入到
/opt/software/
路径,拷贝
jdbc
驱动到
sqoop
的
lib
目录下。
[atguigu@hadoop102 software]$ cp mysql-connector-java-
5.1.48.jar /opt/module/sqoop/lib/
2.3.4
验证
Sqoop
我们可以通过某一个
command
来验证
sqoop
配置是否正确:
[atguigu@hadoop102 sqoop]$ bin/sqoop help
出现一些
Warning
警告(警告信息已省略),并伴随着帮助命令的输出:
Available commands:
codegen Generate code to interact with database
records
create-hive-table Import a table definition into Hive
eval Evaluate a SQL statement and display the
results
export Export an HDFS directory to a database table
help List available commands
import Import a table from a database to HDFS
import-all-tables Import tables from a database to HDFS
import-mainframe Import datasets from a mainframe server to
HDFS
job Work with saved jobs
list-databases List available databases on a server
list-tables List available tables in a database
merge Merge results of incremental imports
metastore Run a standalone Sqoop metastore
version Display version information
2.3.5
测试
Sqoop
是否能够成功连接数据库
[atguigu@hadoop102 sqoop]$ bin/sqoop list-databases --connect
jdbc:mysql://hadoop102:3306/ --username root --password 000000
出现如下输出:
information_schema
metastore
mysql
oozie
performance_schema
2.同步策略
数据同步策略的类型包括:全量同步、增量同步、新增及变化同步、特殊情况
➢
全量表:存储完整的数据。
➢
增量表:存储新增加的数据。
➢
新增及变化表:存储新增加的数据和变化的数据。
➢
特殊表:只需要存储一次。
3.全量同步策略
![](https://img-blog.csdnimg.cn/20210709141729967.png?x-oss-process=image/watermark,type_ZmFuZ3poZW5naGVpdGk,shadow_10,text_aHR0cHM6Ly9ibG9nLmNzZG4ubmV0L3NvbmdfcXVhbl8=,size_16,color_FFFFFF,t_70)
4.增量同步策略
![](https://img-blog.csdnimg.cn/2021070914183734.png?x-oss-process=image/watermark,type_ZmFuZ3poZW5naGVpdGk,shadow_10,text_aHR0cHM6Ly9ibG9nLmNzZG4ubmV0L3NvbmdfcXVhbl8=,size_16,color_FFFFFF,t_70)
5.新增及变化策略
6.特殊策略
某些特殊的维度表,可不必遵循上述同步策略。
1
)客观世界维度
没变化的客观世界的维度(比如性别,地区,民族,政治成分,鞋子尺码)可以只
存一
份固定值。
2
)日期维度
日期维度可以一次性导入一年或若干年的数据。