背景:
学习,学习,还是TM的学习(微笑脸)!
转换:一系列的步骤组合体,可以完成某个任务。
作业:一个作业里包括多个作业项,作业可以执行转换,作业可以定时调度
1.转换
使用kettle前,可以先去了解kettle的相关概念:https://www.kettle.net.cn/category/base
转换。是ETL解决方法中最主要的部分,它处理抽取,转换,加载各阶段各种对数据行的操作。转换包括一个或者多个步骤(step),如读取文件,过滤输出行,数据清洗或者将数据加载到数据库。
本文会创建一个转换,把两个数据源的两张表数据抽取出来,然后根据id进行连接组合成一张新的表,存入到新的数据库中。
1.1 配置数据源
双击Spoon.bat,进入kettle,点击主对象树,右击转换,点击新建
转换新建好后,先创建出两个数据源的数据库的连接,这里使用的数据库是mysql8,kettle配置mysql8数据源,请看:kettle配置mysql8
两个源数据库的表的sql语句:
demo-kettle-student数据库的tb_student表:
CREATE TABLE `tb_student` (
`id` int NOT NULL AUTO_INCREMENT,
`std_name` varchar(255) CHARACTER SET utf8 COLLATE utf8_general_ci NULL DEFAULT NULL,
`cls_id` int NULL DEFAULT NULL,
PRIMARY KEY (`id`) USING BTREE
) ENGINE = InnoDB CHARACTER SET = utf8 COLLATE = utf8_general_ci ROW_FORMAT = Dynamic;
demo-kettle-class数据库的tb_class表:
CREATE TABLE `tb_student` (
`id` int NOT NULL AUTO_INCREMENT,
`std_name` varchar(255) CHARACTER SET utf8 COLLATE utf8_general_ci NULL DEFAULT NULL,
PRIMARY KEY (`id`) USING BTREE
) ENGINE = InnoDB CHARACTER SET = utf8 COLLATE = utf8_general_ci ROW_FORMAT = Dynamic;
目标数据库sql语句:
demo-kettle-total数据库的tb_student_total表:
CREATE TABLE `tb_student_total` (
`id` int NOT NULL AUTO_INCREMENT,
`std_name` varchar(255) CHARACTER SET utf8 COLLATE utf8_general_ci NULL DEFAULT NULL,
`cls_name` varchar(255) CHARACTER SET utf8 COLLATE utf8_general_ci NULL DEFAULT NULL,
PRIMARY KEY (`id`) USING BTREE
) ENGINE = InnoDB CHARACTER SET = utf8 COLLATE = utf8_general_ci ROW_FORMAT = Dynamic;
1.2 编辑转换
数据库连接配置好后,点击左侧的核心对象,打开输入,拖动一个表输入到右侧编辑区
双击这个表输入,即可对它进行设置,这里我们目的是把demo-kettle-student的tb_student表数据抽取出来,因此咱们需要配置的项:
步骤名称
数据库连接
SQL
配置如图所示:
配置好一个表输入,在配置另一个表输入demo-kettle-class表输入。
这里表输入定义好了后,我们需要对两个表输入的记录进行聚合,在连接需要对数据流进行排序,选择 核心对象-》连接-》排序记录,把两个表输入的记录,按照id升序排列。
排序后,选择 核心对象-》连接-》记录集连接,按照student表的cls_id对应class表的id字段进行连接。
然后选择 核心对象-》输出-》表输出,把连接好的记录输出到demo-kettle-total数据库tb_student_total表。这里设置一下输出表数据库连接,目标表,指定数据库字段,配置字段映射关系。
全部配置妥当后,点击执行按钮,如下。
在数据库插入几条测试数据库,执行转换后查看demo-kettle-total中的数据符合预期。
该转换完成预期目标。
2 作业
点击 文件-》新建-》作业,即可新建一个作业
本文会新建一个作业,每个三秒钟执行一次转换。
打开 核心对象-》通用,选择开始、转换和成功。连接它们,然后双击转换,选择在上一步新建的转换,如下:
然后双击开始,设置定时属性,每个三秒执行一次,如下:
点击运行,然后查看数据库,数据符合预期。