作者:烧鸡太子爷
来源:恒生LIGHT云社区
1、前言
- 阿里云的RDS服务提供了比较完善的DTS数据迁移的方案,但是在做非阿里云间服务或跨数据库间数据迁移时还是需要用ETL方案来同步。
基于此,今天和大家一起针对DataX做一个分享和探讨,以便于后续在项目中遇到数据同步的需求的时候可以多一个技术选择
2、DataX介绍
DataX 是淘宝开源的一个异构数据源离线同步工具,致力于实现包括关系型数据库(MySQL、postgreSQL等)、HDFS、Hive、ODPS、HBase、FTP等各种异构数据源之间稳定高效的数据同步功能。我们希望在一个很短的时间窗口内,将一份数据从一个数据库同时导出到多个不同类型的数据库。 DataX正是为了解决这些问题而生
DataX在阿里巴巴集团内被广泛使用,承担了所有大数据的离线同步业务,并已持续稳定运行了6年之久。目前每天完成同步8w多道作业,每日传输数据量超过300TB。
3、DataX框架设计
(图片来源官网)
DataX本身作为离线数据同步框架,采用Framework + plugin架构构建。将数据源读取和写入抽象成为Reader/Writer插件,纳入到整个同步框架中。</