基于DataX的数据同步(上)-DataX介绍以及安装

作者:烧鸡太子爷

来源:恒生LIGHT云社区

1、前言

  • 阿里云的RDS服务提供了比较完善的DTS数据迁移的方案,但是在做非阿里云间服务或跨数据库间数据迁移时还是需要用ETL方案来同步。

基于此,今天和大家一起针对DataX做一个分享和探讨,以便于后续在项目中遇到数据同步的需求的时候可以多一个技术选择

2、DataX介绍

DataX 是淘宝开源的一个异构数据源离线同步工具,致力于实现包括关系型数据库(MySQL、postgreSQL等)、HDFS、Hive、ODPS、HBase、FTP等各种异构数据源之间稳定高效的数据同步功能。我们希望在一个很短的时间窗口内,将一份数据从一个数据库同时导出到多个不同类型的数据库。 DataX正是为了解决这些问题而生
DataX在阿里巴巴集团内被广泛使用,承担了所有大数据的离线同步业务,并已持续稳定运行了6年之久。目前每天完成同步8w多道作业,每日传输数据量超过300TB。

3、DataX框架设计

在这里插入图片描述

                                (图片来源官网)

DataX本身作为离线数据同步框架,采用Framework + plugin架构构建。将数据源读取和写入抽象成为Reader/Writer插件,纳入到整个同步框架中。</

  • 0
    点赞
  • 2
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值