![](https://img.laitimes.com/img/__Qf2AjLwojIjJCLyojI0JCLicmbw5iY3UjNjVTOmFWZxgTZxUDOwcTZ0UmYjV2N1YTN0QWNh9CX5d2bs92Yl1iclB3bsVmdlR2LcNWaw9CXt92Yu4GZjlGbh5yYjV3Lc9CX6MHc0RHaiojIsJye.png)
DataX
DataX 是阿里云
DataWorks数据集成的开源版本,在阿里巴巴集团内被广泛使用的离线数据同步工具/平台。DataX 实现了包括 MySQL、Oracle、SqlServer、Postgre、HDFS、Hive、ADS、HBase、TableStore(OTS)、MaxCompute(ODPS)、Hologres、DRDS 等各种异构数据源之间高效的数据同步功能。
https://github.com/alibaba/DataX#datax-%E5%95%86%E4%B8%9A%E7%89%88%E6%9C%AC DataX 商业版本
阿里云DataWorks数据集成是DataX团队在阿里云上的商业化产品,致力于提供复杂网络环境下、丰富的异构数据源之间高速稳定的数据移动能力,以及繁杂业务背景下的数据同步解决方案。目前已经支持云上近3000家客户,单日同步数据超过3万亿条。DataWorks数据集成目前支持离线50+种数据源,可以进行整库迁移、批量上云、增量同步、分库分表等各类同步解决方案。2020年更新实时同步能力,2020年更新实时同步能力,支持10+种数据源的读写任意组合。提供MySQL,Oracle等多种数据源到阿里云MaxCompute,Hologres等大数据引擎的一键全增量同步解决方案。
商业版本参见:
https://www.aliyun.com/product/bigdata/idehttps://github.com/alibaba/DataX#features Features
DataX本身作为数据同步框架,将不同数据源的同步抽象为从源头数据源读取数据的Reader插件,以及向目标端写入数据的Writer插件,理论上DataX框架可以支持任意数据源类型的数据同步工作。同时DataX插件体系作为一套生态系统, 每接入一套新数据源该新加入的数据源即可实现和现有的数据源互通。
https://github.com/alibaba/DataX#datax%E8%AF%A6%E7%BB%86%E4%BB%8B%E7%BB%8D DataX详细介绍
https://github.com/alibaba/DataX#%E8%AF%B7%E5%8F%82%E8%80%83datax-introduction 请参考: DataX-Introduction
https://github.com/alibaba/DataX#quick-start Quick Start
https://github.com/alibaba/DataX#download-datax%E4%B8%8B%E8%BD%BD%E5%9C%B0%E5%9D%80 Download DataX下载地址
https://github.com/alibaba/DataX#%E8%AF%B7%E7%82%B9%E5%87%BBquick-start 请点击:
https://github.com/alibaba/DataX#support-data-channels Support Data Channels
DataX目前已经有了比较全面的插件体系,主流的RDBMS数据库、NOSQL、大数据计算系统都已经接入,目前支持数据如下图,详情请点击:
DataX数据源参考指南类型 | 数据源 | Reader(读) | Writer(写) | 文档 |
RDBMS 关系型数据库 | MySQL | √ | 读 、 写 | |
Oracle | √ | |||
SQLServer | ||||
PostgreSQL | ||||
DRDS | ||||
通用RDBMS(支持所有关系型数据库) | ||||
阿里云数仓数据存储 | ODPS | |||
ADS | ||||
OSS | ||||
OCS | ||||
NoSQL数据存储 | OTS | |||
Hbase0.94 | ||||
Hbase1.1 | ||||
Phoenix4.x | ||||
Phoenix5.x | ||||
MongoDB | ||||
Hive | ||||
Cassandra | ||||
无结构化数据存储 | TxtFile | |||
FTP | ||||
HDFS | ||||
Elasticsearch | ||||
时间序列数据库 | OpenTSDB | |||
TSDB |
https://github.com/alibaba/DataX#%E9%98%BF%E9%87%8C%E4%BA%91dataworks%E6%95%B0%E6%8D%AE%E9%9B%86%E6%88%90 阿里云DataWorks数据集成
目前DataX的已有能力已经全部融和进阿里云的数据集成,并且比DataX更加高效、安全,同时数据集成具备DataX不具备的其它高级特性和功能。可以理解为数据集成是DataX的全面升级的商业化用版本,为企业可以提供稳定、可靠、安全的数据传输服务。与DataX相比,数据集成主要有以下几大突出特点:
支持实时同步:
- 功能简介: https://help.aliyun.com/document_detail/181912.html
- 支持的数据源: https://help.aliyun.com/document_detail/146778.html
- 支持数据处理: https://help.aliyun.com/document_detail/146777.html
离线同步数据源种类大幅度扩充:
- 新增比如:DB2、Kafka、Hologres、MetaQ、SAPHANA、达梦等等,持续扩充中
- 离线同步支持的数据源: https://help.aliyun.com/document_detail/137670.html
- 具备同步解决方案:
https://github.com/alibaba/DataX#%E6%88%91%E8%A6%81%E5%BC%80%E5%8F%91%E6%96%B0%E7%9A%84%E6%8F%92%E4%BB%B6 我要开发新的插件
DataX插件开发宝典https://github.com/alibaba/DataX#%E9%A1%B9%E7%9B%AE%E6%88%90%E5%91%98 项目成员
核心Contributions: 言柏 、枕水、秋奇、青砾、一斅、云时
感谢天烬、光戈、祁然、巴真、静行对DataX做出的贡献。
https://github.com/alibaba/DataX#license License
This software is free to use under the Apache License
Apache license.
请及时提出issue给我们。请前往:
DataxIssue