Data Integration は、高度な分散アーキテクチャに基づき、複数のモジュール (ダーティデータ処理やフロー制御など) を備えたデータ転送、データ変換、同期を提供する分散サービスです。多種多様なデータソースのサポート、高速転送、高い信頼性、スケーラビリティ、大量同期など、さまざまな機能に対応しています。
メリット

-
多種多様なデータソースのサポート
Data Integration は、RDS データベース、半構造化ストレージ、非構造化ストレージ (音声、動画、画像など)、NoSQL データベース、ビッグデータストレージを含む 400 以上のデータソースペア間のデータ同期をサポートしています。また、Oracle、MySQL、DataHub などのデータソース間でリアルタイムのデータ読み書きにも対応しています。

-
スケジュールタスク
Data Integration では、特定のトリガー時刻 (年、月、日、時、分) を設定してオフラインタスクをスケジュールできます。数ステップの設定で、定期的な増分データ抽出を実行できます。DataWorks のデータモデリングとシームレスに連携し、ワークフロー全体で運用保守を統合しています。

-
クラウドへの大量アップロード
Data Integration は、Hadoop クラスターの計算能力を活用して、クラスターの HDFS データを MaxCompute に同期します。これをクラウドへの大量アップロードと呼びます。Data Integration は 1 日あたり最大 5TB のデータを転送できます。最大転送速度は 2 GB/s です。

-
モニタリングとアラーム
19 種類の組み込みモニタリングルールにより、Data Integration はほとんどのモニタリングシナリオに対応できます。これらのモニタリングルールに基づいてアラームルールを設定できます。さらに、Data Integration のタスク失敗通知モードを事前に定義できます。
特徴
-
データソース管理
Data Integration は、データのソースと送信先を定義するデータソースおよびデータセットを活用し、2 つのデータ管理プラグインを提供しています。Reader プラグインはデータの読み取り、Writer プラグインはデータの書き込みに使用します。このフレームワークに基づき、任意の構造化データソースと半構造化データソース間でデータを交換するための簡易な中間データ転送フォーマットを開発しています。
-
ローカルデータ収集
Data Integration は、Alibaba Cloud のクラシックネットワークと VPC でのデータ同期に加え、ローカル IDC でのデータ収集にも対応しています。
-
データベース全体の移行
データベース全体の移行は Data Integration が提供するツールで、複数のデータ同期タスクを作成し、MySQL データベース内のすべてのデータテーブルを MaxCompute にインポートできます。この機能により、同期タスクを 1 つずつ作成する必要がなくなります。
-
増分同期
WHERE 句を使用して、Data Integration は日付によるビジネスデータのフィルタリングをサポートしています。日付ごとのデータは、対応する MaxCompute パーティションテーブルに同期されます。同期間隔を 1 時間または 10 分に設定することで、準リアルタイムの増分同期を実行できます。
