すべてのプロダクト
Search
ドキュメントセンター

DataWorks:バッチデータベース同期の概要

最終更新日:Aug 18, 2026

DataWorks のデータ統合では、1 回限りまたは定期的なスケジュールで、完全同期または増分同期を通じて、移行元データベースのすべてのテーブルまたは選択したテーブルを移行先ストアに移行できます。移行先のテーブルスキーマは自動で作成されるため、テーブルごとに個別のタスクを設定する必要がなくなります。

ユースケース

  • データ移行とクラウド導入

    • オンプレミスデータセンターから MySQL や Oracle などのデータベースを、クラウドデータウェアハウスやデータレイクに移行します。

    • 異なるクラウドプラットフォームやデータベースシステム間でデータを移行します。

  • データウェアハウスまたはデータレイクの構築

    OLTP データベースからデータウェアハウスまたはデータレイクの ODS 層に定期的かつ完全または増分的にデータを同期し、ダウンストリーム分析に利用します。

  • データのバックアップと障害復旧

    • 本番データベースの完全なデータセットを、HDFS や OSS などの費用対効果の高いストレージメディアに定期的にバックアップします。

    • クロスリージョンまたはクロスアベイラビリティーゾーンの障害復旧ソリューションを実装します。

コア機能

次の表に、コア機能を示します。

image

コア機能

機能

説明

異種データソース間の同期

-

バッチデータベース同期は、オンプレミスデータセンターや他のクラウドプラットフォームから MaxCompute、Hologres、OSS などのデータウェアハウスやデータレイクへのデータ移行をサポートしています。詳細については、「サポート対象のデータソースと移行先」をご参照ください。

複雑なネットワーク環境でのデータ同期

-

オフライン同期は、Alibaba Cloud データベース、オンプレミス IDC データベース、ECS インスタンス上の自己管理データベース、および Alibaba Cloud 以外のデータベース間のデータ同期をサポートしています。設定前に、リソースグループが移行元および移行先とネットワーク接続できることを確認してください。詳細については、「ネットワーク接続の設定」をご参照ください。

同期シナリオ

完全同期

移行先テーブルまたは指定されたパーティションへの、1 回限りまたは定期的なデータの完全同期をサポートします。

増分同期

時間、パーティション、または主キーに基づいて、1 回限りまたは定期的なデータの増分同期をサポートします。

完全同期と増分同期の組み合わせ

初回実行:データの完全同期を自動的に実行します。

2 回目以降の実行:指定されたパーティションへの定期的なデータの増分同期に自動的に切り替わります。

データベースとテーブルのマッピング

バッチテーブル同期

データベース内のすべてのテーブルを同期することも、手動で選択するかフィルター規則を設定して特定のテーブルを選択することもできます。

テーブルの自動作成

1 つの設定で、移行元データベースの数百のテーブルを処理できます。システムは手動の介入なしに、移行先でテーブルスキーマを自動的に作成します。

柔軟なマッピング

移行先のデータベースとテーブルのカスタム命名規則、および移行元と移行先間のカスタムフィールド型マッピングをサポートし、移行先のデータ構造モデルに柔軟に適応します。

スケジューリングと依存関係の管理

スケジュール

分、時、日、週、月、年など、複数のスケジューリング間隔をサポートしています。

一度に多数のテーブルを同期する必要がある場合は、タスクの蓄積やリソースの競合を防ぐために、タスクをバッチで実行するようにスケジュールを設定することを推奨します。

タスクの依存関係

バッチデータベースタスク と各テーブルレベルの サブタスク の両方が DataWorks のアップストリーム依存関係として機能し、他の開発タスクから依存関係として設定できます。特定のテーブルの同期タスクが完了すると、そのダウンストリームの開発タスクが自動的にトリガーされます。

パラメーターのサポート

増分同期用のスケジューリングパラメーターをサポートしています。たとえば、${bizdate} を使用して業務日を表すことができます。

高度なパラメーター

ダーティデータの設定

ダーティデータとは、型の競合や制約違反などの例外により、移行先への書き込みに失敗したデータレコードを指します。デフォルト値は false で、ダーティデータは許可されません。ダーティデータが発生した場合、タスクは失敗します。このパラメーターを true に設定すると、すべてのダーティデータは無視されます。

リーダーとライターの設定

リーダーとライターのデータソースの最大接続数の個別設定、およびデータが書き込まれる前の移行先のクリーンアップポリシーの定義をサポートします。

同時実行数と速度制限

  • タスクの同時実行数を制御し、データベースの読み取りと書き込みのための最大同時接続数を制限します。

  • 同期レートを制御してトラフィックを管理し、移行元または移行先への過度の負荷を防ぎます。速度制限が有効になっていない場合、現在のハードウェア環境で利用可能な最大転送パフォーマンスが使用されます。

O&M

オンラインでの介入

再実行、バックフィル、成功として設定、フリーズ/アンフリーズなどのオンライン介入操作をサポートします。

モニタリングとアラート

ベースライン、タスクステータス、実行時間に基づくモニタリングルールの設定と、ルールがトリガーされた際のアラート設定をサポートします。

データ品質

タスクがコミットおよびデプロイされた後、オペレーションセンターで移行先テーブルのデータ品質モニタリングルールを設定できます。AI ベースの自動生成と手動設定の両方がサポートされています。現在、品質ルールのモニタリングは、特定のデータベースタイプでのみサポートされています。詳細については、「データ品質の概要」をご参照ください。

DI エージェント

AI ネイティブ

DI エージェントは、データ統合シナリオ向けの Data Agent の 垂直機能セット です。対話型のタスク設定、マルチモーダルデータ処理、ChatDB データ Q&A、インテリジェント診断、定期検査、IM チャネル統合の 6 つの機能をカバーしています。

利用開始

バッチデータベース同期タスクを作成するには、「バッチデータベース同期タスクの作成」をご参照ください。

自然言語の対話を通じてバッチデータベース同期タスクを作成および管理するには、データ統合の AI ネイティブ機能 (DI エージェント) を使用できます。詳細については、「DI エージェントの使用」をご参照ください。

サポート対象のデータソース

DataWorks は、さまざまなデータソースから MaxCompute、OSS、Elasticsearch などの移行先へのデータのバッチ移行をサポートしています。以下のデータソースタイプをサポートしています。

移行元データソース

移行先データソース

MaxCompute

Data Lake Formation

Hive

Hologres

OSS

OSS-HDFS

Elasticsearch

StarRocks

MySQL