DataWorks のデータ統合では、1 回限りまたは定期的なスケジュールで、完全同期または増分同期を通じて、移行元データベースのすべてのテーブルまたは選択したテーブルを移行先ストアに移行できます。移行先のテーブルスキーマは自動で作成されるため、テーブルごとに個別のタスクを設定する必要がなくなります。
ユースケース
データ移行とクラウド導入
オンプレミスデータセンターから MySQL や Oracle などのデータベースを、クラウドデータウェアハウスやデータレイクに移行します。
異なるクラウドプラットフォームやデータベースシステム間でデータを移行します。
データウェアハウスまたはデータレイクの構築
OLTP データベースからデータウェアハウスまたはデータレイクの ODS 層に定期的かつ完全または増分的にデータを同期し、ダウンストリーム分析に利用します。
データのバックアップと障害復旧
本番データベースの完全なデータセットを、HDFS や OSS などの費用対効果の高いストレージメディアに定期的にバックアップします。
クロスリージョンまたはクロスアベイラビリティーゾーンの障害復旧ソリューションを実装します。
コア機能
次の表に、コア機能を示します。
コア機能 | 機能 | 説明 |
異種データソース間の同期 | - | バッチデータベース同期は、オンプレミスデータセンターや他のクラウドプラットフォームから MaxCompute、Hologres、OSS などのデータウェアハウスやデータレイクへのデータ移行をサポートしています。詳細については、「サポート対象のデータソースと移行先」をご参照ください。 |
複雑なネットワーク環境でのデータ同期 | - | オフライン同期は、Alibaba Cloud データベース、オンプレミス IDC データベース、ECS インスタンス上の自己管理データベース、および Alibaba Cloud 以外のデータベース間のデータ同期をサポートしています。設定前に、リソースグループが移行元および移行先とネットワーク接続できることを確認してください。詳細については、「ネットワーク接続の設定」をご参照ください。 |
同期シナリオ | 完全同期 | 移行先テーブルまたは指定されたパーティションへの、1 回限りまたは定期的なデータの完全同期をサポートします。 |
増分同期 | 時間、パーティション、または主キーに基づいて、1 回限りまたは定期的なデータの増分同期をサポートします。 | |
完全同期と増分同期の組み合わせ | 初回実行:データの完全同期を自動的に実行します。 2 回目以降の実行:指定されたパーティションへの定期的なデータの増分同期に自動的に切り替わります。 | |
データベースとテーブルのマッピング | バッチテーブル同期 | データベース内のすべてのテーブルを同期することも、手動で選択するかフィルター規則を設定して特定のテーブルを選択することもできます。 |
テーブルの自動作成 | 1 つの設定で、移行元データベースの数百のテーブルを処理できます。システムは手動の介入なしに、移行先でテーブルスキーマを自動的に作成します。 | |
柔軟なマッピング | 移行先のデータベースとテーブルのカスタム命名規則、および移行元と移行先間のカスタムフィールド型マッピングをサポートし、移行先のデータ構造モデルに柔軟に適応します。 | |
スケジューリングと依存関係の管理 | スケジュール | 分、時、日、週、月、年など、複数のスケジューリング間隔をサポートしています。 一度に多数のテーブルを同期する必要がある場合は、タスクの蓄積やリソースの競合を防ぐために、タスクをバッチで実行するようにスケジュールを設定することを推奨します。 |
タスクの依存関係 | バッチデータベースタスク と各テーブルレベルの サブタスク の両方が DataWorks のアップストリーム依存関係として機能し、他の開発タスクから依存関係として設定できます。特定のテーブルの同期タスクが完了すると、そのダウンストリームの開発タスクが自動的にトリガーされます。 | |
パラメーターのサポート | 増分同期用のスケジューリングパラメーターをサポートしています。たとえば、${bizdate} を使用して業務日を表すことができます。 | |
高度なパラメーター | ダーティデータの設定 | ダーティデータとは、型の競合や制約違反などの例外により、移行先への書き込みに失敗したデータレコードを指します。デフォルト値は false で、ダーティデータは許可されません。ダーティデータが発生した場合、タスクは失敗します。このパラメーターを true に設定すると、すべてのダーティデータは無視されます。 |
リーダーとライターの設定 | リーダーとライターのデータソースの最大接続数の個別設定、およびデータが書き込まれる前の移行先のクリーンアップポリシーの定義をサポートします。 | |
同時実行数と速度制限 |
| |
O&M | オンラインでの介入 | 再実行、バックフィル、成功として設定、フリーズ/アンフリーズなどのオンライン介入操作をサポートします。 |
モニタリングとアラート | ベースライン、タスクステータス、実行時間に基づくモニタリングルールの設定と、ルールがトリガーされた際のアラート設定をサポートします。 | |
データ品質 | タスクがコミットおよびデプロイされた後、オペレーションセンターで移行先テーブルのデータ品質モニタリングルールを設定できます。AI ベースの自動生成と手動設定の両方がサポートされています。現在、品質ルールのモニタリングは、特定のデータベースタイプでのみサポートされています。詳細については、「データ品質の概要」をご参照ください。 | |
DI エージェント | AI ネイティブ | DI エージェントは、データ統合シナリオ向けの Data Agent の 垂直機能セット です。対話型のタスク設定、マルチモーダルデータ処理、ChatDB データ Q&A、インテリジェント診断、定期検査、IM チャネル統合の 6 つの機能をカバーしています。 |
利用開始
バッチデータベース同期タスクを作成するには、「バッチデータベース同期タスクの作成」をご参照ください。
自然言語の対話を通じてバッチデータベース同期タスクを作成および管理するには、データ統合の AI ネイティブ機能 (DI エージェント) を使用できます。詳細については、「DI エージェントの使用」をご参照ください。
サポート対象のデータソース
DataWorks は、さまざまなデータソースから MaxCompute、OSS、Elasticsearch などの移行先へのデータのバッチ移行をサポートしています。以下のデータソースタイプをサポートしています。
移行元データソース | 移行先データソース |
MaxCompute | |
Data Lake Formation | |
Hive | |
Hologres | |
OSS | |
OSS-HDFS | |
Elasticsearch | |
StarRocks | |
MySQL |