バッチ同期は、Reader プラグインと Writer プラグインを使用して、ソースデータベースと宛先データベース間で全量データまたは増分データを転送します。データソースとスケジューリングパラメータを設定することで、プロセスを自動化できます。このトピックでは、バッチ同期の機能について説明します。
コア機能
オフライン同期は、以下の機能を提供します。
機能 | 説明 |
異種データソース間のデータ同期 | Data Integration は、リレーショナルデータベース、非構造化ストレージ、ビッグデータストレージ、メッセージキューなど、50 種類以上のデータソースタイプをサポートしています。ソースと宛先のデータソースを定義し、Data Integration が提供する Reader プラグインと Writer プラグインを使用して、構造化または半構造化ソース間でデータを転送できます。詳細については、「サポートされているデータソースと同期ソリューション」をご参照ください。 |
複雑なネットワーク環境でのデータ同期 | バッチ同期は、ApsaraDB、オンプレミスのデータセンター、ECS 上の自己管理データベース、および Alibaba Cloud 外部のデータベースをサポートしています。設定する前に、リソースグループと、ソースおよび宛先のエンドポイントの両方との間の ネットワーク接続 が確保されていることを確認してください。設定の詳細については、「ネットワーク接続ソリューション」をご参照ください。 |
同期シナリオ | 1. 同期モード:
説明 スケジューリングパラメータの詳細については、「Data Integrationのスケジューリングパラメータの代表的なシナリオ」および「スケジューリングパラメータ」をご参照ください。 2. サポートされているソース構造:
|
設定方法 | Data Integration では、次の方法でバッチ同期タスクを設定できます。
説明 タスク設定機能の詳細については、「機能概要」をご参照ください。 |
バッチ同期タスクの O&M |
|
機能概要
機能 | 説明 |
全量または増分データ同期 | バッチ同期タスクは、 データフィルタリング と スケジューリングパラメータ を組み合わせて設定することにより、全量または増分データ同期をサポートします。増分同期の設定はプラグインによって異なります。増分データ同期の詳細については、「増分データ同期の設定」をご参照ください。 |
フィールドマッピング | フィールドマッピングルールを定義することにより、ソースデータは指定された関係に基づいて対応する宛先フィールドに書き込まれます。両側のフィールドタイプに互換性があることを確認してください。
|
タスクのレート制限 |
|
分散タスク実行 | 分散実行をサポートするデータソースでは、タスクシャーディングを使用して同期タスクを複数のノードに分散し、同時実行させることができます。これにより、同期速度をクラスターサイズに比例して線形にスケールさせ、単一ノードのパフォーマンスボトルネックを解消できます。このモードは、高スループット、低レイテンシーの同期シナリオに特に適しており、アイドリング状態のクラスターリソースを効率的に利用して、ハードウェア使用率を大幅に向上させます。 |
ダーティデータポリシー | ダーティデータ とは、タイプの競合や制約違反などの例外により、宛先への書き込みに失敗したデータレコードを指します。バッチ同期は、許容するダーティデータレコードの数とタスクへの影響を定義するダーティデータポリシーをサポートしています。
|
タイムゾーン | ソースと宛先の間でタイムゾーンをまたいだ同期が必要な場合は、ソースのタイムゾーンを設定してタイムゾーン変換を実行できます。 |
インテリジェントなデータ処理 | DataWorks は、データ同期中にデータ処理機能を統合して、ソースデータを変換および処理してから宛先に書き込むことをサポートしています。 文字列置換:バッチ同期タスクに組み込まれている文字列置換機能を使用すると、データのランディングや追加の ETL ステップを必要とせずに、データ転送中に直接軽量なデータ変換を実行できます。 AI 支援処理:データ同期中に AI 大規模言語モデルを統合して、ソースの自然言語データに対してセマンティック分析、感情分析、その他の処理を実行して、処理結果を宛先テーブルに直接書き込むことをサポートします。 データベクトル化:ソースデータを抽出してベクトル化 (エンベディング) して、ベクターデータベースに書き込むことをサポートします。 |
次のステップ
タスク作成の詳細な手順については、以下をご参照ください。