DataWorks の Data Integration は、強力なリアルタイムデータベース同期ソリューションを提供します。このソリューションは、ソースデータベースのすべてまたは選択したテーブルを、自動的かつ統合されたフル + 増分方式で、低レイテンシーで宛先データストアに複製します。リアルタイムコンピューティングエンジン上に構築されたこの機能は、初回のフルデータロードを自動的に実行し、その後シームレスに増分変更データキャプチャ (CDC) に切り替わります。リアルタイムのクラウド移行やリアルタイムデータウェアハウスの ODS 層構築などのユースケース向けのワンストップソリューションです。
ユースケース
データウェアハウス用のリアルタイム ODS 層の構築
MySQL や Oracle などのオペレーショナルデータベースから、Hologres や StarRocks などのリアルタイムデータウェアハウスにデータを同期し、ダッシュボードやアドホッククエリに最新のデータを提供します。
災害復旧のためのリアルタイムデータベースレプリケーション
2 つのデータベースインスタンス間にリアルタイムのレプリケーションリンクを確立し、同種または異種のデータベース間で、読み書き分離、読み取り専用レプリカ、または災害復旧を実現します。
リアルタイムでのクラウドへのデータ移行
オンプレミスデータセンターからクラウドデータベースサービスへ、データベースをシームレスに移行します。
リアルタイムのデータレイクまたはデータミドルプラットフォームの構築
複数のオペレーショナルデータベースからリアルタイムの変更データを中央のデータレイク (OSS または DLF) またはデータウェアハウス (MaxCompute または Hologres) に収集し、統一されたリアルタイムのデータミドルプラットフォームを構築します。
コア機能
リアルタイムデータベース同期は、以下の機能を提供します。
コア機能 | 機能 | 説明 |
異種データソース間でのデータベース全体の同期 | - | リアルタイムデータベース同期は、オンプレミスデータセンターや他のクラウドプラットフォームから、MaxCompute、Hologres、Kafka などのデータウェアハウスやデータレイクへのデータ移行をサポートします。詳細については、「サポートされているデータソースと同期ソリューション」をご参照ください。 |
複雑なネットワーク環境でのデータ同期 | - | リアルタイム同期は、Alibaba Cloud データベースサービス、オンプレミスデータセンター、ECS 上の自己管理型データベース、および他のクラウドプラットフォーム上のデータベースからのデータをサポートします。設定する前に、リソースグループとソースおよび宛先との間のネットワーク接続が確保されていることを確認してください。詳細については、「ネットワーク接続ソリューション」をご参照ください。 |
同期シナリオ | フル同期 | ソースから宛先テーブルへの 1 回限りのフルデータ同期を実行します。 |
増分同期 | メッセージキューまたは CDC ログからストリーミングデータを継続的にキャプチャし、宛先テーブルまたは指定されたパーティションにリアルタイムで書き込みます。 | |
統合されたフル + 増分同期 |
| |
タスク設定 | テーブルの一括同期 | データベース内のすべてのテーブルを同期するか、選択ルールまたはフィルター ルールを使用して同期するテーブルのサブセットを指定します。 |
テーブルの自動作成 | 一度設定するだけで、ソースデータベースから何百ものテーブルを処理できます。システムは手動での介入なしに、宛先にテーブルスキーマを自動的に作成します。 | |
柔軟なマッピング | 宛先データベースとテーブルのカスタム命名規則、およびソースと宛先間のカスタムフィールドタイプマッピングをサポートし、宛先のデータ構造モデルに柔軟に適応します。 | |
DDL 変更検知 (特定の同期リンクでサポート) | ソーステーブルのスキーマが変更された場合 (テーブルや列の作成や削除など)、同期タスクが以下の応答戦略のいずれかを採用するように設定できます。
| |
DML ルール設定 | DML メッセージ処理により、ソースからキャプチャされた変更データ ( | |
動的パーティショニング | 宛先テーブルがパーティションテーブルである場合、ソースフィールドまたはソース側のイベント変更時間に基づいて動的パーティショニングがサポートされます。 重要 パーティションが多すぎると、同期パフォーマンスが低下します。1 日に 1,000 を超えるパーティションが追加されると、パーティションの作成に失敗し、タスクは終了します。 | |
タスク O&M | オンライン介入 | チェックポイントベースの再開をサポートします。これにより、タスクの中断後、指定された時間チェックポイントから実行を再開し、同期中のデータ損失を防ぎます。また、データバックフィル、異常修復、またはロジック変更の検証のためのタスクの再実行もサポートし、データの一貫性とビジネスの継続性を確保します。 |
モニタリングとアラート | ビジネスレイテンシー、タスクステータス、フェイルオーバー、DDL 通知のモニタリングルールをサポートし、ルールがトリガーされた際のアラートをサポートします。 | |
リソースチューニング | DataWorks の Data Integration は、サーバーレスリソースグループ に基づいており、タスクレベルでの弾性スケーリングを提供します。 さらに、時間ベースの弾性スケーリングポリシーを設定して、ビジネスのピーク時とオフピーク時など、異なる時間にタスクに異なるリソース仕様を割り当てることができます。 | |
DI Agent | AI ネイティブ | DI Agent は、データ統合シナリオ向けの Data Agent の特化した機能セットです。対話型のタスク設定、マルチモーダルデータ処理、ChatDB データ Q&A、インテリジェント診断、定期検査、IM チャネル統合の 6 つの主要な機能をカバーしています。 |
利用開始
リアルタイムデータベース同期タスクを作成するには、「リアルタイムデータベース同期タスクの作成」をご参照ください。
自然言語の対話を通じてリアルタイムデータベース同期タスクを作成および管理するには、Data Agent の AI ネイティブ機能を使用できます。Data Agent は、単一テーブルのオフライン、単一テーブルのリアルタイム、データベース全体のオフライン、データベース全体のリアルタイムといった、すべてのタスクタイプをサポートします。設定フォームを手動で入力する必要はありません。1 文だけで、意図の理解からタスクのデプロイまでの全プロセスを完了できます。詳細については、「Data Agent を使用したデータ統合タスクの作成」をご参照ください。
サポートされているデータソース
ソースデータソース | 宛先データソース |
MaxCompute | |
AnalyticDB for MySQL (V3.0) | |
ApsaraDB for OceanBase | |
Data Lake Formation (DLF) | |
DataHub | |
Doris | |
Elasticsearch | |
Hologres | |
Kafka | |
| LogHub |
OSS | |
OSS-HDFS | |
SelectDB | |
StarRocks | |
Lindorm |