DataWorks Data Integration propose une solution puissante de synchronisation de bases de données en temps réel. Elle réplique l'intégralité ou une sélection de tables d'une base de données source vers un magasin de données de destination avec une faible latence, de manière automatisée et intégrée (chargement complet puis incrémentiel). S'appuyant sur un moteur de calcul en temps réel, cette fonctionnalité effectue automatiquement le chargement initial complet des données, puis bascule de manière transparente vers la capture continue des données de modification incrémentielles (CDC). Elle constitue une solution tout-en-un pour des cas d'utilisation tels que la migration vers le cloud en temps réel et la construction de la couche ODS d'un entrepôt de données en temps réel.
Cas d'utilisation
-
Création d'une couche ODS en temps réel pour votre entrepôt de données
Synchronisez les données provenant de bases de données opérationnelles telles que MySQL et Oracle vers un entrepôt de données en temps réel comme Hologres ou StarRocks, afin de fournir des données actualisées pour les tableaux de bord et les requêtes ad hoc.
-
Réplication de bases de données en temps réel pour la reprise après sinistre
Établissez un lien de réplication en temps réel entre deux instances de base de données pour la répartition lecture/écriture, la création de réplicas en lecture seule ou la reprise après sinistre, que les bases de données soient homogènes ou hétérogènes.
-
Migration de données en temps réel vers le cloud
Migrez vos bases de données depuis un centre de données sur site vers un service de base de données cloud de manière transparente.
-
Création d'un lac de données ou d'une plateforme de données intermédiaire en temps réel
Collectez les données de modification en temps réel provenant de plusieurs bases de données opérationnelles dans un lac de données central (OSS ou DLF) ou un entrepôt de données (MaxCompute ou Hologres) afin de construire une plateforme de données intermédiaire unifiée en temps réel.
Fonctionnalités principales
La synchronisation de bases de données en temps réel offre les fonctionnalités suivantes :
Fonctionnalité principale | Fonctionnalité | Description |
Synchronisation de bases de données entières entre des sources de données hétérogènes | - | La synchronisation de bases de données en temps réel prend en charge la migration des données depuis des centres de données sur site ou d'autres plateformes cloud vers un entrepôt de données ou un lac de données tel que MaxCompute, Hologres ou Kafka. Pour plus d'informations, consultez Sources de données prises en charge et solutions de synchronisation. |
Synchronisation des données dans des environnements réseau complexes | - | La synchronisation en temps réel prend en charge les données provenant des services de base de données Alibaba Cloud, des centres de données sur site, des bases de données gérées par l'utilisateur sur ECS et des bases de données hébergées sur d'autres plateformes cloud. Avant la configuration, assurez-vous de la connectivité réseau entre le groupe de ressources et les sources et destinations. Pour plus d'informations, consultez Solutions de connectivité réseau. |
Scénarios de synchronisation | Synchronisation complète | Effectue une synchronisation unique des données complètes de la source vers les tables de destination. |
Synchronisation incrémentielle | Capture en continu les données de streaming provenant de files d'attente de messages ou des journaux CDC et les écrit en temps réel dans les tables de destination ou les partitions spécifiées. | |
Synchronisation complète et incrémentielle intégrée |
| |
Configuration des tâches | Synchronisation de tables par lots | Synchronisez toutes les tables d'une base de données ou utilisez des règles de sélection ou de filtrage pour spécifier un sous-ensemble de tables à synchroniser. |
Création automatique de tables | Configurez une seule fois le traitement de centaines de tables de la base de données source. Le système crée automatiquement les schémas de table dans la destination sans intervention manuelle. | |
Mappage flexible | Prend en charge des règles de nommage personnalisées pour les bases de données et les tables de destination, ainsi que des mappages de types de champs personnalisés entre la source et la destination, s'adaptant de manière flexible au modèle de structure de données de la destination. | |
Détection des modifications DDL (prise en charge pour certaines liaisons de synchronisation) | Lorsque le schéma de la table source change (par exemple, création ou suppression de tables ou de colonnes), vous pouvez configurer la tâche de synchronisation pour adopter l'une des stratégies de réponse suivantes :
| |
Configuration des règles DML | Le traitement des messages DML vous permet d'effectuer un filtrage et un contrôle granulaires sur les données de modification capturées depuis la source ( | |
Partitionnement dynamique | Si la table de destination est une table partitionnée, le partitionnement dynamique est pris en charge en fonction des champs source ou de l'heure de modification de l'événement côté source. Important Un nombre excessif de partitions dégrade les performances de synchronisation. Si plus de 1 000 partitions sont ajoutées en une seule journée, la création de partition échoue et la tâche est interrompue. | |
Gestion opérationnelle des tâches | Intervention en ligne | Prend en charge la reprise basée sur des points de contrôle (checkpoints), permettant de reprendre l'exécution à partir d'un point de contrôle temporel spécifié après une interruption de tâche, garantissant ainsi l'absence de perte de données pendant la synchronisation. Prend également en charge la réexécution des tâches pour le remplissage rétroactif des données, la réparation d'anomalies ou la vérification des changements logiques, assurant la cohérence des données et la continuité des activités. |
Surveillance et alertes | Prend en charge des règles de surveillance pour la latence métier, l'état des tâches, le basculement et les notifications DDL, ainsi que l'envoi d'alertes lorsque les règles sont déclenchées. | |
Ajustement des ressources | DataWorks Data Integration s'appuie sur des groupes de ressources serverless et fournit une mise à l'échelle élastique au niveau des tâches. De plus, vous pouvez configurer des politiques de mise à l'échelle élastique basées sur le temps pour attribuer différentes spécifications de ressources à la tâche à différents moments, par exemple lors des pics d'activité et des périodes creuses. | |
DI Agent | AI Native | DI Agent est un ensemble de capacités verticales de Data Agent dédié au scénario d'intégration de données. Il couvre six capacités majeures : configuration conversationnelle des tâches, traitement multimodal des données, questions-réponses sur les données via ChatDB, diagnostics intelligents, inspections périodiques et intégration de canaux de messagerie instantanée. |
Premiers pas
Pour créer une tâche de synchronisation de base de données en temps réel, consultez Création d'une tâche de synchronisation de base de données en temps réel.
Pour créer et gérer des tâches de synchronisation de bases de données en temps réel via des conversations en langage naturel, utilisez la capacité Data Agent AI Native. Data Agent prend en charge tous les types de tâches, y compris les tâches hors ligne sur une seule table, en temps réel sur une seule table, hors ligne sur toute la base de données et en temps réel sur toute la base de données. Vous n'avez pas besoin de remplir manuellement des formulaires de configuration. Une simple phrase suffit pour mener à bien l'ensemble du processus, de la compréhension de l'intention au déploiement de la tâche. Pour plus d'informations, consultez Utilisation de Data Agent pour créer des tâches d'intégration de données.
Sources de données prises en charge
Sources de données source | Sources de données de destination |
MaxCompute | |
AnalyticDB for MySQL (V3.0) | |
ApsaraDB for OceanBase | |
Data Lake Formation (DLF) | |
DataHub | |
Doris | |
Elasticsearch | |
Hologres | |
Kafka | |
| LogHub |
OSS | |
OSS-HDFS | |
SelectDB | |
StarRocks | |
Lindorm |