Tous les produits
Search
Centre de documentation

DataWorks:Overview of batch database synchronization

Dernière mise à jour :Aug 10, 2026

DataWorks Data Integration vous permet de migrer l'intégralité ou une sélection des tables d'une base de données source vers un magasin de destination, via une synchronisation complète ou incrémentielle, selon une planification ponctuelle ou récurrente. Le service crée automatiquement les schémas des tables de destination, ce qui évite de configurer des tâches individuelles pour chaque table.

Cas d'utilisation

  • Migration de données et adoption du cloud

    • Migrez des bases de données, telles que MySQL et Oracle, depuis un centre de données sur site vers un entrepôt de données ou un lac de données dans le cloud.

    • Transférez des données entre différentes plateformes cloud ou systèmes de gestion de base de données.

  • Construction d'entrepôt de données ou de lac de données

    Synchronisez périodiquement les données complètes ou incrémentielles des bases de données OLTP vers la couche ODS d'un entrepôt de données ou d'un lac de données pour les analyses en aval.

  • Sauvegarde de données et reprise après sinistre

    • Sauvegardez régulièrement des jeux de données complets depuis des bases de données de production vers des supports de stockage économiques, tels que HDFS ou OSS.

    • Mettez en œuvre des solutions de reprise après sinistre inter-régions ou inter-zones de disponibilité.

Fonctionnalités principales

Le tableau suivant décrit les fonctionnalités principales.

image

Fonctionnalité principale

Fonctionnalité

Description

Synchronisation entre sources de données hétérogènes

-

La synchronisation par lot de bases de données prend en charge la migration de données depuis des centres de données sur site ou d'autres plateformes cloud vers des entrepôts de données ou des lacs de données tels que MaxCompute, Hologres et OSS. Pour plus d'informations, consultez Sources et destinations de données prises en charge.

Synchronisation de données dans des environnements réseau complexes

-

La synchronisation hors ligne prend en charge la synchronisation de données entre les bases de données Alibaba Cloud, les bases de données IDC sur site, les bases de données autogérées sur des instances ECS et les bases de données non-Alibaba Cloud. Avant la configuration, assurez-vous que le groupe de ressources dispose d'une connectivité réseau avec la source et la destination. Pour plus d'informations, consultez Configurer la connectivité réseau.

Scénarios de synchronisation

Synchronisation complète

Prend en charge la synchronisation complète des données, ponctuelle ou récurrente, vers des tables de destination ou des partitions spécifiées.

Synchronisation incrémentielle

Prend en charge la synchronisation incrémentielle des données, ponctuelle ou récurrente, basée sur l'heure, les partitions ou les clés primaires.

Synchronisation combinée complète et incrémentielle

Première exécution : effectue automatiquement une synchronisation complète des données.

Exécutions suivantes : bascule automatiquement vers une synchronisation incrémentielle récurrente vers des partitions spécifiées.

Mappage de bases de données et de tables

Synchronisation de tables par lot

Synchronisez toutes les tables d'une base de données ou sélectionnez des tables spécifiques manuellement ou via des règles de filtrage.

Création automatique de tables

Une seule configuration suffit pour traiter des centaines de tables de la base de données source. Le système crée automatiquement les schémas des tables de destination sans intervention manuelle.

Mappage flexible

Prend en charge des règles de nommage personnalisées pour les bases de données et les tables de destination, ainsi que des mappages de types de champs personnalisés entre la source et la destination, afin de s'adapter avec souplesse au modèle de structure de données de la destination.

Gestion de la planification et des dépendances

Planification

Prend en charge plusieurs intervalles de planification : minute, heure, jour, semaine, mois et année.

Si vous devez synchroniser un grand nombre de tables simultanément, nous vous recommandons de configurer des planifications pour exécuter les tâches par lots afin d'éviter l'accumulation de tâches et la contention des ressources.

Dépendances de tâche

La tâche de base de données par lot et chaque sous-tâche au niveau de la table peuvent servir de dépendances en amont dans DataWorks, permettant à d'autres tâches de développement d'en dépendre. Lorsque la tâche de synchronisation pour une table spécifique est terminée, ses tâches de développement en aval sont automatiquement déclenchées.

Prise en charge des paramètres

Prend en charge les paramètres de planification pour la synchronisation incrémentielle. Par exemple, utilisez ${bizdate} pour représenter la date métier.

Paramètres avancés

Paramètres des données erronées

Les données erronées désignent les enregistrements qui n'ont pas pu être écrits dans la destination en raison d'exceptions telles que des conflits de type ou des violations de contraintes. La valeur par défaut est false, ce qui signifie que les données erronées ne sont pas autorisées. Si des données erronées apparaissent, la tâche échoue. Si vous définissez ce paramètre sur true, toutes les données erronées sont ignorées.

Paramètres du lecteur et du rédacteur

Prend en charge la configuration distincte du nombre maximal de connexions pour les sources de données du lecteur et du rédacteur, ainsi que la définition des politiques de nettoyage pour la destination avant l'écriture des données.

Accès simultané et limitation

  • Fournit un contrôle de la simultanéité des tâches pour limiter le nombre maximal de connexions simultanées pour la lecture et l'écriture dans les bases de données.

  • Fournit un contrôle du taux de synchronisation pour gérer le trafic et éviter une pression excessive sur la source ou la destination. Si la limitation n'est pas activée, les performances de transfert maximales disponibles dans l'environnement matériel actuel sont utilisées.

OM

Intervention en ligne

Prend en charge les opérations d'intervention en ligne telles que la réexécution, le remplissage rétroactif, le marquage comme réussi et le gel/dégel.

Surveillance et alertes

Prend en charge la configuration de règles de surveillance basées sur les lignes de base, les états des tâches et les durées d'exécution, ainsi que l'envoi d'alertes lorsque les règles sont déclenchées.

Qualité des données

Après la validation et le déploiement d'une tâche, configurez des règles de surveillance de la qualité des données pour les tables de destination dans Operation Center. La génération automatique basée sur l'IA et la configuration manuelle sont toutes deux prises en charge. Actuellement, seuls certains types de bases de données prennent en charge la surveillance des règles de qualité. Pour plus d'informations, consultez Qualité des données.

DI Agent

AI Native

DI Agent est un ensemble de capacités verticales de Data Agent pour les scénarios d'intégration de données. Il couvre six capacités : configuration conversationnelle des tâches, traitement multimodal des données, questions-réponses sur les données ChatDB, diagnostics intelligents, inspection périodique et intégration de canal IM.

Premiers pas

Pour créer une tâche de synchronisation par lot de bases de données, consultez Créer une tâche de synchronisation de base de données par lot.

Pour créer et gérer des tâches de synchronisation par lot de bases de données via des conversations en langage naturel, utilisez la capacité AI Native d'intégration de données (DI Agent). Pour plus d'informations, consultez Utiliser DI Agent.

Sources de données prises en charge

DataWorks prend en charge la migration par lot de données depuis diverses sources de données vers des destinations telles que MaxCompute, OSS et Elasticsearch. Les types de source de données suivants sont pris en charge.

Source de données source

Source de données de destination

MaxCompute

Data Lake Formation

Hive

Hologres

OSS

OSS-HDFS

Elasticsearch

StarRocks

MySQL