Tous les produits
Search
Centre de documentation

DataWorks:Batch synchronization features

Dernière mise à jour :Aug 09, 2026

La synchronisation par lots transfère des données complètes ou incrémentielles entre les bases de données source et de destination à l'aide des plugins Reader et Writer. Configurez les sources de données et les paramètres de planification pour automatiser le processus. Cette rubrique décrit les fonctionnalités de la synchronisation par lots.

Fonctionnalités principales

La synchronisation hors ligne offre les fonctionnalités suivantes :

image

Fonctionnalité

Description

Synchronisation des données entre sources hétérogènes

Data Integration prend en charge plus de 50 types de sources de données, notamment les bases de données relationnelles, le stockage non structuré, le stockage Big Data et les files d'attente de messages. Définissez les sources et destinations de données, puis utilisez les plugins Reader et Writer fournis par Data Integration pour transférer des données entre n'importe quelles sources structurées ou semi-structurées. Pour plus d'informations, consultez Sources de données prises en charge et solutions de synchronisation.

Synchronisation des données dans des environnements réseau complexes

La synchronisation par lots prend en charge ApsaraDB, les centres de données sur site, les bases de données auto-gérées sur ECS et les bases de données externes à Alibaba Cloud. Avant la configuration, assurez-vous de la connectivité réseau entre le groupe de ressources et les endpoints source et de destination. Pour plus d'informations sur la configuration, consultez Solutions de connectivité réseau.

Scénarios de synchronisation

1. Modes de synchronisation

  • Synchronisation complète périodique : écrase périodiquement la table de destination avec l'intégralité des données source. Adapté aux scénarios nécessitant une actualisation complète.

  • Synchronisation incrémentielle périodique : synchronise uniquement les données nouvelles ou modifiées quotidiennement ou toutes les heures. Utilise des paramètres de planification intégrés tels que ${bizdate} avec une condition de filtre de données WHERE pour garantir que seules les données spécifiées sont extraites et écrites dans la partition temporelle correspondante. Pour plus d'informations, consultez Configurer les paramètres de planification pour la synchronisation incrémentielle.

  • Remplissage des données historiques : lorsque vous devez remplir un grand volume de données historiques en une seule fois, utilisez la fonctionnalité Backfill Data dans Operation Center pour exécuter par lot les tâches de synchronisation et archiver efficacement les données historiques.

Remarque

Pour plus d'informations sur les paramètres de planification, consultez Scénarios typiques des paramètres de planification dans Data Integration et Paramètres de planification.

2. Structures source prises en charge

  • Table unique vers table unique : mode de synchronisation le plus basique. Synchronise les données d'une table source vers une table de destination.

  • Tables fragmentées vers table unique :

    • Agrège automatiquement les données de plusieurs tables physiques (telles que les tables de commandes order_01, order_02...) et écrit les données dans une seule table de destination.

    • Les sources de données prises en charge incluent MySQL, SQL Server, Oracle, PostgreSQL, PolarDB et AnalyticDB. Pour plus d'informations, consultez Synchroniser des tables fragmentées vers une table unique.

Méthodes de configuration

Configurez les tâches de synchronisation par lots dans Data Integration à l'aide des méthodes suivantes.

  • Interface sans code : configurez les tâches étape par étape via une interface visuelle guidée. Ce mode est facile à apprendre et à utiliser, mais ne prend pas en charge certaines fonctionnalités avancées.

  • Éditeur de code : définissez directement la logique de synchronisation à l'aide de scripts JSON. Ce mode prend en charge des configurations plus complexes et permet un contrôle granulaire.

  • OpenAPI : gérez le cycle de vie complet des tâches via OpenAPI, ce qui permet des opérations programmatiques.

  • DI Agent : pour créer et gérer rapidement des tâches de synchronisation par lots pour une table unique via des conversations alimentées par l'IA, utilisez Data Agent au lieu de la configuration manuelle des formulaires. Décrivez vos besoins de synchronisation en une phrase, et l'Agent identifie automatiquement les sources de données, mappe les champs, attribue les groupes de ressources et configure les politiques de planification, réduisant le temps de création d'une tâche unique de 15–30 minutes à moins de 5 minutes.

Remarque

Pour plus d'informations sur les capacités de configuration des tâches, consultez Présentation des fonctionnalités.

Exploitation et maintenance des tâches de synchronisation par lots

  • Alertes : surveille l'état d'exécution des tâches de synchronisation par lots, y compris les scénarios de tâches incomplètes, échouées et terminées. Prend en charge plusieurs méthodes d'alerte, notamment e-mail, SMS, appels téléphoniques, robots de groupe DingTalk et webhooks, pour notifier les destinataires des alertes.

  • Qualité des données : après la validation et le déploiement d'une tâche, configurez des règles de surveillance de la qualité des données pour la table de destination dans Operation Center. Actuellement, seuls certains types de bases de données prennent en charge les règles de surveillance de la qualité des données.

  • Isolation de l'environnement de la source de données : Un nom de source de données unique est lié à deux configurations indépendantes pour les environnements de développement et de production. Lors de l'exécution des tâches, la source de données commute automatiquement selon l'environnement — le débogage en développement utilise l'environnement de développement, et la planification en production utilise l'environnement de production, évitant ainsi le risque que les opérations de test affectent accidentellement les données de production.

Présentation des fonctionnalités

image

Fonctionnalité

Description

Synchronisation complète ou incrémentielle des données

Les tâches de synchronisation par lots prennent en charge la synchronisation complète ou incrémentielle des données en configurant le Data Filtering combiné aux paramètres de planification. Les configurations pour la synchronisation incrémentielle varient selon les plugins. Pour plus d'informations sur la synchronisation incrémentielle des données, consultez Configurer la synchronisation incrémentielle des données.

Mappage des champs

En définissant des règles de mappage des champs, les données source sont écrites dans les champs de destination correspondants selon les relations spécifiées. Assurez-vous que les types de champs des deux côtés sont compatibles.

  • Plusieurs méthodes de mappage des champs sont disponibles :

    • Le mode Assistant prend en charge le mappage par nom identique, le mappage par ligne identique et les relations de champs personnalisées. Les données des champs non mappés sont automatiquement ignorées. Assurez-vous que les champs de destination correspondants ont des valeurs par défaut configurées ou autorisent les valeurs nulles pour éviter les échecs d'écriture.

    • Le mode Script mappe strictement les champs selon l'ordre de configuration des colonnes. Le nombre de champs côté lecteur doit correspondre exactement au nombre côté rédacteur. Sinon, la tâche échoue lors de l'exécution.

  • Les tâches de synchronisation prennent également en charge l'attribution dynamique de valeurs pour les champs de destination, y compris les constantes, les paramètres de planification et les variables intégrées telles que ${bizdate}. Les paramètres pertinents reçoivent leurs valeurs finales lors de la phase de planification.

Limitation du débit des jobs

  • La fonctionnalité de contrôle de la concurrence des tâches limite le nombre maximal de threads simultanés pour la lecture et l'écriture dans les bases de données.

  • La fonctionnalité de vitesse de synchronisation contrôle le trafic pour éviter une pression excessive sur la source ou la destination causée par des vitesses de synchronisation élevées. Si la limitation n'est pas activée, les performances de transfert maximales disponibles dans l'environnement matériel actuel sont fournies.

Exécution distribuée des tâches

Les sources de données qui prennent en charge l'exécution distribuée peuvent utiliser le fragmentation des tâches pour distribuer les tâches de synchronisation sur plusieurs nœuds pour une exécution concurrente. Cela permet à la vitesse de synchronisation de s'adapter linéairement à la taille du cluster, brisant les goulots d'étranglement de performance des nœuds uniques. Ce mode est particulièrement adapté aux scénarios de synchronisation à haut débit et faible latence, et utilise efficacement les ressources inactives du cluster pour améliorer considérablement l'utilisation du matériel.

Politique de données incorrectes

Les données incorrectes désignent les enregistrements de données qui ne peuvent pas être écrits dans la destination en raison d'exceptions telles que des conflits de type ou des violations de contraintes. La synchronisation par lots prend en charge des politiques de données incorrectes qui définissent le nombre acceptable d'enregistrements de données incorrectes et leur impact sur les tâches.

  • Ignorer les données incorrectes : les données incorrectes sont automatiquement filtrées. Seules les données valides sont écrites, et la tâche continue de s'exécuter.

  • Tolérer un nombre limité de données incorrectes : définissez un seuil N. Si le nombre d'enregistrements de données incorrectes est ≤ N, les données anormales sont rejetées et la tâche continue. Si le nombre dépasse N, la tâche échoue et se termine.

  • Aucune tolérance pour les données incorrectes : la tâche échoue immédiatement et se termine dès qu'elle rencontre des données incorrectes.

Fuseau horaire

Si une synchronisation inter-fuseaux horaires est requise entre la source et la destination, configurez le fuseau horaire source pour effectuer la conversion de fuseau horaire.

Traitement intelligent des données

DataWorks prend en charge l'intégration de capacités de traitement des données pendant la synchronisation des données pour transformer et traiter les données source avant de les écrire dans la destination :

Remplacement de chaîne : la fonctionnalité intégrée de remplacement de chaîne dans les tâches de synchronisation par lots vous permet d'effectuer des transformations de données légères directement pendant le transfert de données sans nécessiter d'atterrissage des données ou d'étapes ETL supplémentaires.

Traitement assisté par IA : prend en charge l'intégration de grands modèles de langage IA pendant la synchronisation des données pour effectuer une analyse sémantique, une analyse de sentiment et d'autres traitements sur les données en langage naturel source, et écrit les résultats traités directement dans la table de destination.

Vectorisation des données : prend en charge l'extraction et la vectorisation (embedding) des données source avant de les écrire dans une base de données vectorielle.

Étapes suivantes

Pour des instructions détaillées sur la création de tâches, consultez :