La synchronisation par lots transfère des données complètes ou incrémentielles entre les bases de données source et de destination à l'aide des plugins Reader et Writer. Configurez les sources de données et les paramètres de planification pour automatiser le processus. Cette rubrique décrit les fonctionnalités de la synchronisation par lots.
Fonctionnalités principales
La synchronisation hors ligne offre les fonctionnalités suivantes :
Fonctionnalité | Description |
Synchronisation des données entre sources hétérogènes | Data Integration prend en charge plus de 50 types de sources de données, notamment les bases de données relationnelles, le stockage non structuré, le stockage Big Data et les files d'attente de messages. Définissez les sources et destinations de données, puis utilisez les plugins Reader et Writer fournis par Data Integration pour transférer des données entre n'importe quelles sources structurées ou semi-structurées. Pour plus d'informations, consultez Sources de données prises en charge et solutions de synchronisation. |
Synchronisation des données dans des environnements réseau complexes | La synchronisation par lots prend en charge ApsaraDB, les centres de données sur site, les bases de données auto-gérées sur ECS et les bases de données externes à Alibaba Cloud. Avant la configuration, assurez-vous de la connectivité réseau entre le groupe de ressources et les endpoints source et de destination. Pour plus d'informations sur la configuration, consultez Solutions de connectivité réseau. |
Scénarios de synchronisation | 1. Modes de synchronisation
Remarque Pour plus d'informations sur les paramètres de planification, consultez Scénarios typiques des paramètres de planification dans Data Integration et Paramètres de planification. 2. Structures source prises en charge
|
Méthodes de configuration | Configurez les tâches de synchronisation par lots dans Data Integration à l'aide des méthodes suivantes.
Remarque Pour plus d'informations sur les capacités de configuration des tâches, consultez Présentation des fonctionnalités. |
Exploitation et maintenance des tâches de synchronisation par lots |
|
Présentation des fonctionnalités
Fonctionnalité | Description |
Synchronisation complète ou incrémentielle des données | Les tâches de synchronisation par lots prennent en charge la synchronisation complète ou incrémentielle des données en configurant le Data Filtering combiné aux paramètres de planification. Les configurations pour la synchronisation incrémentielle varient selon les plugins. Pour plus d'informations sur la synchronisation incrémentielle des données, consultez Configurer la synchronisation incrémentielle des données. |
Mappage des champs | En définissant des règles de mappage des champs, les données source sont écrites dans les champs de destination correspondants selon les relations spécifiées. Assurez-vous que les types de champs des deux côtés sont compatibles.
|
Limitation du débit des jobs |
|
Exécution distribuée des tâches | Les sources de données qui prennent en charge l'exécution distribuée peuvent utiliser le fragmentation des tâches pour distribuer les tâches de synchronisation sur plusieurs nœuds pour une exécution concurrente. Cela permet à la vitesse de synchronisation de s'adapter linéairement à la taille du cluster, brisant les goulots d'étranglement de performance des nœuds uniques. Ce mode est particulièrement adapté aux scénarios de synchronisation à haut débit et faible latence, et utilise efficacement les ressources inactives du cluster pour améliorer considérablement l'utilisation du matériel. |
Politique de données incorrectes | Les données incorrectes désignent les enregistrements de données qui ne peuvent pas être écrits dans la destination en raison d'exceptions telles que des conflits de type ou des violations de contraintes. La synchronisation par lots prend en charge des politiques de données incorrectes qui définissent le nombre acceptable d'enregistrements de données incorrectes et leur impact sur les tâches.
|
Fuseau horaire | Si une synchronisation inter-fuseaux horaires est requise entre la source et la destination, configurez le fuseau horaire source pour effectuer la conversion de fuseau horaire. |
Traitement intelligent des données | DataWorks prend en charge l'intégration de capacités de traitement des données pendant la synchronisation des données pour transformer et traiter les données source avant de les écrire dans la destination : Remplacement de chaîne : la fonctionnalité intégrée de remplacement de chaîne dans les tâches de synchronisation par lots vous permet d'effectuer des transformations de données légères directement pendant le transfert de données sans nécessiter d'atterrissage des données ou d'étapes ETL supplémentaires. Traitement assisté par IA : prend en charge l'intégration de grands modèles de langage IA pendant la synchronisation des données pour effectuer une analyse sémantique, une analyse de sentiment et d'autres traitements sur les données en langage naturel source, et écrit les résultats traités directement dans la table de destination. Vectorisation des données : prend en charge l'extraction et la vectorisation (embedding) des données source avant de les écrire dans une base de données vectorielle. |
Étapes suivantes
Pour des instructions détaillées sur la création de tâches, consultez :