DataWorks Data Integration synchronise vos données au sein d'environnements réseau complexes. Depuis l'interface DataStudio, créez un nœud de synchronisation par lots pour synchroniser périodiquement les données par lots, ou créez un nœud de synchronisation en temps réel pour synchroniser les données incrémentielles d'une table unique ou d'une base de données entière. Cette rubrique présente une vue d'ensemble des fonctionnalités de synchronisation des données.
Contexte
Outre les nœuds de synchronisation des données dans DataStudio, Data Integration propose diverses solutions, telles que la synchronisation en temps réel (données complètes et incrémentielles) et la synchronisation par lots pour les bases de données entières. Pour en savoir plus sur Data Integration et ses solutions, consultez la section Sources de données prises en charge et solutions de synchronisation.
Limites
Le rôle Development est requis pour créer des tâches de synchronisation dans DataStudio. Pour attribuer des autorisations, consultez la section Ajouter des membres à un espace de travail et gérer leurs rôles.
Tâches de synchronisation par lots
-
Cas d'utilisation
La synchronisation par lots couvre deux scénarios principaux : la synchronisation d'une table source unique vers une table de destination unique et la synchronisation des données provenant de bases de données et de tables sources fragmentées vers une table de destination unique. Utilisez les paramètres de planification de DataWorks pour écrire périodiquement des données incrémentielles et complètes dans des partitions spécifiques d'une table de destination. De plus, la fonctionnalité de remplissage des données dans Operation Center permet d'utiliser une seule configuration de tâche pour synchroniser par lots les données historiques vers une table ou une partition spécifique de votre base de données ou entrepôt de données de destination.
-
Sources de données prises en charge
Data Integration prend en charge plus de 40 types de sources de données, notamment les bases de données relationnelles, le stockage non structuré, le stockage Big Data et les files d'attente de messages. Transférez des données entre n'importe quelles sources de données structurées et semi-structurées en définissant les sources et destinations, puis en utilisant les plug-ins Reader et Writer dans Data Integration.
-
Fonctionnalités
Description Références Data Integration utilise des plug-ins Reader et Writer pour la synchronisation par lots. Créez une source de données dans DataWorks et utilisez son nom pour spécifier la source et la destination du transfert de données. Après avoir créé une source de données dans DataWorks, configurez les tâches de synchronisation des données via l'interface sans code. Configurer une tâche de synchronisation par lots à l'aide de l'interface sans code Utilisez l'éditeur de code pour configurer une tâche de synchronisation dans les scénarios suivants : - La source de données ne peut pas être créée directement dans DataWorks.
- La source de données ne prend pas en charge la configuration des tâches via l'interface sans code.
- Certains paramètres de plug-in doivent être configurés dans l'éditeur de code.
Configurer une tâche de synchronisation par lots à l'aide de l'éditeur de code
Tâches de synchronisation en temps réel
La synchronisation en temps réel combine plusieurs sources de données en pipelines en forme d'étoile. Configurez diverses combinaisons d'entrées et de sorties pour créer des liens de synchronisation de données flexibles. Synchronisez ainsi les données d'une seule table source vers une seule table de destination, ou d'une base de données source entière vers une destination. Pour plus de détails, consultez les sections Sources de données prises en charge pour la synchronisation en temps réel et Vue d'ensemble de la synchronisation en temps réel.
Configuration de la planification des tâches
Dépendances des nœuds
-
Tâche de synchronisation par lots
Nœuds ancêtres d'une tâche de synchronisation par lots : Les tâches de synchronisation s'appuient sur la lignée de données de la plateforme. Selon la complexité de la logique métier de votre espace de travail, configurez la tâche pour qu'elle dépende soit du nœud racine de l'espace de travail, soit d'un nœud à charge nulle. Ce paramètre détermine si le nœud racine ou le nœud à charge nulle planifie le nœud actuel.
Nœuds descendants d'une tâche de synchronisation par lots : Pour garantir qu'une tâche SQL en aval analyse automatiquement et définit une dépendance sur cette tâche de synchronisation lors du traitement des données de la table, ajoutez la table de sortie de la tâche de synchronisation en tant que sortie du nœud. Utilisez le format
projectname.tablename.
-
Nœuds descendants d'une tâche de synchronisation en temps réel
DataWorks prend uniquement en charge la définition de dépendances sur les tables produites par des nœuds planifiés périodiquement. Vous ne pouvez donc pas utiliser la lignée de données pour définir une dépendance lorsqu'une tâche en aval doit traiter les données d'une tâche de synchronisation en temps réel. Comme solution de contournement, définissez l'ancêtre de la tâche comme étant le
nœud racine
de l'espace de travail ou un
nœud à charge nulle
. Le nœud racine ou le nœud à charge nulle planifie alors la tâche, selon vos exigences métier.
RemarquePour garantir que votre tâche de synchronisation en temps réel s'exécute comme prévu,
configurez une règle de surveillance
.
Paramètres de planification des nœuds
Les tâches de synchronisation par lots incluent une variable intégrée nommée
${bizdate}
. Cette variable reçoit automatiquement la valeur du paramètre de planification intégré au système
$bizdate
.
Pour en savoir plus sur le fonctionnement des paramètres de planification dans Data Integration, consultez la section Utilisation des paramètres de planification dans Data Integration.
Pour examiner les cas d'utilisation typiques des paramètres de planification dans Data Integration, consultez la section Cas d'utilisation : Applications typiques des paramètres de planification dans Data Integration.