Le lignage des données pour les déploiements Flink vous permet de retracer l'origine de vos données, de gérer et d'optimiser les flux de données, de localiser rapidement les problèmes et d'évaluer leur impact. Cette rubrique décrit comment consulter le lignage des données depuis la perspective d'un déploiement et depuis la perspective des métadonnées.
Contexte
Lorsque l'origine et l'historique des modifications des données ne sont pas traçables, il est difficile de garantir la qualité et la sécurité des données, et les analyses ainsi que le dépannage deviennent inefficaces. Le lignage des données répond à ces défis en décrivant les relations formées lors de l'acquisition, du traitement, de la transmission et de la consommation des données. Ces relations incluent les flux de données entre les métadonnées, les dépendances, ainsi que les relations de production et de consommation entre les métadonnées et les déploiements en flux ou par lots. Dans Flink, vous pouvez consulter et analyser le lignage des données à plusieurs niveaux de déploiement, tant au niveau des tables qu'au niveau des colonnes. Le tableau suivant présente les principaux avantages.
|
Avantage |
Description |
|
Améliorer l'efficacité de la validation des données |
En retraçant le lignage des données, vous comprenez tous les aspects de vos données, y compris les produits, bases de données et tables impliqués dans un déploiement, les attributs et associations des colonnes de table, ainsi que l'origine des données, les étapes de traitement, le chemin de transmission et les consommateurs finaux. Ces connaissances vous aident à valider la crédibilité et l'exactitude des données, à gérer et analyser les données plus efficacement et à améliorer votre productivité. |
|
Améliorer l'efficacité du dépannage |
Lorsqu'un problème de traitement des données survient, le lignage des données vous permet de remonter à la cause racine pour une résolution rapide, évitant ainsi les pertes commerciales et des coûts de main-d'œuvre élevés. |
|
Améliorer l'efficacité de l'analyse des données |
Lorsqu'un actif de données change ou contient des erreurs, vous pouvez identifier rapidement les déploiements en ligne affectés et prendre des mesures correctives pour éviter des décisions incorrectes. |
|
Optimiser les coûts des actifs de données |
En analysant le lignage des données, vous comprenez les chemins de flux de données et les dépendances. Cela vous permet d'optimiser les pipelines de traitement des données, de mettre hors service les services inutilisés depuis longtemps, d'améliorer l'efficacité et la qualité du traitement des données et de réduire les coûts liés aux données. |
Modèle de lignage des données
La figure contient des nœuds (entités) et des arêtes (relations). Les entités et les relations forment ensemble le lignage des données.
|
Élément |
Description |
|
Nœud |
Chaque catalogue, table de données et colonne est une entité de données. Dans le graphique de lignage, une entité est représentée par un nœud. Les nœuds de lignage des données comprennent les deux types suivants :
|
|
Arête |
Les relations entre les entités sont définies par leurs sources en amont (producteurs) et leurs consommateurs en aval. Vous pouvez consulter les relations de lignage suivantes :
|
Limites
Le lignage des données est pris en charge uniquement au sein d'un seul namespace. Le lignage des données inter-namespaces n'est pas pris en charge.
Pour consulter le lignage des données depuis la perspective des métadonnées, vous devez utiliser un catalogue. La consultation depuis la perspective du déploiement ne dépend pas d'un catalogue.
Seuls les déploiements SQL permettent de consulter et de rechercher le lignage des données.
Le lignage des données est disponible uniquement pour les déploiements SQL que vous avez démarrés au moins une fois. Lorsque vous arrêtez un déploiement, le système conserve son dernier lignage des données connu.
Seules les opérations QueryOperation, SinkModifyOperation et CreateTableAsTableOperation sont prises en charge. Le système ne peut pas suivre ni afficher le lignage indirect provenant de sources telles que la syntaxe CDAS, les conditions de filtre ou les conditions de jointure.
Consulter le lignage depuis la perspective du déploiement
Sur la page Deployments, vous pouvez consulter des informations spécifiques sur les nœuds de déploiement et les nœuds de données, ainsi que les dépendances entre les tables et les relations hiérarchiques entre les tables et les colonnes dans le déploiement cible.
Par défaut, le graphique est centré sur le déploiement et affiche trois niveaux de lignage : la table en amont, le déploiement central et la table en aval. Si vous devez retracer le lignage plus loin en amont ou en aval, cliquez sur le signe plus à gauche de la table en amont ou à droite de la table en aval.
Connectez-vous à la console Realtime Compute for Apache Flink.
Cliquez sur Console dans la colonne Actions de l'espace de travail cible.
Dans le volet de navigation de gauche, accédez à , puis cliquez sur le nom du déploiement cible.
-
Sous l'onglet Data Lineage, cliquez sur Table Level ou Column Level pour consulter le lignage des données correspondant.
-
Table Level
Vous pouvez consulter des informations telles que le type de nœud, le connecteur, le nom du catalogue, le nom de la base de données, les noms des tables de destination et source, ainsi que l'ID du déploiement, l'heure de création, le créateur, l'heure de la dernière modification et le dernier modificateur.
Dans le graphe acyclique dirigé (DAG) du déploiement, les données circulent du nœud source datagen via le nœud de traitement resource_setting_plan jusqu'au nœud de destination blackhole. Vous pouvez cliquer sur un nœud pour ouvrir un panneau de détails et consulter les valeurs de chaque colonne.
-
Column Level
Vous pouvez consulter les colonnes de table, les types de colonne, le nom de la base de données de la table, le nom du catalogue et le connecteur, ainsi que des informations sur le déploiement.
Dans le DAG du déploiement, les données circulent du nœud source datagen via le nœud de traitement resource_setting_plan jusqu'au nœud puits blackhole. Chaque nœud affiche le type de connecteur et les détails des colonnes, tels que id et name, tous deux de type VARCHAR(2147483647).
-
Consulter le lignage depuis la perspective des métadonnées
Si une table d'un catalogue est associée à de nombreux déploiements, le graphique de lignage devient encombré. Vous pouvez utiliser des fonctionnalités telles que le zoom pour naviguer dans le graphique. Vous pouvez également activer l'option Auto focus clicked node. Lorsque cette fonctionnalité est activée, cliquer sur un déploiement ou une table cible centre automatiquement le graphique sur ce nœud.
Connectez-vous à la console Realtime Compute for Apache Flink.
Cliquez sur Console dans la colonne Actions de l'espace de travail cible.
Dans le volet de navigation de gauche, cliquez sur Catalogs. Ensuite, double-cliquez sur le nom d'une table sous une base de données spécifique d'un catalogue.
-
Sous l'onglet Data Lineage, cliquez sur Table Level ou Column Level pour consulter le lignage des données correspondant.
-
Table Level
Vous pouvez voir quels déploiements référencent une table spécifique dans le catalogue cible. Lorsque le schéma de la table ou les données changent, vous pouvez rapidement gérer l'impact sur les déploiements référencés en modifiant leur code ou en les arrêtant.
Double-cliquez sur le nœud de déploiement cible pour consulter son ID et les informations relatives à sa création et à sa modification. Pour accéder rapidement à la page O&M du déploiement, cliquez sur le nom du déploiement.
-
Column Level
Vous pouvez cliquer sur une colonne cible et suivre la ligne pleine bleu clair pour déterminer quel déploiement et quelle table la référencent, ainsi que la colonne correspondante. Lorsque la colonne cible est supprimée ou que son nom ou ses attributs changent, vous pouvez rapidement trouver les déploiements, tables et colonnes référencés pour gérer les colonnes de table associées en conséquence.
Le canevas affiche les nœuds de requête intermédiaires associés (tels que query-91) au centre. Le panneau de propriétés à droite affiche les détails de la colonne sélectionnée, tels que le type de nœud, le type de colonne (par exemple, VARCHAR(2147483647)) et la possibilité d'être nul.
-
Rechercher des nœuds ou des colonnes
Lorsque le graphique de lignage est complexe, vous pouvez effectuer une recherche floue sur le nom d'un nœud ou d'une colonne pour localiser rapidement la cible et consulter ses informations.
-
Sous l'onglet Data Lineage du déploiement cible sur la page , saisissez le nom du nœud cible ou le nom de la colonne (pris en charge uniquement au niveau des colonnes) dans la zone de recherche et appuyez sur Entrée.
Le nœud central passe du déploiement actuel à la cible de recherche et est mis en surbrillance.
Double-cliquez sur le nom du nœud ou de la colonne cible pour consulter ses informations de lignage.