DataWorks Data Map fournit des informations détaillées sur le lignage pour les tables et les API DataService Studio sur leurs pages de détails respectives, ce qui vous aide à retracer l'origine des données et à gérer les dépendances. La console classe les métadonnées et les calculs par type, tels que EMR Hive, Data Lake Formation (DLF) et Data Lake Formation (DLF-Legacy). Cette rubrique explique comment afficher le lignage pour chaque type.
Table Lineage
Point d'accès
Dans Data Map, recherchez une table et accédez à sa page de détails. Cliquez sur l'onglet Lineage Information pour afficher les détails du lignage au niveau de la table et au niveau du champ. Vous pouvez également effectuer une analyse d'impact pour obtenir la liste des tables en aval, télécharger cette liste sous forme de fichier local ou envoyer des notifications de modification par e-mail.
Data Map affiche le lignage extrait des tâches de planification et des informations de transfert de données. Le lignage issu d'opérations manuelles, telles que les requêtes temporaires, n'est pas inclus. Le lignage des données offline est mis à jour selon un décalage J+1.
Pour visualiser un lignage complexe à plusieurs niveaux dans une zone plus grande, cliquez sur le bouton Open in New Page (icône plein écran) situé dans la barre d'outils supérieure droite du graphique de lignage. Cette action ouvre le lignage sur une page distincte. Ce bouton est disponible dans les onglets de lignage des tables, des jeux de données, des API DataService Studio et des ressources IA.
Si la fonctionnalité de lignage des données n'est pas activée pour votre espace de travail ou votre locataire, une page d'abonnement s'affiche lorsque vous accédez à l'onglet de lignage. Suivez les instructions à l'écran pour acheter ou activer la fonctionnalité.
Limites par source de données
EMR Hive, DLF et DLF-Legacy
EMR Hive : Pour gérer les métadonnées d'un cluster EMR dans DataWorks, vous devez d'abord configurer EMR-HOOK sur le cluster. Si EMR-HOOK n'est pas configuré, le lignage ne peut pas être affiché dans DataWorks. Pour plus d'informations, consultez la rubrique Configurer EMR-HOOK pour Hive.
-
DLF et DLF-Legacy : Pour les tables de Data Lake Formation (DLF) et Data Lake Formation (DLF-Legacy), le lignage est affiché dans Data Map après la collecte des métadonnées. Cette fonctionnalité est prise en charge lorsque les tâches de calcul utilisent les métadonnées DLF avec les moteurs Serverless Spark, Serverless StarRocks ou Serverless Flink. Pour les autres moteurs ou scénarios, l'affichage du lignage dépend des capacités d'acquisition et d'analyse des métadonnées. Pour plus d'informations, consultez la rubrique Acquisition des métadonnées.
ImportantLes moteurs Serverless Spark, Serverless StarRocks et Serverless Flink doivent être associés à un espace de travail DataWorks. Sinon, le lignage correspondant est considéré comme non pertinent pour DataWorks et est ignoré.
Pour les clusters de calcul EMR Hive : L'affichage du lignage n'est pas pris en charge pour les clusters EMR sur ACK Spark, mais il l'est pour les clusters EMR Serverless Spark.
Pour les clusters de calcul EMR Hive : Le lignage n'est pas disponible pour les tâches exécutées sur les nœuds EMR Presto.
-
Moteur EMR Impala : L'acquisition du lignage pour les tâches EMR Impala dépend des journaux de lignage propres à Impala. Dans la console du cluster EMR, accédez à Cluster Services > Impala > Configuration. Définissez le paramètre
lineage_event_log_dirsur/mnt/disk1/log/impala/lineage_loget redémarrez le service Impala. Une fois ces étapes effectuées, DataWorks Data Map peut afficher le lignage au niveau de la table et au niveau du champ pour les tâches EMR Impala.RemarqueSeules les tâches Impala sur les clusters EMR DataLake sont prises en charge. Les métadonnées HMS (correspondant au type de source de données EMR Hive) et DLF (correspondant au type de source de données DLF) sont prises en charge.
Il n'y a aucune exigence concernant la version du cluster EMR ou la version d'Impala. Impala doit simplement être déployé sur le cluster.
Cette fonctionnalité est actuellement en déploiement progressif. Avant de l'utiliser, soumettez un ticket ou contactez le support technique Alibaba Cloud pour l'activer.
AnalyticDB for MySQL
Exécutez l'instruction SQL
set adb_config RC_LINEAGE_INFO_LOG_ENABLE=truesur le moteur correspondant pour activer la fonctionnalité de lignage des données pour l'instance AnalyticDB for MySQL.Lorsque la source de métadonnées est de type AnalyticDB for Spark, la collecte automatique est prise en charge.
Lorsque la source de métadonnées est de type AnalyticDB for Spark, vous pouvez activer le lignage en temps réel en configurant le paramètre Spark
spark.sql.queryExecutionListeners = com.aliyun.dataworks.meta.lineage.LineageListener.
Pour les tables de type AnalyticDB for MySQL, certaines commandes de traitement SQL ne permettent pas de générer des informations de lignage dans Data Map. Les limites suivantes s'appliquent.
-
Commandes SQL ne prenant pas en charge l'affichage du lignage :
SQL non pris en charge
Exemple
join,unionou l'utilisation de mots-clés tels que*ne sont pas pris en charge.Par exemple, le SQL suivant utilise
*, donc Data Map ne peut pas afficher le lignage.INSERT INTO test SELECT * FROM test1, test2 WHERE test1.id = test2.idLes sous-requêtes ne sont pas prises en charge.
Par exemple, le SQL suivant contient une sous-requête, donc Data Map ne peut pas afficher le lignage.
SELECT column1, column2 FROM table1 WHERE column3 IN (SELECT column4 FROM table2 WHERE column5 = 'value') -
Exemples de commandes SQL prenant en charge l'affichage du lignage :
-
Exemple 1 : Créez une table nommée A (sans spécifier de colonnes) et sélectionnez des colonnes spécifiques (à l'exclusion de *) de la table B comme contenu de la table A. Par exemple :
CREATE TABLE test AS SELECT id,name FROM test1; -
Exemple 2 : Insérez des colonnes spécifiques (à l'exclusion de *) de la table A qui répondent à la condition column1 = value1 dans la table B (sans spécifier de colonnes). Par exemple :
INSERT INTO test SELECT id,name FROM test1 WHERE name='test'; -
Exemple 3 : Écrasez des colonnes spécifiques (à l'exclusion de *) de la table A dans la table B d'une base de données. Par exemple :
INSERT OVERWRITE INTO db_name.test SELECT id,name FROM test1;
-
CDH
Pour afficher le lignage des tables pour le traitement des données CDH Spark SQL et des nœuds CDH Spark dans Data Map, configurez les paramètres Spark pour chaque module de traitement des données dans .
-
Connectez-vous à la console DataWorks. Dans la région cible, cliquez sur dans le volet de navigation de gauche. Sélectionnez un espace de travail dans la liste déroulante et cliquez sur Go to Management Center.
Dans le volet de navigation de gauche, cliquez sur Cluster Management, puis recherchez le cluster CDH cible que vous avez créé.
-
Cliquez sur Edit Spark Parameters.

-
Ajoutez des paramètres Spark en fonction du module de traitement des données spécifique.
Par exemple, pour afficher le lignage des tables pour le traitement des données par CDH Spark SQL et les nœuds CDH Spark dans le module Operation Center - Scheduled Instances de Data Map, ajoutez les paramètres suivants dans le module correspondant :
Spark Property Name :
spark.sql.queryExecutionListeners.Spark Property Value :
com.aliyun.dataworks.meta.lineage.LineageListener.
Cliquez sur Confirm pour terminer la modification.
Lindorm
La collecte d'informations de lignage est prise en charge uniquement en mode instance. Le mode chaîne de connexion ne prend pas en charge la collecte d'informations de lignage.
Pour afficher le lignage des tables pour le traitement des données Lindorm Spark et des nœuds Lindorm Spark SQL dans Data Map, configurez les paramètres Spark pour chaque module de traitement des données dans .
-
Connectez-vous à la console DataWorks. Dans la région cible, cliquez sur dans le volet de navigation de gauche. Sélectionnez un espace de travail dans la liste déroulante et cliquez sur Go to Management Center.
Dans le volet de navigation de gauche, cliquez sur Computing Resources, puis recherchez la ressource de calcul Lindorm que vous avez créée.
Cliquez sur Edit Spark Parameters.
-
Ajoutez des paramètres Spark en fonction du module de traitement des données spécifique.
Par exemple, pour afficher le lignage des tables pour le traitement des données par les nœuds Lindorm Spark et Lindorm Spark SQL dans le module Operation Center - Scheduled Instances de Data Map, ajoutez les paramètres suivants dans le module correspondant :
Spark Property Name :
spark.sql.queryExecutionListeners.Spark Property Value :
com.aliyun.dataworks.meta.lineage.LineageListener.
Cliquez sur Confirm pour terminer la configuration des paramètres Spark.
Prise en charge du lignage par source de données
La catégorie d'origine E-MapReduce dans Data Map a été divisée en EMR Hive, DLF et DLF-Legacy en fonction des sources de métadonnées. Le tableau suivant répertorie la prise en charge du lignage par catégorie de source de données telle qu'affichée dans la console actuelle.
Source de données | Data Integration | Data Studio | ||
Lignage au niveau de la table | Lignage au niveau de la colonne | Lignage au niveau de la table | Lignage au niveau de la colonne | |
AnalyticDB MySQL
|
|
|
|
|
AnalyticDB PostgreSQL
|
|
|
|
|
ClickHouse
|
|
|
|
|
CDH/CDP
|
|
| Hive, Impala, Spark, Spark SQL
| Hive, Impala, Spark, Spark SQL
|
EMR Hive
|
(OSS, Hive)
|
(OSS, Hive)
| Moteurs pris en charge : E-MapReduce, Serverless Spark, Serverless StarRocks, Serverless Flink et EMR Impala (clusters EMR DataLake uniquement ; actuellement en déploiement progressif ; contactez le support technique Alibaba Cloud pour l'activer avant utilisation).
| Moteurs pris en charge : E-MapReduce, Serverless Spark, Serverless StarRocks, Serverless Flink et EMR Impala (clusters EMR DataLake uniquement ; actuellement en déploiement progressif ; contactez le support technique Alibaba Cloud pour l'activer avant utilisation).
|
DLF-Legacy
|
(OSS, Hive)
|
(OSS, Hive)
| Moteurs pris en charge : E-MapReduce, Serverless Spark, Serverless StarRocks, Serverless Flink et EMR Impala (clusters EMR DataLake uniquement ; actuellement en déploiement progressif ; contactez le support technique Alibaba Cloud pour l'activer avant utilisation).
| Moteurs pris en charge : E-MapReduce, Serverless Spark, Serverless StarRocks, Serverless Flink et EMR Impala (clusters EMR DataLake uniquement ; actuellement en déploiement progressif ; contactez le support technique Alibaba Cloud pour l'activer avant utilisation).
|
DLF
|
(OSS, Hive)
|
(OSS, Hive)
| Moteurs pris en charge : Serverless Spark, Serverless StarRocks, Serverless Flink et EMR Impala (clusters EMR DataLake uniquement ; actuellement en déploiement progressif ; contactez le support technique Alibaba Cloud pour l'activer avant utilisation).
| Moteurs pris en charge : Serverless Spark, Serverless StarRocks, Serverless Flink et EMR Impala (clusters EMR DataLake uniquement ; actuellement en déploiement progressif ; contactez le support technique Alibaba Cloud pour l'activer avant utilisation).
|
Hologres
|
|
|
|
|
Kafka
|
(Kafka synchronisé vers MaxCompute/Hologres) |
|
|
|
Lindorm
|
|
|
|
|
MaxCompute
|
|
|
|
|
MySQL
|
(MySQL synchronisé vers MaxCompute/Hologres) |
|
|
|
Oracle
|
|
|
|
|
OceanBase
|
|
|
|
|
OSS
|
|
|
|
|
PolarDB MySQL
|
|
|
|
|
PolarDB PostgreSQL
|
|
|
|
|
PostgreSQL
|
|
|
|
|
StarRocks
|
|
|
|
|
SelectDB
|
|
|
|
|
SQL Server
|
|
|
|
|
Tablestore (OTS)
|
|
|
|
|
Lignage des API DataService Studio
Recherchez une API DataService Studio dans Data Map et accédez à sa page de détails. Cliquez sur l'onglet Lineage Information pour afficher les détails du lignage de l'API.
Lignage des ressources IA
Le lignage des ressources IA retrace les jeux de données d'entrée, les jeux de résultats de sortie et les relations entre les modèles utilisés lors de l'entraînement des modèles. Pour plus d'informations, consultez la rubrique Lignage des ressources IA.
Page de détails
Synchronisation en temps réel