Data Map de DataWorks propose la fonctionnalité Metadata Collection, qui vous permet de consolider et de gérer de manière centralisée les métadonnées provenant de diverses sources de données DataWorks. Dans Data Map, vous pouvez consulter les métadonnées agrégées de l'ensemble de vos sources. Cette rubrique explique comment créer un crawler qui collecte et consolide les métadonnées de différentes sources de données dans DataWorks.
Présentation
La collecte de métadonnées est une fonctionnalité essentielle pour mettre en place un Data Map d'envergure entreprise et réaliser une gestion unifiée des actifs de données. Un crawler extrait automatiquement les métadonnées techniques (telles que les bases de données, les tables et les colonnes), la lignée des données ainsi que les informations sur les partitions à partir des sources de données DataWorks (comme MaxCompute, Hologres, MySQL et CDH Hive) dispersées dans différents espaces de travail au sein d'une même région. Il consolide ensuite ces informations dans Data Map de DataWorks afin de créer une vue unifiée des données.
La collecte de métadonnées vous permet de :
Créer une vue unifiée des données : éliminez les silos de données en gérant de manière centralisée les métadonnées issues de sources multiples et hétérogènes.
Faciliter la découverte et la recherche de données : permettez aux consommateurs de données de trouver rapidement et avec précision les données dont ils ont besoin.
Réaliser une analyse complète de la lignée des données : tracez clairement l'origine et le flux des données pour faciliter l'analyse d'impact et le dépannage.
Renforcer la gouvernance des données : mettez en œuvre la classification des données, le contrôle d'accès, la surveillance de la qualité et la gestion du cycle de vie sur la base de métadonnées exhaustives.
Facturation
Par défaut, chaque tâche de collecte consomme 0,25 UC multiplié par la durée d'exécution de la tâche, ce qui entraîne des frais d'unité de calcul. Chaque collecte réussie génère une instance de planification, entraînant des frais de planification.
Limites
Si une source de données utilise une liste d'autorisation pour le contrôle d'accès, vous devez la configurer au préalable. Pour plus d'informations, consultez la section Liste d'autorisation pour la collecte de métadonnées.
Le déploiement DataWorks et la source de données doivent se trouver dans la même région. Si vous devez collecter des métadonnées entre différentes régions, utilisez un endpoint public lors de la création de la source de données. Pour plus d'informations, consultez la section Créer une source de données.
La collecte de métadonnées n'est pas prise en charge pour les sources de données AnalyticDB for MySQL ayant activé le protocole SSL.
La nouvelle version de la collecte de métadonnées prend uniquement en charge les nouveaux groupes de ressources Serverless. Les anciens groupes de ressources ne sont pas pris en charge. Assurez-vous d'avoir créé et lié un nouveau groupe de ressources Serverless avant d'utiliser la fonctionnalité de collecte de métadonnées.
Point d'entrée
Connectez-vous à la console DataWorks. Dans la région cible, cliquez sur dans le volet de navigation de gauche. Sur la page qui s'affiche, cliquez sur Go to Data Map.
Dans le volet de navigation de gauche, cliquez sur
pour accéder à la page de collecte de métadonnées.
Crawlers intégrés
Les crawlers intégrés sont préconfigurés et exécutés automatiquement (en quasi temps réel) par la plateforme DataWorks. Ils servent à collecter les métadonnées principales étroitement intégrées à DataWorks. Vous n'avez pas besoin de les créer ; il vous suffit de gérer le périmètre de collecte.
Si vous ne trouvez pas la table cible dans Data Map, accédez à et synchronisez manuellement les tables concernées.
Crawler MaxCompute par défaut
Ce crawler collecte les métadonnées des projets MaxCompute associés à votre compte. Vous pouvez accéder à la page des détails, cliquer sur Modify Data Scope pour sélectionner les projets à collecter, puis cliquer sur Permission Configurations pour configurer la visibilité des métadonnées au sein du tenant.
Dans la section Built-in de la page de collecte de métadonnées, repérez la carte MaxCompute Default Crawler et cliquez sur Details.
-
La page des détails du MaxCompute Default Crawler contient deux onglets : Basic Information et Data Scope.
Basic Information : affiche les propriétés de base du crawler, telles que le type et la méthode de collecte. Ces informations sont en lecture seule.
Data Scope : gère les projets MaxCompute à partir desquels ce crawler collecte les métadonnées.
-
Modifier le périmètre de collecte :
Basculez vers l'onglet Data Scope et cliquez sur le bouton Modify Data Scope.
-
Dans la boîte de dialogue qui s'affiche, sélectionnez ou désélectionnez les projets MaxCompute dont vous souhaitez collecter les métadonnées.
ImportantPar défaut, le périmètre inclut tous les projets MaxCompute associés aux espaces de travail de la région actuelle sous votre tenant. Après modification du périmètre de données, les objets de métadonnées collectés dans Data Map correspondent au périmètre actuel. Les métadonnées des projets désélectionnés ne sont plus visibles.
Cliquez sur OK pour enregistrer les modifications.
-
Configurer la visibilité des métadonnées :
Dans la liste Data Scope, repérez le projet cible et cliquez sur Permission Configurations dans la colonne Actions.
-
Sélectionnez une politique de visibilité selon vos exigences de gouvernance des données :
Public Within Tenant : tous les membres du tenant peuvent rechercher et afficher les métadonnées de ce projet.
Only members in the associated workspace can search and view. : seuls les membres d'espaces de travail spécifiques peuvent accéder aux métadonnées de ce projet, garantissant ainsi l'isolation des données.
Crawler DLF par défaut
Pour activer la collecte en temps réel des métadonnées DLF, vous devez accorder l'autorisation Data Reader au rôle lié au service AliyunServiceRoleForDataworksOnEmr dans la console DLF.
Le DLF Default Crawler collecte les métadonnées de Data Lake Formation (DLF) associées à votre compte.
Dans la section Built-in de la page de collecte de métadonnées, repérez la carte DLF Default Crawler et cliquez sur Details pour afficher les informations de base.
-
Basculez vers l'onglet Data Scope pour afficher la liste des catalogues DLF inclus dans le périmètre de collecte ainsi que le nombre de tables qu'ils contiennent.
Par défaut, tous les catalogues accessibles (y compris DLF et DLF-Legacy) sont collectés.
Crawlers personnalisés
Les crawlers personnalisés vous permettent de gérer de manière centralisée les métadonnées across environnements et moteurs.
-
Pour les sources de données classiques
Vous pouvez créer des crawlers personnalisés pour les sources de données structurées ou semi-structurées traditionnelles, telles que Hologres, StarRocks, MySQL, Oracle et CDH Hive. En configurant des tâches de collecte, le système effectue une analyse approfondie des structures physiques de bases de données et de tables à la source afin de réaliser l'extraction et la synchronisation automatisées des métadonnées, telles que les attributs de colonnes, les index et les partitions.
-
Pour les sources de données de type métadonnées (catalogue)
Pour les métadonnées natives de format lac non gérées par DLF et déclarées manuellement, telles que Paimon Catalog, Apache Gravitino et autres sources de données de type métadonnées, vous pouvez également créer des crawlers pour une collecte directe.
Create Custom Crawler
Dans la section de liste des crawlers personnalisés sur la page de collecte de métadonnées, cliquez sur Create Metadata Crawler.
Sélectionner un type de collecte : sur la page de sélection du type, choisissez le type de source de données cible à collecter, par exemple Hologres ou StarRocks.
-
Configurer les paramètres de base et le groupe de ressources :
-
Basic Configurations :
Select a workspace : sélectionnez l'espace de travail contenant la source de données.
Select Data Source : sélectionnez une source de données cible précédemment créée dans la liste déroulante. Après votre sélection, le système affiche automatiquement les détails de la source de données.
Name : nommez le crawler pour faciliter son identification ultérieure. Par défaut, le nom correspond à celui de la source de données.
-
Resource Group Configuration :
Resource Group : sélectionnez un groupe de ressources Serverless pour exécuter la tâche de collecte.
-
Test Network Connectivity : cette étape est cruciale. Cliquez sur Test Network Connectivity pour vous assurer que le groupe de ressources peut accéder à la source de données.
ImportantVérifiez si la source de données comporte des restrictions de liste d'autorisation. Si vous devez collecter des métadonnées depuis une source de données protégée par liste d'autorisation, consultez les sections Ajouter les adresses IP du groupe de ressources à la liste d'autorisation et Configurer une liste d'autorisation pour une source de données afin de configurer les autorisations de liste d'autorisation.
Si la source de données ne comporte pas de restrictions de liste d'autorisation, consultez la section Configurer la connectivité réseau pour une source de données pour établir la connectivité réseau avec la source de données.
Si le test de connectivité renvoie l'erreur
Backend service call failed: test connectivity failed.not support data type, contactez le support technique pour mettre à niveau le groupe de ressources.
-
-
Configurer la collecte de métadonnées :
-
Collection Scope : définissez les bases de données (database/schema) à collecter. Si la source de données est au niveau de la base de données, la base de données correspondant à la source est sélectionnée par défaut. Vous pouvez sélectionner des bases de données supplémentaires au-delà de la source de données.
ImportantChaque base de données ne peut être configurée que dans un seul crawler. Si une base de données est grisée, cela signifie qu'elle est déjà collectée par un autre crawler.
Après réduction du périmètre de collecte, les métadonnées situées en dehors de ce périmètre ne sont plus recherchables dans Data Map.
-
-
Configurer l'amélioration intelligente et le plan de collecte :
-
Amélioration intelligente (Beta) :
Descriptions générées par IA : lorsqu'elle est activée, cette fonctionnalité utilise les capacités des grands modèles de langage pour générer automatiquement des descriptions métier pour vos tables et colonnes après la collecte des métadonnées, améliorant considérablement la lisibilité et l'utilisabilité des métadonnées. Une fois la collecte terminée, vous pouvez consulter les informations générées par l'IA (telles que les descriptions de tables et de colonnes) sur la page des détails d'un objet table dans Data Map.
-
Collection Plan :
-
Trigger Mode : sélectionnez le mode manuel ou périodique.
Manuel : le crawler s'exécute uniquement lorsque vous le déclenchez manuellement. Ce mode convient aux collectes ponctuelles ou à la demande.
-
Périodique : configurez une tâche planifiée (par exemple mensuelle, quotidienne, hebdomadaire ou horaire) et le système mettra automatiquement à jour les métadonnées de manière périodique.
Pour configurer une tâche planifiée à la minute, sélectionnez le cycle de collecte horaire et choisissez toutes les granularités en minutes pour mettre en place une tâche s'exécutant toutes les 5 minutes.
ImportantSeules les sources de données de l'environnement de production prennent en charge la collecte périodique.
-
-
Enregistrer la configuration : cliquez sur Save ou Save and Run pour finaliser la création du crawler.
Gérer les crawlers personnalisés
Une fois un crawler créé, il apparaît dans la liste des crawlers personnalisés. Vous pouvez effectuer les opérations de gestion suivantes :
-
Opérations de liste : dans la liste, vous pouvez directement Run, Stop ou Delete un crawler. Utilisez les fonctionnalités Filter et Search en haut de la page pour localiser rapidement le crawler cible.
ImportantAprès suppression d'un crawler de métadonnées, les objets de métadonnées collectés par ce crawler dans Data Map deviennent invalides. Vous ne pourrez plus rechercher ni afficher ces objets ni leurs détails. Procédez avec prudence.
Opérations groupées : sélectionnez plusieurs crawlers dans la liste et utilisez Batch Run ou Batch Stop en bas de la liste pour déclencher ou arrêter plusieurs tâches de collecte simultanément, améliorant ainsi l'efficacité de gestion.
-
Statut du crawler : la liste des crawlers affiche le statut actuel de chacun d'eux. Les statuts courants incluent Not Run, Waiting, Running, Successful, Failed et Manually Terminated.
RemarqueSi la source de données associée à un crawler a été dissociée ou devient invalide, le crawler passe à l'état frozen. Un crawler gelé ne peut pas être exécuté et ne peut être que supprimé.
-
Afficher les détails et les journaux : cliquez sur le nom du crawler cible pour accéder à sa page de détails.
Basic Information : affichez tous les éléments de configuration du crawler.
-
Data Scope : affichez ou Modify Data Scope.
Si aucune collecte n'a été effectuée, le nombre de tables et l'heure de la dernière mise à jour restent vides.
Les sources de données suivantes ne prennent pas en charge la modification du périmètre : EMR Hive, CDH Hive, Lindorm, ElasticSearch, OTS, MongoDB et AnalyticDB for Spark dans AnalyticDB MySQL.
Run Logs : suivez l'historique d'exécution de chaque tâche de collecte. Vous pouvez consulter l'heure de début, la durée, le statut et le volume de données collectées pour chaque tâche. En cas d'échec d'une tâche, cliquer sur View Logs constitue le point d'entrée principal pour identifier et résoudre les problèmes.
Déclencher manuellement la collecte : dans le coin supérieur droit de la page de détails, cliquez sur le bouton Collect Metadata pour déclencher immédiatement une tâche de collecte. Cette option est utile lorsque vous souhaitez voir une table nouvellement créée dans Data Map sans délai.
Étapes suivantes
Une fois les métadonnées collectées avec succès, vous pouvez tirer pleinement parti des diverses fonctionnalités de Data Map :
Recherchez vos tables collectées dans Data Map et consultez leurs détails, les informations sur les colonnes, les partitions ainsi qu'un aperçu des données. Pour plus d'informations, consultez la section Afficher les détails d'une table.
Analysez la lignée amont et aval d'une table pour comprendre le flux complet de traitement des données. Pour plus d'informations, consultez la section Lignée des données.
Ajoutez des actifs à une Data Collection pour organiser et gérer vos données d'un point de vue métier. Pour plus d'informations, consultez la section Créer une Data Collection.
FAQ
-
Q : La collecte des sources de type base de données (MySQL, etc.) expire ou échoue ?
R : Vérifiez si vous avez ajouté le bloc CIDR du vSwitch du groupe de ressources à la liste d'autorisation. Vérifiez le vSwitch CIDR Block du groupe de ressources.
Annexe : Périmètre de collecte et actualité
Source de données
Data Source Type | Collection Mode | Granularité de collecte | Actualité de la mise à jour des métadonnées | ||
Table/Colonne | Partition | Lignée | |||
MaxCompute | Collecte automatique par le système par défaut | Instance | Projets réguliers : Temps réel Projets externes : T+1 | Régions de Chine continentale : Temps réel Régions internationales : T+1 | Temps réel |
Data Lake Formation (DLF) | Instance | Temps réel Important Pour activer la collecte en temps réel, vous devez accorder l'autorisation Data Reader au rôle lié au service | Temps réel | La lignée est prise en charge pour les métadonnées DLF des moteurs Serverless Spark, Serverless StarRocks, Serverless Flink et EMR Impala. Les autres moteurs ne sont pas pris en charge. Important Pour les clusters EMR, vous devez activer EMR_HOOK. Pour afficher la lignée des tâches EMR Impala, vous devez activer la journalisation de la lignée dans la configuration Impala du cluster EMR. Cette fonctionnalité n'est prise en charge que pour les clusters EMR DataLake et est actuellement en phase de déploiement progressif. Contactez le support technique d'Alibaba Cloud pour activer cette fonctionnalité avant utilisation. Pour les détails de configuration, consultez Lignée des données. | |
Hologres | Créer un crawler manuellement | Base de données | Dépend du cycle de collecte | Temps réel | |
EMR Hive | Instance | Dépend du cycle de collecte | Dépend du cycle de collecte | Temps réel Important Vous devez activer EMR_HOOK pour le cluster. Pour afficher la lignée des tâches EMR Impala, vous devez activer la journalisation de la lignée dans la configuration Impala du cluster EMR. Cette fonctionnalité n'est prise en charge que pour les clusters EMR DataLake et est actuellement en phase de déploiement progressif. Contactez le support technique d'Alibaba Cloud pour activer cette fonctionnalité avant utilisation. Pour les détails de configuration, consultez Lignée des données. | |
CDH Hive | Instance | Dépend du cycle de collecte | Temps réel | Temps réel | |
StarRocks | Base de données |
| Temps réel Important Seul le mode instance prend en charge la collecte de la lignée. Le mode chaîne de connexion ne prend pas en charge la collecte de la lignée. | ||
AnalyticDB for MySQL | Base de données | Dépend du cycle de collecte | Temps réel Remarque Vous devez soumettre un ticket pour activer la fonctionnalité de lignée des données pour l'instance AnalyticDB for MySQL. | ||
AnalyticDB for Spark | Instance | Temps réel | Temps réel | ||
AnalyticDB for PostgreSQL | Base de données | Dépend du cycle de collecte | Temps réel | ||
Lindorm | Instance | Dépend du cycle de collecte | Temps réel | ||
OTS | Instance | Dépend du cycle de collecte | |||
MongoDB | Instance | Dépend du cycle de collecte | |||
ElasticSearch | Instance | Dépend du cycle de collecte | Mise à jour T+1 | ||
Paimon Catalog | Catalogue | Dépend du cycle de collecte | Dépend du cycle de collecte | ||
Apache Gravitino | Catalogue | Dépend du cycle de collecte | Dépend du cycle de collecte | ||
Autres types de sources de données (MySQL, PostgreSQL, SQL Server, Oracle, ClickHouse, SelectDB, OceanBase, etc.) | Base de données | Dépend du cycle de collecte | |||
« Dépend du cycle de collecte » dans le tableau signifie que les métadonnées sont mises à jour périodiquement en fonction du plan de collecte que vous avez configuré pour le crawler (par exemple mensuel, quotidien, hebdomadaire ou horaire).
AnalyticDB for Spark et AnalyticDB for MySQL partagent le même point d'entrée pour la collecte de métadonnées.
Code de tâche
Data Map prend en charge la recherche de code de tâche et la navigation rapide. La section suivante décrit le périmètre du code searchable.
Source du code | Périmètre de collecte | Méthode de déclenchement de la collecte |
Data Studio | Data Studio - Créer un nœud et modifier le code | Collecte automatique |
Legacy Data Studio | Legacy Data Studio - Créer un nœud et modifier le code | |
Data Analysis | Data Analysis - Créer une requête SQL et modifier le code | |
Data Service | Data Service - Créer un service API Data Push |
Actifs API
Data Map permet d'afficher les métadonnées des API Data Service, comme décrit ci-dessous :
API Type | Périmètre de collecte | Méthode de déclenchement de la collecte |
Génération d'API (mode assistant) | Data Service - Créer une API en mode assistant | Collecte automatique |
Génération d'API (mode script) | Data Service - Créer une API en mode script | |
Enregistrement d'API | Data Service - Enregistrer une API | |
Orchestration d'API | Data Service - Créer une orchestration d'API |
Actifs IA
Data Map permet d'afficher et de gérer les actifs IA, et fournit une lignée des actifs IA pour suivre l'origine, l'utilisation et l'évolution des données et des modèles. La section suivante décrit la prise en charge de chaque type d'actif IA.
Type d'actif | Périmètre de collecte | Méthode de déclenchement de la collecte |
Jeu de données |
| Collecte automatique |
Modèle IA | PAI - Tâche d'entraînement de modèle/Enregistrer un modèle/Déployer un service de modèle | |
Tâche algorithmique | PAI - Tâche d'entraînement/Tâche de workflow/Tâche d'entraînement distribué | |
Service de modèle | PAI - Déployer un service de modèle (déploiement EAS) |
Workspace
Data Map permet d'afficher les métadonnées de l'espace de travail, comme décrit ci-dessous :
|
Projet |
Collection Mode |
Méthode de déclenchement de la collecte |
|
Espace de travail |
DataWorks - Créer un espace de travail |
Collecte automatique |