Tous les produits
Search
Centre de documentation

DataWorks:Collecte de métadonnées

Dernière mise à jour :Aug 27, 2026

Data Map de DataWorks propose la fonctionnalité Metadata Collection, qui vous permet de consolider et de gérer de manière centralisée les métadonnées provenant de diverses sources de données DataWorks. Dans Data Map, vous pouvez consulter les métadonnées agrégées de l'ensemble de vos sources. Cette rubrique explique comment créer un crawler qui collecte et consolide les métadonnées de différentes sources de données dans DataWorks.

Présentation

La collecte de métadonnées est une fonctionnalité essentielle pour mettre en place un Data Map d'envergure entreprise et réaliser une gestion unifiée des actifs de données. Un crawler extrait automatiquement les métadonnées techniques (telles que les bases de données, les tables et les colonnes), la lignée des données ainsi que les informations sur les partitions à partir des sources de données DataWorks (comme MaxCompute, Hologres, MySQL et CDH Hive) dispersées dans différents espaces de travail au sein d'une même région. Il consolide ensuite ces informations dans Data Map de DataWorks afin de créer une vue unifiée des données.

La collecte de métadonnées vous permet de :

  • Créer une vue unifiée des données : éliminez les silos de données en gérant de manière centralisée les métadonnées issues de sources multiples et hétérogènes.

  • Faciliter la découverte et la recherche de données : permettez aux consommateurs de données de trouver rapidement et avec précision les données dont ils ont besoin.

  • Réaliser une analyse complète de la lignée des données : tracez clairement l'origine et le flux des données pour faciliter l'analyse d'impact et le dépannage.

  • Renforcer la gouvernance des données : mettez en œuvre la classification des données, le contrôle d'accès, la surveillance de la qualité et la gestion du cycle de vie sur la base de métadonnées exhaustives.

Facturation

Par défaut, chaque tâche de collecte consomme 0,25 UC multiplié par la durée d'exécution de la tâche, ce qui entraîne des frais d'unité de calcul. Chaque collecte réussie génère une instance de planification, entraînant des frais de planification.

Limites

  • Si une source de données utilise une liste d'autorisation pour le contrôle d'accès, vous devez la configurer au préalable. Pour plus d'informations, consultez la section Liste d'autorisation pour la collecte de métadonnées.

  • Le déploiement DataWorks et la source de données doivent se trouver dans la même région. Si vous devez collecter des métadonnées entre différentes régions, utilisez un endpoint public lors de la création de la source de données. Pour plus d'informations, consultez la section Créer une source de données.

  • La collecte de métadonnées n'est pas prise en charge pour les sources de données AnalyticDB for MySQL ayant activé le protocole SSL.

  • La nouvelle version de la collecte de métadonnées prend uniquement en charge les nouveaux groupes de ressources Serverless. Les anciens groupes de ressources ne sont pas pris en charge. Assurez-vous d'avoir créé et lié un nouveau groupe de ressources Serverless avant d'utiliser la fonctionnalité de collecte de métadonnées.

Point d'entrée

  1. Connectez-vous à la console DataWorks. Dans la région cible, cliquez sur Data Governance > Data Map dans le volet de navigation de gauche. Sur la page qui s'affiche, cliquez sur Go to Data Map.

  2. Dans le volet de navigation de gauche, cliquez sur image pour accéder à la page de collecte de métadonnées.

Crawlers intégrés

Les crawlers intégrés sont préconfigurés et exécutés automatiquement (en quasi temps réel) par la plateforme DataWorks. Ils servent à collecter les métadonnées principales étroitement intégrées à DataWorks. Vous n'avez pas besoin de les créer ; il vous suffit de gérer le périmètre de collecte.

Important

Si vous ne trouvez pas la table cible dans Data Map, accédez à My Data > My Tools > Refresh Table Metadata et synchronisez manuellement les tables concernées.

Crawler MaxCompute par défaut

Ce crawler collecte les métadonnées des projets MaxCompute associés à votre compte. Vous pouvez accéder à la page des détails, cliquer sur Modify Data Scope pour sélectionner les projets à collecter, puis cliquer sur Permission Configurations pour configurer la visibilité des métadonnées au sein du tenant.

  1. Dans la section Built-in de la page de collecte de métadonnées, repérez la carte MaxCompute Default Crawler et cliquez sur Details.

  2. La page des détails du MaxCompute Default Crawler contient deux onglets : Basic Information et Data Scope.

    • Basic Information : affiche les propriétés de base du crawler, telles que le type et la méthode de collecte. Ces informations sont en lecture seule.

    • Data Scope : gère les projets MaxCompute à partir desquels ce crawler collecte les métadonnées.

  3. Modifier le périmètre de collecte :

    1. Basculez vers l'onglet Data Scope et cliquez sur le bouton Modify Data Scope.

    2. Dans la boîte de dialogue qui s'affiche, sélectionnez ou désélectionnez les projets MaxCompute dont vous souhaitez collecter les métadonnées.

      Important

      Par défaut, le périmètre inclut tous les projets MaxCompute associés aux espaces de travail de la région actuelle sous votre tenant. Après modification du périmètre de données, les objets de métadonnées collectés dans Data Map correspondent au périmètre actuel. Les métadonnées des projets désélectionnés ne sont plus visibles.

    3. Cliquez sur OK pour enregistrer les modifications.

  4. Configurer la visibilité des métadonnées :

    • Dans la liste Data Scope, repérez le projet cible et cliquez sur Permission Configurations dans la colonne Actions.

    • Sélectionnez une politique de visibilité selon vos exigences de gouvernance des données :

      • Public Within Tenant : tous les membres du tenant peuvent rechercher et afficher les métadonnées de ce projet.

      • Only members in the associated workspace can search and view. : seuls les membres d'espaces de travail spécifiques peuvent accéder aux métadonnées de ce projet, garantissant ainsi l'isolation des données.

Crawler DLF par défaut

Important

Pour activer la collecte en temps réel des métadonnées DLF, vous devez accorder l'autorisation Data Reader au rôle lié au service AliyunServiceRoleForDataworksOnEmr dans la console DLF.

Le DLF Default Crawler collecte les métadonnées de Data Lake Formation (DLF) associées à votre compte.

  1. Dans la section Built-in de la page de collecte de métadonnées, repérez la carte DLF Default Crawler et cliquez sur Details pour afficher les informations de base.

  2. Basculez vers l'onglet Data Scope pour afficher la liste des catalogues DLF inclus dans le périmètre de collecte ainsi que le nombre de tables qu'ils contiennent.

    Par défaut, tous les catalogues accessibles (y compris DLF et DLF-Legacy) sont collectés.

Crawlers personnalisés

Les crawlers personnalisés vous permettent de gérer de manière centralisée les métadonnées across environnements et moteurs.

  • Pour les sources de données classiques

    Vous pouvez créer des crawlers personnalisés pour les sources de données structurées ou semi-structurées traditionnelles, telles que Hologres, StarRocks, MySQL, Oracle et CDH Hive. En configurant des tâches de collecte, le système effectue une analyse approfondie des structures physiques de bases de données et de tables à la source afin de réaliser l'extraction et la synchronisation automatisées des métadonnées, telles que les attributs de colonnes, les index et les partitions.

  • Pour les sources de données de type métadonnées (catalogue)

    Pour les métadonnées natives de format lac non gérées par DLF et déclarées manuellement, telles que Paimon Catalog, Apache Gravitino et autres sources de données de type métadonnées, vous pouvez également créer des crawlers pour une collecte directe.

Create Custom Crawler

  1. Dans la section de liste des crawlers personnalisés sur la page de collecte de métadonnées, cliquez sur Create Metadata Crawler.

  2. Sélectionner un type de collecte : sur la page de sélection du type, choisissez le type de source de données cible à collecter, par exemple Hologres ou StarRocks.

  3. Configurer les paramètres de base et le groupe de ressources :

    • Basic Configurations :

      • Select a workspace : sélectionnez l'espace de travail contenant la source de données.

      • Select Data Source : sélectionnez une source de données cible précédemment créée dans la liste déroulante. Après votre sélection, le système affiche automatiquement les détails de la source de données.

      • Name : nommez le crawler pour faciliter son identification ultérieure. Par défaut, le nom correspond à celui de la source de données.

    • Resource Group Configuration :

      • Resource Group : sélectionnez un groupe de ressources Serverless pour exécuter la tâche de collecte.

      • Test Network Connectivity : cette étape est cruciale. Cliquez sur Test Network Connectivity pour vous assurer que le groupe de ressources peut accéder à la source de données.

        Important
  4. Configurer la collecte de métadonnées :

    • Collection Scope : définissez les bases de données (database/schema) à collecter. Si la source de données est au niveau de la base de données, la base de données correspondant à la source est sélectionnée par défaut. Vous pouvez sélectionner des bases de données supplémentaires au-delà de la source de données.

      Important
      • Chaque base de données ne peut être configurée que dans un seul crawler. Si une base de données est grisée, cela signifie qu'elle est déjà collectée par un autre crawler.

      • Après réduction du périmètre de collecte, les métadonnées situées en dehors de ce périmètre ne sont plus recherchables dans Data Map.

  5. Configurer l'amélioration intelligente et le plan de collecte :

    • Amélioration intelligente (Beta) :

      • Descriptions générées par IA : lorsqu'elle est activée, cette fonctionnalité utilise les capacités des grands modèles de langage pour générer automatiquement des descriptions métier pour vos tables et colonnes après la collecte des métadonnées, améliorant considérablement la lisibilité et l'utilisabilité des métadonnées. Une fois la collecte terminée, vous pouvez consulter les informations générées par l'IA (telles que les descriptions de tables et de colonnes) sur la page des détails d'un objet table dans Data Map.

    • Collection Plan :

      • Trigger Mode : sélectionnez le mode manuel ou périodique.

        • Manuel : le crawler s'exécute uniquement lorsque vous le déclenchez manuellement. Ce mode convient aux collectes ponctuelles ou à la demande.

        • Périodique : configurez une tâche planifiée (par exemple mensuelle, quotidienne, hebdomadaire ou horaire) et le système mettra automatiquement à jour les métadonnées de manière périodique.

          Pour configurer une tâche planifiée à la minute, sélectionnez le cycle de collecte horaire et choisissez toutes les granularités en minutes pour mettre en place une tâche s'exécutant toutes les 5 minutes.
          Important

          Seules les sources de données de l'environnement de production prennent en charge la collecte périodique.

  6. Enregistrer la configuration : cliquez sur Save ou Save and Run pour finaliser la création du crawler.

Gérer les crawlers personnalisés

Une fois un crawler créé, il apparaît dans la liste des crawlers personnalisés. Vous pouvez effectuer les opérations de gestion suivantes :

  • Opérations de liste : dans la liste, vous pouvez directement Run, Stop ou Delete un crawler. Utilisez les fonctionnalités Filter et Search en haut de la page pour localiser rapidement le crawler cible.

    Important

    Après suppression d'un crawler de métadonnées, les objets de métadonnées collectés par ce crawler dans Data Map deviennent invalides. Vous ne pourrez plus rechercher ni afficher ces objets ni leurs détails. Procédez avec prudence.

  • Opérations groupées : sélectionnez plusieurs crawlers dans la liste et utilisez Batch Run ou Batch Stop en bas de la liste pour déclencher ou arrêter plusieurs tâches de collecte simultanément, améliorant ainsi l'efficacité de gestion.

  • Statut du crawler : la liste des crawlers affiche le statut actuel de chacun d'eux. Les statuts courants incluent Not Run, Waiting, Running, Successful, Failed et Manually Terminated.

    Remarque

    Si la source de données associée à un crawler a été dissociée ou devient invalide, le crawler passe à l'état frozen. Un crawler gelé ne peut pas être exécuté et ne peut être que supprimé.

  • Afficher les détails et les journaux : cliquez sur le nom du crawler cible pour accéder à sa page de détails.

    • Basic Information : affichez tous les éléments de configuration du crawler.

    • Data Scope : affichez ou Modify Data Scope.

      Si aucune collecte n'a été effectuée, le nombre de tables et l'heure de la dernière mise à jour restent vides.
      Les sources de données suivantes ne prennent pas en charge la modification du périmètre : EMR Hive, CDH Hive, Lindorm, ElasticSearch, OTS, MongoDB et AnalyticDB for Spark dans AnalyticDB MySQL.
    • Run Logs : suivez l'historique d'exécution de chaque tâche de collecte. Vous pouvez consulter l'heure de début, la durée, le statut et le volume de données collectées pour chaque tâche. En cas d'échec d'une tâche, cliquer sur View Logs constitue le point d'entrée principal pour identifier et résoudre les problèmes.

  • Déclencher manuellement la collecte : dans le coin supérieur droit de la page de détails, cliquez sur le bouton Collect Metadata pour déclencher immédiatement une tâche de collecte. Cette option est utile lorsque vous souhaitez voir une table nouvellement créée dans Data Map sans délai.

Étapes suivantes

Une fois les métadonnées collectées avec succès, vous pouvez tirer pleinement parti des diverses fonctionnalités de Data Map :

  • Recherchez vos tables collectées dans Data Map et consultez leurs détails, les informations sur les colonnes, les partitions ainsi qu'un aperçu des données. Pour plus d'informations, consultez la section Afficher les détails d'une table.

  • Analysez la lignée amont et aval d'une table pour comprendre le flux complet de traitement des données. Pour plus d'informations, consultez la section Lignée des données.

  • Ajoutez des actifs à une Data Collection pour organiser et gérer vos données d'un point de vue métier. Pour plus d'informations, consultez la section Créer une Data Collection.

FAQ

Annexe : Périmètre de collecte et actualité

Source de données

Data Source Type

Collection Mode

Granularité de collecte

Actualité de la mise à jour des métadonnées

Table/Colonne

Partition

Lignée

MaxCompute

Collecte automatique par le système par défaut

Instance

Projets réguliers : Temps réel

Projets externes : T+1

Régions de Chine continentale : Temps réel

Régions internationales : T+1

Temps réel

Data Lake Formation (DLF)

Instance

Temps réel

Important

Pour activer la collecte en temps réel, vous devez accorder l'autorisation Data Reader au rôle lié au service AliyunServiceRoleForDataworksOnEmr dans la console DLF. Pour plus d'informations, consultez la section Crawler DLF par défaut ci-dessus.

Temps réel

La lignée est prise en charge pour les métadonnées DLF des moteurs Serverless Spark, Serverless StarRocks, Serverless Flink et EMR Impala. Les autres moteurs ne sont pas pris en charge.

Important

Pour les clusters EMR, vous devez activer EMR_HOOK.

Pour afficher la lignée des tâches EMR Impala, vous devez activer la journalisation de la lignée dans la configuration Impala du cluster EMR. Cette fonctionnalité n'est prise en charge que pour les clusters EMR DataLake et est actuellement en phase de déploiement progressif. Contactez le support technique d'Alibaba Cloud pour activer cette fonctionnalité avant utilisation. Pour les détails de configuration, consultez Lignée des données.

Hologres

Créer un crawler manuellement

Base de données

Dépend du cycle de collecte

Non pris en charge

Temps réel

EMR Hive

Instance

Dépend du cycle de collecte

Dépend du cycle de collecte

Temps réel

Important

Vous devez activer EMR_HOOK pour le cluster.

Pour afficher la lignée des tâches EMR Impala, vous devez activer la journalisation de la lignée dans la configuration Impala du cluster EMR. Cette fonctionnalité n'est prise en charge que pour les clusters EMR DataLake et est actuellement en phase de déploiement progressif. Contactez le support technique d'Alibaba Cloud pour activer cette fonctionnalité avant utilisation. Pour les détails de configuration, consultez Lignée des données.

CDH Hive

Instance

Dépend du cycle de collecte

Temps réel

Temps réel

StarRocks

Base de données

  • Mode instance : Temps réel.

  • Mode chaîne de connexion : Dépend du cycle de collecte.

Non pris en charge

Temps réel

Important

Seul le mode instance prend en charge la collecte de la lignée. Le mode chaîne de connexion ne prend pas en charge la collecte de la lignée.

AnalyticDB for MySQL

Base de données

Dépend du cycle de collecte

Non pris en charge

Temps réel

Remarque

Vous devez soumettre un ticket pour activer la fonctionnalité de lignée des données pour l'instance AnalyticDB for MySQL.

AnalyticDB for Spark

Instance

Temps réel

Non pris en charge

Temps réel

AnalyticDB for PostgreSQL

Base de données

Dépend du cycle de collecte

Non pris en charge

Temps réel

Lindorm

Instance

Dépend du cycle de collecte

Non pris en charge

Temps réel

OTS

Instance

Dépend du cycle de collecte

Non pris en charge

Non pris en charge

MongoDB

Instance

Dépend du cycle de collecte

Non pris en charge

Non pris en charge

ElasticSearch

Instance

Dépend du cycle de collecte

Non pris en charge

Mise à jour T+1

Paimon Catalog

Catalogue

Dépend du cycle de collecte

Dépend du cycle de collecte

Non pris en charge

Apache Gravitino

Catalogue

Dépend du cycle de collecte

Dépend du cycle de collecte

Non pris en charge

Autres types de sources de données (MySQL, PostgreSQL, SQL Server, Oracle, ClickHouse, SelectDB, OceanBase, etc.)

Base de données

Dépend du cycle de collecte

Non pris en charge

Non pris en charge

Remarque
  • « Dépend du cycle de collecte » dans le tableau signifie que les métadonnées sont mises à jour périodiquement en fonction du plan de collecte que vous avez configuré pour le crawler (par exemple mensuel, quotidien, hebdomadaire ou horaire).

  • AnalyticDB for Spark et AnalyticDB for MySQL partagent le même point d'entrée pour la collecte de métadonnées.

Code de tâche

Data Map prend en charge la recherche de code de tâche et la navigation rapide. La section suivante décrit le périmètre du code searchable.

Source du code

Périmètre de collecte

Méthode de déclenchement de la collecte

Data Studio

Data Studio - Créer un nœud et modifier le code

Collecte automatique

Legacy Data Studio

Legacy Data Studio - Créer un nœud et modifier le code

Data Analysis

Data Analysis - Créer une requête SQL et modifier le code

Data Service

Data Service - Créer un service API Data Push

Actifs API

Data Map permet d'afficher les métadonnées des API Data Service, comme décrit ci-dessous :

API Type

Périmètre de collecte

Méthode de déclenchement de la collecte

Génération d'API (mode assistant)

Data Service - Créer une API en mode assistant

Collecte automatique

Génération d'API (mode script)

Data Service - Créer une API en mode script

Enregistrement d'API

Data Service - Enregistrer une API

Orchestration d'API

Data Service - Créer une orchestration d'API

Actifs IA

Data Map permet d'afficher et de gérer les actifs IA, et fournit une lignée des actifs IA pour suivre l'origine, l'utilisation et l'évolution des données et des modèles. La section suivante décrit la prise en charge de chaque type d'actif IA.

Type d'actif

Périmètre de collecte

Méthode de déclenchement de la collecte

Jeu de données

  • PAI - Créer un jeu de données/Enregistrer un jeu de données

  • DataWorks - Créer un jeu de données

Collecte automatique

Modèle IA

PAI - Tâche d'entraînement de modèle/Enregistrer un modèle/Déployer un service de modèle

Tâche algorithmique

PAI - Tâche d'entraînement/Tâche de workflow/Tâche d'entraînement distribué

Service de modèle

PAI - Déployer un service de modèle (déploiement EAS)

Workspace

Data Map permet d'afficher les métadonnées de l'espace de travail, comme décrit ci-dessous :

Projet

Collection Mode

Méthode de déclenchement de la collecte

Espace de travail

DataWorks - Créer un espace de travail

Collecte automatique