Tous les produits
Search
Centre de documentation

E-MapReduce:Hive extension: Record data lineage and access history

Dernière mise à jour :Aug 20, 2026

Par défaut, les clusters E-MapReduce intègrent EMR-HOOK au service Hive. EMR-HOOK collecte les informations SQL issues des jobs, telles que la lignée des données et la fréquence d'accès. Vous pouvez utiliser EMR-HOOK avec Data Lake Formation (DLF) pour suivre les statistiques d'accès aux tables et aux partitions. Il est également possible de gérer la lignée des données via DataWorks. Cette rubrique explique comment configurer EMR-HOOK pour le service Hive.

Prérequis

Créez un cluster DataLake ou un cluster personnalisé en sélectionnant le service Hive. Pour plus d'informations, consultez la section Créer un cluster.

Limites

  • EMR-HOOK ne prend pas en charge la collecte des informations SQL provenant des jobs dans un environnement de passerelle déployé manuellement avec EMR-CLI.

  • Dans les versions EMR antérieures à 5.16.0 et 3.50.0, les paramètres hive.exec.post.hooks (pour Hive) et spark.sql.queryExecutionListeners (pour Spark) ne sont pas synchronisés sur les nœuds de passerelle. À partir des versions EMR 5.16.0 et 3.50.0, ces paramètres sont synchronisés sur les nœuds de passerelle. Ces versions introduisent également le paramètre hive_aux_jars_path_gateway_only, qui permet d'utiliser indépendamment des fichiers JAR d'extension personnalisés sur les nœuds de passerelle.

Notes d'utilisation

  • EMR-HOOK est activé par défaut dans les versions EMR antérieures à 5.14.0 et 3.48.0.

    Pour les clusters personnalisés sous EMR 3.44 où EMR-HOOK n'est pas activé par défaut, vous pouvez l'activer manuellement. Pour plus d'informations, reportez-vous à la section FAQ.

  • EMR-HOOK est désactivé par défaut dans les versions EMR 5.14.0 et ultérieures, ainsi que 3.48.0 et ultérieures. Vous devez l'activer manuellement.

Procédure

  1. Accédez à la page des services du cluster.

    1. Connectez-vous à la console E-MapReduce.

    2. Dans la barre de navigation supérieure, sélectionnez une région et un groupe de ressources.

    3. Sur la page EMR on ECS, localisez votre cluster et cliquez sur Services dans la colonne Actions.

  2. Configurez EMR-HOOK.

    1. Sur la page Services, dans la section du service Hive, cliquez sur Configure.

    2. Sur la page Configure, ajoutez ou modifiez les paramètres suivants.

      Onglet

      Paramètre

      Description

      hive-site.xml

      hive.exec.post.hooks

      Spécifie le hook qui écoute les instructions SQL du service Hive. Ce hook collecte les informations relatives à la lignée des données et à la fréquence d'accès.

      • Pour activer EMR-HOOK, définissez ce paramètre sur com.aliyun.emr.meta.hive.hook.LineageLoggerHook.

      • Pour désactiver EMR-HOOK, laissez ce paramètre vide.

      dlf.emrhook.webtracking

      Indique si le rapport de fréquence d'accès est activé. Valeurs possibles :

      • true : Activé.

      • false : Désactivé.

      hivemetastore-site.xml

      hive.metastore.event.listeners

      Spécifie l'écouteur des événements liés aux modifications des métadonnées Hive. Cet écouteur collecte les informations relatives à la lignée des données.

      • Pour activer EMR-HOOK, définissez ce paramètre sur com.aliyun.emr.meta.hive.listener.MetaStoreListener.

      • Pour désactiver EMR-HOOK, laissez ce paramètre vide.

      hive.metastore.pre.event.listeners

      Spécifie l'écouteur des événements survenant avant les modifications des métadonnées Hive. Cet écouteur collecte les informations relatives à la lignée des données.

      • Pour activer EMR-HOOK, définissez ce paramètre sur com.aliyun.emr.meta.hive.listener.MetaStorePreAuditListener.

      • Pour désactiver EMR-HOOK, laissez ce paramètre vide.

      Remarque

      Si vous désactivez EMR-HOOK, la page Data Overview des tables dans la console Data Lake Formation (DLF) n'affichera plus les données pour Access Count (Today), Access Count (Last 7 Days) et Access Count (Last 30 Days).

    3. Enregistrez la configuration.

      1. Sur la page Configure, cliquez sur Save.

      2. Dans la boîte de dialogue qui s'affiche, saisissez un Execution Reason et cliquez sur Save.

  3. Redémarrez Hive.

    1. Sur la page Configure, choisissez More > Restart.

    2. Dans la boîte de dialogue qui s'affiche, saisissez un Execution Reason et cliquez sur OK.

    3. Dans la boîte de dialogue Confirm, cliquez sur OK.

  4. Consultez l'aperçu des données et la lignée des données.

FAQ

Comment activer EMR-HOOK pour un cluster personnalisé sous EMR-3,44 ?

Dans l'onglet Configure du service Hive, modifiez les paramètres suivants. Suivez ensuite les instructions pour appliquer les modifications.

Onglet

Paramètre

Modification

hive-site.xml

hive_aux_jars_path

Ajoutez ,/opt/apps/EMRHOOK/emrhook-1.1.5/hive-hook-1.1.5-hive23.jar à la valeur du paramètre.

hive-env.sh

hive_aux_jars_path

Rubriques connexes

Pour savoir comment configurer EMR-HOOK pour le service Spark, consultez la section SparkSQL : Utiliser une extension pour enregistrer la lignée des données et l'historique d'accès.