Par défaut, les clusters E-MapReduce intègrent EMR-HOOK au service Hive. EMR-HOOK collecte les informations SQL issues des jobs, telles que la lignée des données et la fréquence d'accès. Vous pouvez utiliser EMR-HOOK avec Data Lake Formation (DLF) pour suivre les statistiques d'accès aux tables et aux partitions. Il est également possible de gérer la lignée des données via DataWorks. Cette rubrique explique comment configurer EMR-HOOK pour le service Hive.
Prérequis
Créez un cluster DataLake ou un cluster personnalisé en sélectionnant le service Hive. Pour plus d'informations, consultez la section Créer un cluster.
Limites
EMR-HOOK ne prend pas en charge la collecte des informations SQL provenant des jobs dans un environnement de passerelle déployé manuellement avec EMR-CLI.
Dans les versions EMR antérieures à 5.16.0 et 3.50.0, les paramètres hive.exec.post.hooks (pour Hive) et spark.sql.queryExecutionListeners (pour Spark) ne sont pas synchronisés sur les nœuds de passerelle. À partir des versions EMR 5.16.0 et 3.50.0, ces paramètres sont synchronisés sur les nœuds de passerelle. Ces versions introduisent également le paramètre hive_aux_jars_path_gateway_only, qui permet d'utiliser indépendamment des fichiers JAR d'extension personnalisés sur les nœuds de passerelle.
Notes d'utilisation
-
EMR-HOOK est activé par défaut dans les versions EMR antérieures à 5.14.0 et 3.48.0.
Pour les clusters personnalisés sous EMR 3.44 où EMR-HOOK n'est pas activé par défaut, vous pouvez l'activer manuellement. Pour plus d'informations, reportez-vous à la section FAQ.
EMR-HOOK est désactivé par défaut dans les versions EMR 5.14.0 et ultérieures, ainsi que 3.48.0 et ultérieures. Vous devez l'activer manuellement.
Procédure
-
Accédez à la page des services du cluster.
Connectez-vous à la console E-MapReduce.
Dans la barre de navigation supérieure, sélectionnez une région et un groupe de ressources.
Sur la page EMR on ECS, localisez votre cluster et cliquez sur Services dans la colonne Actions.
-
Configurez EMR-HOOK.
Sur la page Services, dans la section du service Hive, cliquez sur Configure.
-
Sur la page Configure, ajoutez ou modifiez les paramètres suivants.
Onglet
Paramètre
Description
hive-site.xml
hive.exec.post.hooks
Spécifie le hook qui écoute les instructions SQL du service Hive. Ce hook collecte les informations relatives à la lignée des données et à la fréquence d'accès.
-
Pour activer EMR-HOOK, définissez ce paramètre sur
com.aliyun.emr.meta.hive.hook.LineageLoggerHook. -
Pour désactiver EMR-HOOK, laissez ce paramètre vide.
dlf.emrhook.webtracking
Indique si le rapport de fréquence d'accès est activé. Valeurs possibles :
-
true : Activé.
-
false : Désactivé.
hivemetastore-site.xml
hive.metastore.event.listeners
Spécifie l'écouteur des événements liés aux modifications des métadonnées Hive. Cet écouteur collecte les informations relatives à la lignée des données.
-
Pour activer EMR-HOOK, définissez ce paramètre sur
com.aliyun.emr.meta.hive.listener.MetaStoreListener. -
Pour désactiver EMR-HOOK, laissez ce paramètre vide.
hive.metastore.pre.event.listeners
Spécifie l'écouteur des événements survenant avant les modifications des métadonnées Hive. Cet écouteur collecte les informations relatives à la lignée des données.
-
Pour activer EMR-HOOK, définissez ce paramètre sur
com.aliyun.emr.meta.hive.listener.MetaStorePreAuditListener. -
Pour désactiver EMR-HOOK, laissez ce paramètre vide.
RemarqueSi vous désactivez EMR-HOOK, la page Data Overview des tables dans la console Data Lake Formation (DLF) n'affichera plus les données pour Access Count (Today), Access Count (Last 7 Days) et Access Count (Last 30 Days).
-
-
Enregistrez la configuration.
Sur la page Configure, cliquez sur Save.
Dans la boîte de dialogue qui s'affiche, saisissez un Execution Reason et cliquez sur Save.
-
Redémarrez Hive.
Sur la page Configure, choisissez More > Restart.
Dans la boîte de dialogue qui s'affiche, saisissez un Execution Reason et cliquez sur OK.
Dans la boîte de dialogue Confirm, cliquez sur OK.
-
Consultez l'aperçu des données et la lignée des données.
Consultez l'aperçu des données dans Data Lake Formation (DLF). Pour plus d'informations, consultez la section Aperçu des données des tables de données.
Consultez la lignée des données dans DataWorks. Pour plus d'informations, consultez la section Analyse de la lignée des données.
FAQ
Rubriques connexes
Pour savoir comment configurer EMR-HOOK pour le service Spark, consultez la section SparkSQL : Utiliser une extension pour enregistrer la lignée des données et l'historique d'accès.