Le hook E-MapReduce collecte la lignée des données et la fréquence d'accès depuis les jobs SparkSQL. Utilisez Data Lake Formation (DLF) pour suivre le nombre d'accès aux tables et aux partitions, ou DataWorks pour gérer la lignée des données.
Prérequis
Un cluster DataLake ou personnalisé disposant du service Spark est requis. Pour plus d'informations, consultez la rubrique Créer un cluster.
Limites
EMR-HOOK ne prend pas en charge la collecte des informations SQL issues des jobs exécutés dans un environnement de passerelle déployé de manière personnalisée avec EMR-CLI.
Dans les versions d'EMR antérieures à 5.16.0 et 3.50.0, les paramètres hive.exec.post.hooks (pour Hive) et spark.sql.queryExecutionListeners (pour Spark) ne sont pas synchronisés sur les nœuds de passerelle. À partir des versions EMR 5.16.0 et 3.50.0, ces paramètres sont synchronisés sur les nœuds de passerelle. Ces versions introduisent également le paramètre hive_aux_jars_path_gateway_only, qui permet d'utiliser indépendamment des fichiers JAR d'extension personnalisés sur les nœuds de passerelle.
Notes d'utilisation
-
Dans les versions d'E-MapReduce antérieures à EMR-5.14.0 et EMR-3.48.0, le hook E-MapReduce est activé par défaut.
Sur les clusters personnalisés exécutant EMR-3,44, le hook E-MapReduce est désactivé par défaut ; vous pouvez l'activer manuellement. Pour plus d'informations, consultez la section FAQ.
À partir des versions EMR-5.14.0 et EMR-3.48.0 d'E-MapReduce, le hook E-MapReduce est désactivé par défaut ; vous devez l'activer manuellement.
Procédure
-
Accédez à la page Services de votre cluster.
Connectez-vous à la console E-MapReduce.
Dans la barre de navigation supérieure, sélectionnez une région et un groupe de ressources selon vos besoins.
Sur la page EMR on ECS, localisez le cluster cible et cliquez sur Services dans la colonne Services.
-
Configurez le hook E-MapReduce.
Sur la page Services, localisez le service Spark2 ou Spark3 et cliquez sur Configure.
-
Sur la page Configure, dans l'onglet correspondant, modifiez ou ajoutez les paramètres suivants pour le hook E-MapReduce.
Onglet
Paramètre
Description
spark-defaults.conf
spark.sql.queryExecutionListeners
Capture les informations SQL du service Spark pour la lignée des données et la fréquence d'accès.
-
Pour activer le hook E-MapReduce, définissez ce paramètre sur
com.aliyun.emr.meta.spark.listener.EMRQueryLogger. -
Pour désactiver le hook E-MapReduce, laissez la valeur du paramètre vide.
hive-site.xml
dlf.emrhook.webtracking
Indique s'il faut signaler la fréquence d'accès. Valeurs possibles :
-
true : activé.
-
false : désactivé.
RemarqueSi vous désactivez le hook E-MapReduce, la page Data Overview des tables de données dans la console Data Lake Formation (DLF) n'affichera plus les données pour File Visits within Last Day, File Visits within Last Seven Days et File Visits within Last 30 Days.
-
-
Enregistrez la configuration.
Sur la page Configure, cliquez sur Save.
Dans la boîte de dialogue qui s'affiche, saisissez une raison dans le champ Execution Reason et cliquez sur Save.
-
Redémarrez le service Spark.
Sur la page Configure, choisissez More > Restart.
Dans la boîte de dialogue qui s'affiche, saisissez une raison dans le champ Execution Reason et cliquez sur OK.
Dans la boîte de dialogue Confirm, cliquez sur OK.
-
Consultez l'aperçu des données et la lignée des données.
Consultez l'aperçu des données dans Data Lake Formation (DLF). Pour plus d'informations, consultez la rubrique Aperçu des données des tables de données.
Consultez la lignée des données dans DataWorks. Pour plus d'informations, consultez la rubrique Analyse de la lignée des données.
FAQ
Documents connexes
Pour configurer le hook E-MapReduce pour le service Hive, consultez la rubrique Utiliser les extensions Hive pour enregistrer la lignée des données et l'historique d'accès.