Associez votre cluster E-MapReduce (EMR) à DataWorks en tant que ressource de calcul EMR pour activer la synchronisation des données, le développement et la gestion des tâches EMR.
Prérequis
Un espace de travail DataWorks est créé, et l'utilisateur RAM qui effectue l'opération est ajouté à l'espace de travail avec le rôle d'administrateur de l'espace de travail.
-
-
Types de clusters pris en charge :
-
Vous pouvez associer cette ressource de calcul uniquement à un espace de travail qui utilise Use Data Studio (New Version).
RemarquePour les espaces de travail qui n'utilisent pas Use Use Data Studio (New Version), vous pouvez associer la ressource dans Clusters. Pour plus d'informations, consultez la rubrique Associer une ressource de calcul EMR (version héritée).
-
-
Un groupe de ressources est associé à l'espace de travail et la connectivité réseau est établie.
Si vous utilisez un groupe de ressources serverless, assurez-vous que la ressource de calcul EMR peut se connecter au groupe de ressources serverless.
Si vous utilisez un groupe de ressources exclusif hérité, assurez-vous que la ressource de calcul EMR peut se connecter au groupe de ressources exclusif pour la planification correspondant au cas d'utilisation.
Limites
-
Limites du produit :
-
Pour les clusters EMR avec l'authentification Kerberos activée, le groupe de sécurité doit autoriser le trafic UDP entrant depuis le bloc CIDR du vSwitch associé au groupe de ressources.
RemarqueCliquez sur l'icône
située à côté de Cluster Security Group dans la section Basic information du cluster EMR pour accéder à l'onglet Security Group Details. Cliquez sur Access Rule > Inbound, sélectionnez Added Manually, définissez Protocol Type sur Custom UDP. Pour la Port Range, vérifiez le port KDC dans le fichier /etc/krb5.confsur le cluster EMR. Définissez Authorized object sur le bloc CIDR du vSwitch associé au groupe de ressources. -
Pour gérer les métadonnées dans DataWorks pour les clusters DataLake ou personnalisés, configurez EMR-HOOK côté cluster ou lors de la configuration des paramètres Spark. Sans EMR-HOOK, DataWorks ne peut pas afficher les métadonnées en temps réel, générer des journaux d'audit ou afficher la lignée, et les tâches de gouvernance liées à EMR ne peuvent pas s'exécuter. Seuls les services EMR Hive et EMR Spark SQL prennent en charge EMR-HOOK. Pour plus d'informations, consultez les rubriques Configurer EMR-HOOK pour Hive et Configurer EMR-HOOK pour Spark SQL.
RemarqueLa configuration Configurer EMR-HOOK pour Hive peut être effectuée dans la console E-MapReduce. Une fois la configuration terminée, vous n'avez pas besoin de réinitialiser le groupe de ressources.
-
La configuration Configurer EMR-HOOK pour Spark SQL peut être réalisée de deux manières :
Configurez-la dans la console E-MapReduce. Cela nécessite la réinitialisation du groupe de ressources.
Configurez-la dans la ressource de calcul en définissant les paramètres de propriété Spark. Cela ne nécessite pas la réinitialisation du groupe de ressources.
-
Limites régionales : Chine (Hangzhou), Chine (Shanghai), Chine (Pékin), Chine (Shenzhen), Chine (Chengdu), Chine (Hong Kong), Japon (Tokyo), Singapour, Malaisie (Kuala Lumpur), Indonésie (Jakarta), Allemagne (Francfort), Royaume-Uni (Londres), États-Unis (Silicon Valley) et États-Unis (Virginie).
-
Limites d'autorisation :
Opérateur
Autorisations requises
Compte Alibaba Cloud
Aucune autorisation supplémentaire n'est requise.
Utilisateur RAM ou rôle RAM
Seuls les membres de l'espace de travail auxquels est attribué le rôle operator ou workspace administrator, ou qui disposent de l'autorisation
AliyunDataWorksFullAccess, peuvent créer des ressources de calcul. Pour plus d'informations, consultez la rubrique Attribuer le rôle d'administrateur d'espace de travail à un utilisateur.
Notes
-
DataWorks prend en charge les versions EMR suivantes pour les clusters Hadoop (lac de données hérité) :
EMR-3.38.2,EMR-3.38.3,EMR-4.9.0,EMR-5.6.0,EMR-3.26.3,EMR-3.27.2,EMR-3.29.0,EMR-3.32.0,EMR-3.35.0,EMR-4.3.0,EMR-4.4.1,EMR-4.5.0,EMR-4.5.1,EMR-4.6.0,EMR-4.8.0,EMR-5.2.1etEMR-5.4.3. L'utilisation de clusters Hadoop (lac de données hérité) n'est plus recommandée. Migrez vers des clusters DataLake dès que possible. Pour plus d'informations, consultez la rubrique Migrer d'un cluster Hadoop vers un cluster DataLake.
Accéder à la page de liste des ressources de calcul
Connectez-vous à la console DataWorks. Dans le volet de navigation de gauche, basculez vers la région cible, puis cliquez sur . Sélectionnez votre espace de travail dans la liste déroulante et cliquez sur Go to Management Center.
Dans le volet de navigation de gauche, cliquez sur Computing Resources pour ouvrir la page de liste des ressources de calcul.
Associer une ressource de calcul EMR
Sur la page de liste des ressources de calcul, configurez et associez la ressource de calcul EMR.
-
Sélectionnez le type de ressource de calcul à associer.
Cliquez sur Associate Computing Resources pour accéder à la page Associate Computing Resources.
Sur la page Associate Computing Resources, définissez le type de ressource de calcul sur EMR afin d'accéder à la page de configuration Associate EMR Computing Resource.
-
Configurez la ressource de calcul EMR.
Sur la page de configuration Associate EMR Computing Resource, configurez les paramètres suivants.
Parameter
Description
Alibaba Cloud Account to Which Cluster Belongs
Vous pouvez sélectionner Current Alibaba Cloud Account ou Another Alibaba Cloud Account.
RemarqueLorsque vous sélectionnez Another Alibaba Cloud Account, suivez les instructions de la rubrique Utiliser un cluster EMR entre plusieurs comptes Alibaba Cloud pour autoriser les comptes concernés, puis configurez les paramètres requis selon les instructions.
Cluster Type
Sélectionnez le type de cluster en fonction de vos besoins métier.
RemarqueTypes de clusters pris en charge :
Cluster
Sélectionnez le cluster EMR que vous souhaitez utiliser sous le type de cluster correspondant.
Default Access Identity
-
Environnement de développement : vous pouvez utiliser le compte de cluster
hadoopou le compte de cluster mappé à l'exécuteur de tâche. -
Environnement de production : vous pouvez utiliser le compte de cluster
hadoopou le compte de cluster mappé au propriétaire de la tâche, au compte Alibaba Cloud ou à l'utilisateur RAM.RemarqueLorsque l'identité d'accès par défaut est définie sur le compte de cluster mappé au propriétaire de la tâche, au compte Alibaba Cloud ou à l'utilisateur RAM, consultez la rubrique Configurer le mappage des comptes entre DataWorks et EMR pour configurer le mappage entre les membres du locataire DataWorks et les comptes de cluster EMR. Les tâches EMR s'exécutent sous le compte de cluster mappé. Si aucun mappage n'est configuré, DataWorks gère la situation comme suit :
-
Si un utilisateur RAM (sous-compte) exécute la tâche : DataWorks utilise par défaut le compte système du cluster EMR portant le même nom que l'opérateur actuel. Si l'authentification LDAP ou Kerberos est activée pour le cluster, la tâche échoue.
-
Si un compte Alibaba Cloud exécute la tâche : la tâche DataWorks renvoie une erreur.
-
Pass Proxy User Information
Indique si les informations de l'utilisateur proxy (Proxy User) sont transmises lors de l'exécution des tâches sur le cluster EMR.
RemarqueLorsque LDAP, Kerberos ou une autre méthode d'authentification est activée, le cluster émet un identifiant d'authentification pour chaque utilisateur standard. Vous pouvez utiliser un super-utilisateur (utilisateur réel) pour agir en tant que proxy des utilisateurs standards (utilisateurs proxy) lors de l'authentification, permettant ainsi aux utilisateurs proxy d'accéder au cluster avec les identifiants du super-utilisateur. Il vous suffit d'ajouter l'utilisateur en tant qu'utilisateur proxy.
-
Transmettre : lorsque les tâches sont exécutées sur le cluster EMR, les autorisations d'accès aux données sont vérifiées et contrôlées en fonction de l'utilisateur proxy.
-
Data Studio et Data Analysis : le nom du compte Alibaba Cloud de l'exécuteur de la tâche est transmis dynamiquement en tant qu'informations de l'utilisateur proxy.
-
Operation Center : le nom du compte Alibaba Cloud de l'identité d'accès par défaut configurée lors de l'enregistrement du cluster est transmis en tant qu'informations fixes de l'utilisateur proxy.
-
-
Ne pas transmettre : lorsque les tâches sont exécutées sur le cluster EMR, les autorisations d'accès aux données sont vérifiées et contrôlées en fonction de la méthode d'authentification du compte configurée lors de l'enregistrement du cluster.
La transmission des informations de l'utilisateur proxy varie selon le type de tâche EMR :
-
Tâches EMR Kyuubi : les informations sont transmises via l'élément de configuration
hive.server2.proxy.user. -
Tâches EMR Spark et tâches EMR Spark SQL en mode non JDBC : les informations sont transmises via l'élément de configuration
-proxy-user.
Fichiers de configuration
Lorsque le type de cluster est défini sur HADOOP, obtenez les fichiers de configuration depuis la console EMR. Pour plus d'informations, consultez la rubrique Exporter les fichiers de configuration du cluster EMR. Après l'exportation, renommez les fichiers comme indiqué sur la page de configuration.
Vous pouvez également vous connecter au cluster EMR et obtenir les fichiers de configuration à partir des chemins suivants.
/etc/ecm/hadoop-conf/core-site.xml /etc/ecm/hadoop-conf/hdfs-site.xml /etc/ecm/hadoop-conf/mapred-site.xml /etc/ecm/hadoop-conf/yarn-site.xml /etc/ecm/hive-conf/hive-site.xml /etc/ecm/spark-conf/spark-defaults.conf /etc/ecm/spark-conf/spark-env.shComputing Resource Instance Name
Personnalisez le nom de l'instance de ressource de calcul. Lors de l'exécution d'une tâche, vous pouvez sélectionner la ressource de calcul par son nom.
-
Cliquez sur Confirm pour terminer la configuration de la ressource de calcul EMR.
Initialisation du groupe de ressources
Après avoir enregistré un cluster pour la première fois, modifié la configuration des services du cluster ou mis à niveau la version d'un composant (par exemple, en modifiant le fichier core-site.xml), initialisez le groupe de ressources afin de garantir qu'il puisse accéder au cluster EMR via la configuration de la connectivité réseau.
Sur la page de liste Computing Resources, localisez la ressource de calcul EMR que vous avez créée. Cliquez sur Initialize Resource Group dans le coin supérieur droit.
Cliquez sur Initialize à côté du groupe de ressources souhaité. Une fois l'initialisation terminée, cliquez sur Determine.
(Facultatif) Configurer les files d'attente de ressources YARN
Sur la page de liste Computing Resources, localisez le cluster EMR associé. Dans l'onglet YARN Resource Queue, cliquez sur Edit YARN Resource Queue pour configurer les files d'attente de ressources YARN pour les tâches des différents modules.
(Facultatif) Configurer les paramètres Spark
Configurez des paramètres de propriété Spark dédiés pour les tâches des différents modules.
Sur la page de liste Computing Resources, localisez le cluster EMR associé.
Cliquez sur l'onglet Spark-related Parameter, puis cliquez sur Edit Spark Parameters pour accéder à la page de modification des paramètres Spark du cluster EMR.
Cliquez sur Add sous un module, saisissez le Spark Property Name et la Spark Property Value correspondante pour configurer les paramètres de propriété Spark pour les tâches des différents modules.
Étapes suivantes
Configurer les informations de connexion Kyuubi : définissez un compte et un mot de passe personnalisés pour vous connecter à Kyuubi et exécuter des tâches.
Une fois la ressource de calcul EMR configurée, utilisez les nœuds liés à EMR dans Data Studio pour le développement de données.