Tous les produits
Search
Centre de documentation

DataWorks:Data Studio : Associer une ressource de calcul EMR

Dernière mise à jour :Aug 25, 2026

Associez votre cluster E-MapReduce (EMR) à DataWorks en tant que ressource de calcul EMR pour activer la synchronisation des données, le développement et la gestion des tâches EMR.

Prérequis

Limites

  • Limites du produit :

    • Pour les clusters EMR avec l'authentification Kerberos activée, le groupe de sécurité doit autoriser le trafic UDP entrant depuis le bloc CIDR du vSwitch associé au groupe de ressources.

      Remarque

      Cliquez sur l'icône image située à côté de Cluster Security Group dans la section Basic information du cluster EMR pour accéder à l'onglet Security Group Details. Cliquez sur Access Rule > Inbound, sélectionnez Added Manually, définissez Protocol Type sur Custom UDP. Pour la Port Range, vérifiez le port KDC dans le fichier /etc/krb5.conf sur le cluster EMR. Définissez Authorized object sur le bloc CIDR du vSwitch associé au groupe de ressources.

    • Pour gérer les métadonnées dans DataWorks pour les clusters DataLake ou personnalisés, configurez EMR-HOOK côté cluster ou lors de la configuration des paramètres Spark. Sans EMR-HOOK, DataWorks ne peut pas afficher les métadonnées en temps réel, générer des journaux d'audit ou afficher la lignée, et les tâches de gouvernance liées à EMR ne peuvent pas s'exécuter. Seuls les services EMR Hive et EMR Spark SQL prennent en charge EMR-HOOK. Pour plus d'informations, consultez les rubriques Configurer EMR-HOOK pour Hive et Configurer EMR-HOOK pour Spark SQL.

      Remarque
  • Limites régionales : Chine (Hangzhou), Chine (Shanghai), Chine (Pékin), Chine (Shenzhen), Chine (Chengdu), Chine (Hong Kong), Japon (Tokyo), Singapour, Malaisie (Kuala Lumpur), Indonésie (Jakarta), Allemagne (Francfort), Royaume-Uni (Londres), États-Unis (Silicon Valley) et États-Unis (Virginie).

  • Limites d'autorisation :

    Opérateur

    Autorisations requises

    Compte Alibaba Cloud

    Aucune autorisation supplémentaire n'est requise.

    Utilisateur RAM ou rôle RAM

    Seuls les membres de l'espace de travail auxquels est attribué le rôle operator ou workspace administrator, ou qui disposent de l'autorisation AliyunDataWorksFullAccess, peuvent créer des ressources de calcul. Pour plus d'informations, consultez la rubrique Attribuer le rôle d'administrateur d'espace de travail à un utilisateur.

Notes

  • DataWorks prend en charge les versions EMR suivantes pour les clusters Hadoop (lac de données hérité) :

    EMR-3.38.2, EMR-3.38.3, EMR-4.9.0, EMR-5.6.0, EMR-3.26.3, EMR-3.27.2, EMR-3.29.0, EMR-3.32.0, EMR-3.35.0, EMR-4.3.0, EMR-4.4.1, EMR-4.5.0, EMR-4.5.1, EMR-4.6.0, EMR-4.8.0, EMR-5.2.1 et EMR-5.4.3.

  • L'utilisation de clusters Hadoop (lac de données hérité) n'est plus recommandée. Migrez vers des clusters DataLake dès que possible. Pour plus d'informations, consultez la rubrique Migrer d'un cluster Hadoop vers un cluster DataLake.

Accéder à la page de liste des ressources de calcul

  1. Connectez-vous à la console DataWorks. Dans le volet de navigation de gauche, basculez vers la région cible, puis cliquez sur More > Management Center. Sélectionnez votre espace de travail dans la liste déroulante et cliquez sur Go to Management Center.

  2. Dans le volet de navigation de gauche, cliquez sur Computing Resources pour ouvrir la page de liste des ressources de calcul.

Associer une ressource de calcul EMR

Sur la page de liste des ressources de calcul, configurez et associez la ressource de calcul EMR.

  1. Sélectionnez le type de ressource de calcul à associer.

    1. Cliquez sur Associate Computing Resources pour accéder à la page Associate Computing Resources.

    2. Sur la page Associate Computing Resources, définissez le type de ressource de calcul sur EMR afin d'accéder à la page de configuration Associate EMR Computing Resource.

  2. Configurez la ressource de calcul EMR.

    Sur la page de configuration Associate EMR Computing Resource, configurez les paramètres suivants.

    Parameter

    Description

    Alibaba Cloud Account to Which Cluster Belongs

    Vous pouvez sélectionner Current Alibaba Cloud Account ou Another Alibaba Cloud Account.

    Remarque

    Lorsque vous sélectionnez Another Alibaba Cloud Account, suivez les instructions de la rubrique Utiliser un cluster EMR entre plusieurs comptes Alibaba Cloud pour autoriser les comptes concernés, puis configurez les paramètres requis selon les instructions.

    Cluster Type

    Sélectionnez le type de cluster en fonction de vos besoins métier.

    Cluster

    Sélectionnez le cluster EMR que vous souhaitez utiliser sous le type de cluster correspondant.

    Default Access Identity

    • Environnement de développement : vous pouvez utiliser le compte de cluster hadoop ou le compte de cluster mappé à l'exécuteur de tâche.

    • Environnement de production : vous pouvez utiliser le compte de cluster hadoop ou le compte de cluster mappé au propriétaire de la tâche, au compte Alibaba Cloud ou à l'utilisateur RAM.

      Remarque

      Lorsque l'identité d'accès par défaut est définie sur le compte de cluster mappé au propriétaire de la tâche, au compte Alibaba Cloud ou à l'utilisateur RAM, consultez la rubrique Configurer le mappage des comptes entre DataWorks et EMR pour configurer le mappage entre les membres du locataire DataWorks et les comptes de cluster EMR. Les tâches EMR s'exécutent sous le compte de cluster mappé. Si aucun mappage n'est configuré, DataWorks gère la situation comme suit :

      • Si un utilisateur RAM (sous-compte) exécute la tâche : DataWorks utilise par défaut le compte système du cluster EMR portant le même nom que l'opérateur actuel. Si l'authentification LDAP ou Kerberos est activée pour le cluster, la tâche échoue.

      • Si un compte Alibaba Cloud exécute la tâche : la tâche DataWorks renvoie une erreur.

    Pass Proxy User Information

    Indique si les informations de l'utilisateur proxy (Proxy User) sont transmises lors de l'exécution des tâches sur le cluster EMR.

    Remarque

    Lorsque LDAP, Kerberos ou une autre méthode d'authentification est activée, le cluster émet un identifiant d'authentification pour chaque utilisateur standard. Vous pouvez utiliser un super-utilisateur (utilisateur réel) pour agir en tant que proxy des utilisateurs standards (utilisateurs proxy) lors de l'authentification, permettant ainsi aux utilisateurs proxy d'accéder au cluster avec les identifiants du super-utilisateur. Il vous suffit d'ajouter l'utilisateur en tant qu'utilisateur proxy.

    • Transmettre : lorsque les tâches sont exécutées sur le cluster EMR, les autorisations d'accès aux données sont vérifiées et contrôlées en fonction de l'utilisateur proxy.

      • Data Studio et Data Analysis : le nom du compte Alibaba Cloud de l'exécuteur de la tâche est transmis dynamiquement en tant qu'informations de l'utilisateur proxy.

      • Operation Center : le nom du compte Alibaba Cloud de l'identité d'accès par défaut configurée lors de l'enregistrement du cluster est transmis en tant qu'informations fixes de l'utilisateur proxy.

    • Ne pas transmettre : lorsque les tâches sont exécutées sur le cluster EMR, les autorisations d'accès aux données sont vérifiées et contrôlées en fonction de la méthode d'authentification du compte configurée lors de l'enregistrement du cluster.

    La transmission des informations de l'utilisateur proxy varie selon le type de tâche EMR :

    • Tâches EMR Kyuubi : les informations sont transmises via l'élément de configuration hive.server2.proxy.user.

    • Tâches EMR Spark et tâches EMR Spark SQL en mode non JDBC : les informations sont transmises via l'élément de configuration -proxy-user.

    Fichiers de configuration

    Lorsque le type de cluster est défini sur HADOOP, obtenez les fichiers de configuration depuis la console EMR. Pour plus d'informations, consultez la rubrique Exporter les fichiers de configuration du cluster EMR. Après l'exportation, renommez les fichiers comme indiqué sur la page de configuration.

    Vous pouvez également vous connecter au cluster EMR et obtenir les fichiers de configuration à partir des chemins suivants.

    /etc/ecm/hadoop-conf/core-site.xml
    /etc/ecm/hadoop-conf/hdfs-site.xml
    /etc/ecm/hadoop-conf/mapred-site.xml
    /etc/ecm/hadoop-conf/yarn-site.xml
    /etc/ecm/hive-conf/hive-site.xml
    /etc/ecm/spark-conf/spark-defaults.conf
    /etc/ecm/spark-conf/spark-env.sh

    Computing Resource Instance Name

    Personnalisez le nom de l'instance de ressource de calcul. Lors de l'exécution d'une tâche, vous pouvez sélectionner la ressource de calcul par son nom.

  3. Cliquez sur Confirm pour terminer la configuration de la ressource de calcul EMR.

Initialisation du groupe de ressources

Après avoir enregistré un cluster pour la première fois, modifié la configuration des services du cluster ou mis à niveau la version d'un composant (par exemple, en modifiant le fichier core-site.xml), initialisez le groupe de ressources afin de garantir qu'il puisse accéder au cluster EMR via la configuration de la connectivité réseau.

  1. Sur la page de liste Computing Resources, localisez la ressource de calcul EMR que vous avez créée. Cliquez sur Initialize Resource Group dans le coin supérieur droit.

  2. Cliquez sur Initialize à côté du groupe de ressources souhaité. Une fois l'initialisation terminée, cliquez sur Determine.

(Facultatif) Configurer les files d'attente de ressources YARN

Sur la page de liste Computing Resources, localisez le cluster EMR associé. Dans l'onglet YARN Resource Queue, cliquez sur Edit YARN Resource Queue pour configurer les files d'attente de ressources YARN pour les tâches des différents modules.

(Facultatif) Configurer les paramètres Spark

Configurez des paramètres de propriété Spark dédiés pour les tâches des différents modules.

  1. Sur la page de liste Computing Resources, localisez le cluster EMR associé.

  2. Cliquez sur l'onglet Spark-related Parameter, puis cliquez sur Edit Spark Parameters pour accéder à la page de modification des paramètres Spark du cluster EMR.

  3. Cliquez sur Add sous un module, saisissez le Spark Property Name et la Spark Property Value correspondante pour configurer les paramètres de propriété Spark pour les tâches des différents modules.

Étapes suivantes