Tous les produits
Search
Centre de documentation

DataWorks:Enregistrer un cluster EMR inter-comptes

Dernière mise à jour :Aug 10, 2026

Lieez un cluster EMR appartenant à un autre compte Alibaba Cloud à DataWorks en utilisant un rôle RAM. Cette rubrique explique comment le compte A peut lier un cluster EMR du compte B afin d'accorder un accès inter-comptes aux données EMR.

Prérequis

  • Vous avez créé deux comptes Alibaba Cloud, désignés ci-après comme le compte A et le compte B. Pour plus d'informations, consultez la rubrique Inscrire un compte.

    • Compte Alibaba Cloud A : le compte utilisé pour lier le cluster EMR du compte B dans DataWorks.

    • Compte Alibaba Cloud B : le compte propriétaire du cluster EMR.

  • Vous avez créé un cluster EMR dans le compte Alibaba Cloud B. Pour plus d'informations, consultez la rubrique Créer un cluster.

Limites

  • La liaison inter-comptes est prise en charge uniquement pour les clusters Hadoop qui n'utilisent pas DLF pour la gestion des métadonnées.

  • L'authentification Kerberos n'est pas prise en charge.

  • Pour les tâches Spark SQL, seule la lignée des tables est prise en charge. La lignée des champs n'est pas disponible.

Compte B: Créer un rôle RAM et accorder l'accès

Dans le compte B, créez un rôle RAM doté d'une politique d'approbation autorisant le compte A à assumer ce rôle. Cela permet au compte A d'accéder aux ressources EMR du compte B.

  1. Créez un rôle RAM.

    Connectez-vous à la console RAM avec le compte B pour créer un rôle RAM. Spécifiez le compte A comme compte de confiance afin de lui permettre d'assumer le rôle et d'accéder aux ressources autorisées. Pour des instructions détaillées, consultez la rubrique Créer un rôle RAM pour un compte Alibaba Cloud de confiance.

    Voici les principaux paramètres à configurer :

    • Nom du rôle RAM : saisissez EMRRole.

    • Sélectionner un compte Alibaba Cloud de confiance : sélectionnez Autre compte Alibaba Cloud. Dans le champ ID du compte, saisissez l'ID du compte A. Pour trouver cet ID, connectez-vous à la console avec le compte A et survolez l'avatar de profil dans la barre de navigation supérieure.

    Une fois la configuration terminée, le compte A peut assumer le rôle EMRRole pour accéder aux ressources autorisées.

  2. Modifiez la politique d'approbation.

    Sur la page des détails du rôle EMRRole, mettez à jour la politique d'approbation pour accorder au compte A l'accès au cluster EMR du compte B. Pour plus d'informations, consultez la rubrique Modifier la politique d'approbation d'un rôle RAM. Utilisez la politique suivante :

    {
      "Statement": [
        {
          "Action": "sts:AssumeRole",
          "Effect": "Allow",
          "Principal": {
            "Service": [
              "<UID of Account A>@emr.dataworks.aliyuncs.com"
            ]
          }
        }
      ],
      "Version": "1"
    }
    Remarque

    Remplacez <UID of Account A> par l'UID du compte Alibaba Cloud A.

  3. Accordez l'autorisation AliyunDataWorksAccessingEMRReadOnlyPolicy au rôle EMRRole.

    Dans la console RAM, accédez à la page des détails du rôle EMRRole. Sous l'onglet Permissions, cliquez sur Grant Permission. Recherchez et sélectionnez la stratégie AliyunDataWorksAccessingEMRReadOnlyPolicy, puis cliquez sur OK.

Compte A: Enregistrer le cluster inter-comptes

Remarque

À cette étape, vous allez lier le cluster EMR du compte B à un espace de travail DataWorks du compte A. Avant de commencer, vous devez obtenir l'UID du compte B.

  1. Connectez-vous à la console DataWorks. Dans la région cible, cliquez sur More > Management Center dans le volet de navigation de gauche. Sélectionnez un espace de travail dans la liste déroulante et cliquez sur Go to Management Center.

  2. Dans le volet de navigation de gauche, cliquez sur Computing Resources.

  3. Configurez les informations du cluster.

    1. Configurez les informations de base.

      Les espaces de travail en mode standard nécessitent une liaison distincte des ressources de calcul pour les environnements de développement et de production. Suivez les instructions à l'écran pour configurer le cluster. Pour plus d'informations sur les modes d'espace de travail, consultez la rubrique Différences entre les modes d'espace de travail.

      Pour Cloud Account for Cluster, sélectionnez Other Alibaba Cloud Account. Téléchargez les sept fichiers de configuration (core-site.xml, hdfs-site.xml, mapred-site.xml, yarn-site.xml, hive-site.xml, spark-defaults.conf et spark-env.sh). Définissez l'Default Access Identity et activez l'option Pass Proxy User Information. Saisissez un Compute Resource Instance Name et une Description, puis cliquez sur OK.

      Les paramètres clés sont décrits ci-dessous :

      • UID of Other Account : saisissez l'UID du compte B, propriétaire du cluster EMR. Vous devez obtenir cet UID auprès du titulaire du compte B.

      • RAM Role of Other Account : saisissez le nom du rôle RAM que vous avez créé dans le compte B. Dans cet exemple, le nom est EMRRole.

      • EMR Cluster of Other Account : sélectionnez le cluster EMR que vous souhaitez lier à DataWorks. Vous ne pouvez sélectionner que des clusters Hadoop de version 3.38.3 ou 3.38.2 qui n'utilisent pas DLF pour la gestion des métadonnées.

      Pour plus d'informations sur la liaison d'un cluster, consultez la rubrique DataStudio : Lier des ressources de calcul EMR.

    2. Initialisation du groupe de ressources

      Initialisez le groupe de ressources lorsque vous liez des ressources de calcul EMR pour la première fois, que vous modifiez les configurations des services du cluster ou que vous mettez à niveau des composants (par exemple, en modifiant core-site.xml). Ce processus garantit que le groupe de ressources peut accéder au cluster EMR après avoir configuré la connectivité réseau.

      Important
      • Si l'initialisation échoue, utilisez l'outil de diagnostic de connectivité pour identifier la cause du problème.

      • L'initialisation peut entraîner l'échec des tâches en cours d'exécution. Sauf si une réinitialisation immédiate est nécessaire, par exemple pour éviter des échecs massifs de tâches suite à une modification de configuration, nous vous recommandons d'initialiser le groupe de ressources pendant les heures creuses.

Étapes suivantes

Après avoir enregistré le cluster dans DataWorks, vous pouvez effectuer les opérations suivantes :

  • Configurer le mappage d'identité du cluster : si l'identité d'accès par défaut du cluster EMR n'est pas un compte Hadoop, configurez le mappage d'identité du cluster. Cela empêche les utilisateurs RAM d'accéder à des ressources DataWorks non autorisées.

  • Utilisez Data Integration pour exécuter des tâches de synchronisation de données sur le cluster. Pour plus d'informations, consultez la rubrique Data Integration.

  • Accédez à Operation Center et Data Map pour afficher plus de détails sur le cluster. Pour plus d'informations, consultez les rubriques Operation Center et Data Map.