Tous les produits
Search
Centre de documentation

DataWorks:Associer une ressource de calcul EMR Serverless Spark

Dernière mise à jour :Aug 25, 2026

Associez votre espace de travail EMR Serverless Spark à DataWorks en tant que ressource de calcul Serverless Spark pour développer et gérer des tâches EMR Serverless Spark dans DataWorks.

Prérequis

Limites

  • Limites régionales : Chine (Hangzhou), Chine (Shanghai), Chine (Pékin), Chine (Shenzhen), Chine (Chengdu), Chine (Hong Kong), Japon (Tokyo), Singapour, Indonésie (Jakarta), Allemagne (Francfort), États-Unis (Silicon Valley) et États-Unis (Virginie).

  • Limites d'autorisation :

    Opérateur

    Autorisations requises

    Compte Alibaba Cloud

    Aucune autorisation supplémentaire n'est requise.

    Utilisateur RAM/Rôle RAM

Accéder à la page de liste des ressources de calcul

  1. Connectez-vous à la console DataWorks. Dans le volet de navigation de gauche, basculez vers la région cible et cliquez sur More > Management Center. Sélectionnez votre espace de travail dans la liste déroulante et cliquez sur Go to Management Center.

  2. Dans le volet de navigation de gauche, cliquez sur Computing Resources pour ouvrir la page de liste des ressources de calcul.

Associer une ressource de calcul Serverless Spark

Sur la page de liste des ressources de calcul, configurez et liez une ressource de calcul Serverless Spark.

  1. Sélectionnez le type de ressource de calcul à associer.

    1. Cliquez sur Associate Computing Resources pour accéder à la page Associate Computing Resources.

    2. Sur la page Associate Computing Resources, sélectionnez Serverless Spark comme type de ressource de calcul pour ouvrir la page de configuration Associate EMR Serverless Spark Computing Resource.

  2. Configurez la ressource de calcul Serverless Spark.

    Sur la page de configuration Associate EMR Serverless Spark Computing Resource, configurez les paramètres suivants.

    Paramètre

    Description

    EMR Serverless Spark Workspace

    Sélectionnez l'espace de travail Spark à associer. Vous pouvez également cliquer sur Create dans la liste déroulante pour créer un espace de travail Spark.

    Default Engine Version

    Sélectionnez la version du moteur à utiliser.

    • Lorsque vous créez une tâche EMR Spark dans Data Studio, cette version du moteur est utilisée par défaut.

    • Pour définir différentes versions de moteur pour différentes tâches, spécifiez les versions dans les paramètres avancés de la fenêtre d'édition de la tâche Spark.

    Default Resource Queue

    Sélectionnez la file d'attente de ressources à utiliser. Vous pouvez également cliquer sur Create dans la liste déroulante pour ajouter une file d'attente.

    • Lorsque vous créez une tâche EMR Spark dans Data Studio, cette file d'attente de ressources est utilisée par défaut.

    • Pour définir différentes files d'attente de ressources pour différentes tâches, spécifiez les files d'attente dans les paramètres avancés de la fenêtre d'édition de la tâche Spark.

    Default Kyuubi Gateway

    Facultatif. La configuration de Kyuubi Gateway détermine l'exécution des tâches suivantes :

    • Si une passerelle Kyuubi est configurée :

      • Toutes les tâches associées (EMR Spark SQL/Kyuubi et Serverless Spark SQL/Kyuubi) s'exécutent via la passerelle Kyuubi.

    • Si aucune passerelle Kyuubi n'est configurée :

      • Les tâches EMR Spark SQL et Serverless Spark SQL s'exécutent à l'aide de spark-submit.

      • L'exécution des tâches EMR Kyuubi et Serverless Kyuubi échoue.

    Pour configurer une passerelle, créez une passerelle Kyuubi et un jeton dans EMR Serverless Spark console > Operation Center > Gateway > Kyuubi Gateway .

    • Si Kerberos n'est pas activé : Cliquez sur le nom de la passerelle Kyuubi pour obtenir l'URL JDBC et le jeton, puis combinez-les pour former la chaîne de connexion complète.

    • Si Kerberos est activé : Obtenez la chaîne de connexion Beeline en fonction de votre configuration Kerberos. Pour plus d'informations, consultez Utiliser Kerberos avec Kyuubi Gateway.

      # Example of a standard connection string
      jdbc:hive2://kyuubi-cn-hangzhou-internal.spark.emr.aliyuncs.com:80/;transportMode=http;httpPath=cliservice/token/<token>
      # Example of a connection string for a Kerberos-enabled cluster. Make sure to include the principal of the Kyuubi service.
      jdbc:hive2://ep-xxxxxxxxxxx.epsrv-xxxxxxxxxxx.cn-hangzhou.privatelink.aliyuncs.com:10009/;principal=kyuubi/_HOST@EMR.C-DFD43*****7C204.COM

    Default Access Identity

    L'identité utilisée pour accéder à cet espace de travail Spark depuis DataWorks.

    • Environnement de développement : Seule l'identité Executor est prise en charge.

    • Environnement de production : Les identités Alibaba Cloud Account, Alibaba Cloud RAM Sub-account et Task Owner sont prises en charge.

    Computing Resource Instance Name

    L'identifiant de la ressource de calcul. Au moment de l'exécution, les tâches utilisent ce nom pour sélectionner la ressource.

  3. Cliquez sur Confirm pour terminer la configuration de la ressource de calcul Serverless Spark.

Configurer les paramètres Spark globaux

Vous pouvez configurer les paramètres Spark au niveau de l'espace de travail pour chaque module et contrôler si les paramètres globaux ont la priorité sur les paramètres spécifiques au module. Après la configuration, les tâches utilisent les paramètres Spark spécifiés par défaut.

Portée

Méthode de configuration

Configuration globale

Au niveau de l'espace de travail, vous pouvez configurer les paramètres Spark globaux pour les modules exécutant des tâches EMR et définir leur priorité par rapport aux paramètres spécifiques au module. Pour plus d'informations, consultez Configurer les paramètres SPARK globaux.

Nœud unique

Dans Data Studio, vous pouvez définir des propriétés Spark spécifiques pour une tâche de nœud individuelle sur la page d'édition du nœud. Les autres modules de produit ne permettent pas de définir des propriétés Spark au sein des modules.

Gestion des autorisations

Seuls les utilisateurs disposant des rôles suivants peuvent configurer les paramètres Spark globaux :

  • Compte Alibaba Cloud

  • Un utilisateur RAM ou un rôle RAM disposant de la stratégie AliyunDataWorksFullAccess

  • Un utilisateur RAM disposant du rôle Administrateur de l'espace de travail

Configurer les paramètres Spark globaux

Configurez les paramètres Spark globaux en suivant les étapes ci-dessous. Pour plus d'informations sur les paramètres Spark d'une ressource de calcul Serverless Spark, consultez Vue d'ensemble de la configuration des tâches.

  1. Accédez à la page de liste des ressources de calcul et recherchez la ressource de calcul Serverless Spark que vous avez associée.

  2. Cliquez sur Spark Parameters pour ouvrir le volet de configuration et afficher les paramètres Spark globaux.

  3. Définissez les paramètres Spark globaux.

    Dans le coin supérieur droit de la page Spark Parameters, cliquez sur Edit Spark Parameters pour configurer les paramètres Spark globaux et les priorités pour chaque module.

    Remarque

    Il s'agit d'une configuration au niveau de l'espace de travail. Avant de continuer, assurez-vous d'avoir sélectionné le bon espace de travail.

    Paramètre

    Étapes

    Spark property

    Configurez les propriétés Spark pour l'exécution des tâches Serverless Spark.

    Global Settings Take Precedence

    Si vous sélectionnez cette option, la configuration globale remplace les configurations des modules de produit. Dans ce cas, les tâches sont exécutées en fonction des propriétés Spark globales.

    • Configuration globale : fait référence aux propriétés Spark configurées sur la page Spark Parameters de la ressource de calcul Serverless Spark dans Management Center > Computing Resources.

      Actuellement, vous ne pouvez définir des paramètres Spark globaux que pour Data Studio, Operation Center et Data Analysis.

    • Configurations dans les modules de produit :

      • Data Studio : Pour les nœuds EMR Spark, EMR Kyuubi, EMR Spark SQL, EMR Spark Streaming, Serverless Spark Batch, Serverless Spark SQL et Serverless Kyuubi, vous pouvez définir des propriétés Spark pour une tâche de nœud individuelle dans la section Spark Parameters de l'onglet Run Configuration ou Scheduling Settings de la page d'édition du nœud.

      • Autres modules de produit : Vous ne pouvez pas définir de propriétés Spark au sein des modules.

  4. Cliquez sur Confirm pour enregistrer les paramètres Spark globaux configurés.

Configurer les mappages de comptes de cluster

Configurez les mappages entre les comptes Alibaba Cloud des membres DataWorks et les comptes d'identité dans le cluster EMR. Cela permet aux membres d'exécuter des tâches EMR Serverless Spark en utilisant les identités de cluster mappées.

Important

Cette fonctionnalité est disponible uniquement dans un groupe de ressources serverless. Si vous avez acheté un groupe de ressources serverless avant le 15 août 2025 et souhaitez utiliser cette fonctionnalité, vous devez soumettre un ticket pour mettre à niveau le groupe de ressources.

  1. Accédez à la page de liste des ressources de calcul et recherchez la ressource de calcul Serverless Spark que vous avez associée.

  2. Cliquez sur Account Mappings pour accéder au volet de configuration Account Mappings.

  3. Cliquez sur Edit Account Mapping pour configurer les informations de mappage des comptes de cluster. Vous pouvez configurer les paramètres associés en fonction du Mapping Type sélectionné.

    Type de Mapping Type

    Exécution des tâches

    Configuration

    Mappage de compte système

    Exécute les tâches EMR Spark, EMR Spark SQL, EMR Kyuubi et tâches notebook développées dans un environnement de développement personnel en utilisant un compte de cluster portant le même nom que l'Default Access Identity spécifié dans les informations de base de la ressource de calcul.

    Par défaut, le mappage par nom identique est utilisé. Pour utiliser différents mappages de comptes, configurez les comptes manuellement.

    Mappage de compte OpenLDAP

    L'Default Access Identity spécifié dans les informations de base de la ressource de calcul est utilisé pour exécuter les tâches EMR Spark et EMR Spark SQL.

    Le compte OpenLDAP mappé à l'identité d'accès par défaut dans les informations de base de la ressource de calcul est utilisé pour exécuter les tâches EMR Kyuubi et tâches notebook développées dans un environnement de développement personnel.

    Si vous avez configuré et activé l'authentification LDAP pour Kyuubi Gateway, vous devez configurer les mappages entre le Account et les comptes OpenLDAP (LDAP Account et LDAP Password) pour exécuter les tâches associées.

    Important

    Si un compte Alibaba Cloud requis ne figure pas dans la liste de mappage, la tâche peut échouer.

    Mappage de compte Kerberos

    L'Default Access Identity spécifié dans les informations de base de la ressource de calcul est utilisé pour exécuter les tâches EMR Spark et EMR Spark SQL.

    Le compte Kerberos mappé à l'identité d'accès par défaut dans les informations de base de la ressource de calcul est utilisé pour exécuter les tâches de nœud EMR Kyuubi.

    1. Vous devez télécharger le fichier krb5.conf du service Kerberos configuré pour le cluster EMR Serverless Spark.

    2. Pour le compte Alibaba Cloud spécifié comme identité d'accès par défaut, configurez le principal et le keytab requis pour l'authentification Kerberos.

  4. Cliquez sur Confirm pour terminer la configuration des mappages de comptes de cluster.

Étapes suivantes

Une fois la ressource de calcul Serverless Spark configurée, vous pouvez l'utiliser pour développer des tâches de nœud dans Data Studio. Pour plus d'informations, consultez Nœud EMR Spark, Nœud EMR Spark SQL, Nœud EMR Spark Streaming, Nœud EMR Kyuubi, Nœud Serverless Spark Batch, Nœud Serverless Spark SQL et Nœud Serverless Kyuubi.