Associez votre espace de travail EMR Serverless Spark à DataWorks en tant que ressource de calcul Serverless Spark pour développer et gérer des tâches EMR Serverless Spark dans DataWorks.
Prérequis
Un espace de travail EMR Serverless Spark est créé.
-
Un espace de travail DataWorks est créé. L'utilisateur RAM qui effectue ces opérations doit être membre de l'espace de travail avec le rôle Administrateur de l'espace de travail.
ImportantSeuls les espaces de travail utilisant Use Data Studio (New Version) sont pris en charge.
Un groupe de ressources serverless est associé à l'espace de travail DataWorks cible.
Limites
Limites régionales : Chine (Hangzhou), Chine (Shanghai), Chine (Pékin), Chine (Shenzhen), Chine (Chengdu), Chine (Hong Kong), Japon (Tokyo), Singapour, Indonésie (Jakarta), Allemagne (Francfort), États-Unis (Silicon Valley) et États-Unis (Virginie).
-
Limites d'autorisation :
Opérateur
Autorisations requises
Compte Alibaba Cloud
Aucune autorisation supplémentaire n'est requise.
Utilisateur RAM/Rôle RAM
-
Autorisations de gestion DataWorks : Seuls les membres de l'espace de travail disposant des rôles O&M et Workspace Administrator, ou de la stratégie
AliyunDataWorksFullAccess, peuvent créer des ressources de calcul. Pour plus d'informations, consultez Accorder à un utilisateur les autorisations d'un administrateur d'espace de travail. -
Autorisations du service EMR Serverless Spark :
-
La stratégie
AliyunEMRServerlessSparkFullAccess. -
L'autorisation
Ownerpour l'espace de travail EMR Serverless Spark. Pour plus d'informations, consultez Gérer les utilisateurs et les rôles.
-
-
Accéder à la page de liste des ressources de calcul
Connectez-vous à la console DataWorks. Dans le volet de navigation de gauche, basculez vers la région cible et cliquez sur . Sélectionnez votre espace de travail dans la liste déroulante et cliquez sur Go to Management Center.
Dans le volet de navigation de gauche, cliquez sur Computing Resources pour ouvrir la page de liste des ressources de calcul.
Associer une ressource de calcul Serverless Spark
Sur la page de liste des ressources de calcul, configurez et liez une ressource de calcul Serverless Spark.
-
Sélectionnez le type de ressource de calcul à associer.
Cliquez sur Associate Computing Resources pour accéder à la page Associate Computing Resources.
Sur la page Associate Computing Resources, sélectionnez Serverless Spark comme type de ressource de calcul pour ouvrir la page de configuration Associate EMR Serverless Spark Computing Resource.
-
Configurez la ressource de calcul Serverless Spark.
Sur la page de configuration Associate EMR Serverless Spark Computing Resource, configurez les paramètres suivants.
Paramètre
Description
EMR Serverless Spark Workspace
Sélectionnez l'espace de travail Spark à associer. Vous pouvez également cliquer sur Create dans la liste déroulante pour créer un espace de travail Spark.
Default Engine Version
Sélectionnez la version du moteur à utiliser.
-
Lorsque vous créez une tâche EMR Spark dans Data Studio, cette version du moteur est utilisée par défaut.
-
Pour définir différentes versions de moteur pour différentes tâches, spécifiez les versions dans les paramètres avancés de la fenêtre d'édition de la tâche Spark.
Default Resource Queue
Sélectionnez la file d'attente de ressources à utiliser. Vous pouvez également cliquer sur Create dans la liste déroulante pour ajouter une file d'attente.
-
Lorsque vous créez une tâche EMR Spark dans Data Studio, cette file d'attente de ressources est utilisée par défaut.
-
Pour définir différentes files d'attente de ressources pour différentes tâches, spécifiez les files d'attente dans les paramètres avancés de la fenêtre d'édition de la tâche Spark.
Default Kyuubi Gateway
Facultatif. La configuration de Kyuubi Gateway détermine l'exécution des tâches suivantes :
-
Si une passerelle Kyuubi est configurée :
-
Toutes les tâches associées (EMR Spark SQL/Kyuubi et Serverless Spark SQL/Kyuubi) s'exécutent via la passerelle Kyuubi.
-
-
Si aucune passerelle Kyuubi n'est configurée :
-
Les tâches EMR Spark SQL et Serverless Spark SQL s'exécutent à l'aide de
spark-submit. -
L'exécution des tâches EMR Kyuubi et Serverless Kyuubi échoue.
-
Pour configurer une passerelle, créez une passerelle Kyuubi et un jeton dans .
-
Si Kerberos n'est pas activé : Cliquez sur le nom de la passerelle Kyuubi pour obtenir l'URL JDBC et le jeton, puis combinez-les pour former la chaîne de connexion complète.
-
Si Kerberos est activé : Obtenez la chaîne de connexion Beeline en fonction de votre configuration Kerberos. Pour plus d'informations, consultez Utiliser Kerberos avec Kyuubi Gateway.
# Example of a standard connection string jdbc:hive2://kyuubi-cn-hangzhou-internal.spark.emr.aliyuncs.com:80/;transportMode=http;httpPath=cliservice/token/<token> # Example of a connection string for a Kerberos-enabled cluster. Make sure to include the principal of the Kyuubi service. jdbc:hive2://ep-xxxxxxxxxxx.epsrv-xxxxxxxxxxx.cn-hangzhou.privatelink.aliyuncs.com:10009/;principal=kyuubi/_HOST@EMR.C-DFD43*****7C204.COM
Default Access Identity
L'identité utilisée pour accéder à cet espace de travail Spark depuis DataWorks.
-
Environnement de développement : Seule l'identité Executor est prise en charge.
-
Environnement de production : Les identités Alibaba Cloud Account, Alibaba Cloud RAM Sub-account et Task Owner sont prises en charge.
Computing Resource Instance Name
L'identifiant de la ressource de calcul. Au moment de l'exécution, les tâches utilisent ce nom pour sélectionner la ressource.
-
Cliquez sur Confirm pour terminer la configuration de la ressource de calcul Serverless Spark.
Configurer les paramètres Spark globaux
Vous pouvez configurer les paramètres Spark au niveau de l'espace de travail pour chaque module et contrôler si les paramètres globaux ont la priorité sur les paramètres spécifiques au module. Après la configuration, les tâches utilisent les paramètres Spark spécifiés par défaut.
|
Portée |
Méthode de configuration |
|
Configuration globale |
Au niveau de l'espace de travail, vous pouvez configurer les paramètres Spark globaux pour les modules exécutant des tâches EMR et définir leur priorité par rapport aux paramètres spécifiques au module. Pour plus d'informations, consultez Configurer les paramètres SPARK globaux. |
|
Nœud unique |
Dans Data Studio, vous pouvez définir des propriétés Spark spécifiques pour une tâche de nœud individuelle sur la page d'édition du nœud. Les autres modules de produit ne permettent pas de définir des propriétés Spark au sein des modules. |
Gestion des autorisations
Seuls les utilisateurs disposant des rôles suivants peuvent configurer les paramètres Spark globaux :
Compte Alibaba Cloud
Un utilisateur RAM ou un rôle RAM disposant de la stratégie
AliyunDataWorksFullAccessUn utilisateur RAM disposant du rôle Administrateur de l'espace de travail
Configurer les paramètres Spark globaux
Configurez les paramètres Spark globaux en suivant les étapes ci-dessous. Pour plus d'informations sur les paramètres Spark d'une ressource de calcul Serverless Spark, consultez Vue d'ensemble de la configuration des tâches.
Accédez à la page de liste des ressources de calcul et recherchez la ressource de calcul Serverless Spark que vous avez associée.
Cliquez sur Spark Parameters pour ouvrir le volet de configuration et afficher les paramètres Spark globaux.
-
Définissez les paramètres Spark globaux.
Dans le coin supérieur droit de la page Spark Parameters, cliquez sur Edit Spark Parameters pour configurer les paramètres Spark globaux et les priorités pour chaque module.
RemarqueIl s'agit d'une configuration au niveau de l'espace de travail. Avant de continuer, assurez-vous d'avoir sélectionné le bon espace de travail.
Paramètre
Étapes
Spark property
Configurez les propriétés Spark pour l'exécution des tâches Serverless Spark.
-
Cliquez sur Add ci-dessous et saisissez le Spark Property Name et la Spark Property Value correspondante pour définir les informations de propriété Spark.
-
Pour plus d'informations sur les paramètres de propriété Spark pris en charge, consultez Configuration Spark et Liste des paramètres Spark Conf personnalisés.
Global Settings Take Precedence
Si vous sélectionnez cette option, la configuration globale remplace les configurations des modules de produit. Dans ce cas, les tâches sont exécutées en fonction des propriétés Spark globales.
-
Configuration globale : fait référence aux propriétés Spark configurées sur la page Spark Parameters de la ressource de calcul Serverless Spark dans .
Actuellement, vous ne pouvez définir des paramètres Spark globaux que pour Data Studio, Operation Center et Data Analysis.
-
Configurations dans les modules de produit :
-
Data Studio : Pour les nœuds EMR Spark, EMR Kyuubi, EMR Spark SQL, EMR Spark Streaming, Serverless Spark Batch, Serverless Spark SQL et Serverless Kyuubi, vous pouvez définir des propriétés Spark pour une tâche de nœud individuelle dans la section Spark Parameters de l'onglet Run Configuration ou Scheduling Settings de la page d'édition du nœud.
-
Autres modules de produit : Vous ne pouvez pas définir de propriétés Spark au sein des modules.
-
-
Cliquez sur Confirm pour enregistrer les paramètres Spark globaux configurés.
Configurer les mappages de comptes de cluster
Configurez les mappages entre les comptes Alibaba Cloud des membres DataWorks et les comptes d'identité dans le cluster EMR. Cela permet aux membres d'exécuter des tâches EMR Serverless Spark en utilisant les identités de cluster mappées.
Cette fonctionnalité est disponible uniquement dans un groupe de ressources serverless. Si vous avez acheté un groupe de ressources serverless avant le 15 août 2025 et souhaitez utiliser cette fonctionnalité, vous devez soumettre un ticket pour mettre à niveau le groupe de ressources.
Accédez à la page de liste des ressources de calcul et recherchez la ressource de calcul Serverless Spark que vous avez associée.
Cliquez sur Account Mappings pour accéder au volet de configuration Account Mappings.
-
Cliquez sur Edit Account Mapping pour configurer les informations de mappage des comptes de cluster. Vous pouvez configurer les paramètres associés en fonction du Mapping Type sélectionné.
Type de Mapping Type
Exécution des tâches
Configuration
Mappage de compte système
Exécute les tâches EMR Spark, EMR Spark SQL, EMR Kyuubi et tâches notebook développées dans un environnement de développement personnel en utilisant un compte de cluster portant le même nom que l'Default Access Identity spécifié dans les informations de base de la ressource de calcul.
Par défaut, le mappage par nom identique est utilisé. Pour utiliser différents mappages de comptes, configurez les comptes manuellement.
Mappage de compte OpenLDAP
L'Default Access Identity spécifié dans les informations de base de la ressource de calcul est utilisé pour exécuter les tâches EMR Spark et EMR Spark SQL.
Le compte OpenLDAP mappé à l'identité d'accès par défaut dans les informations de base de la ressource de calcul est utilisé pour exécuter les tâches EMR Kyuubi et tâches notebook développées dans un environnement de développement personnel.
Si vous avez configuré et activé l'authentification LDAP pour Kyuubi Gateway, vous devez configurer les mappages entre le Account et les comptes OpenLDAP (LDAP Account et LDAP Password) pour exécuter les tâches associées.
ImportantSi un compte Alibaba Cloud requis ne figure pas dans la liste de mappage, la tâche peut échouer.
Mappage de compte Kerberos
L'Default Access Identity spécifié dans les informations de base de la ressource de calcul est utilisé pour exécuter les tâches EMR Spark et EMR Spark SQL.
Le compte Kerberos mappé à l'identité d'accès par défaut dans les informations de base de la ressource de calcul est utilisé pour exécuter les tâches de nœud EMR Kyuubi.
-
Vous devez télécharger le fichier krb5.conf du service Kerberos configuré pour le cluster EMR Serverless Spark.
-
Pour le compte Alibaba Cloud spécifié comme identité d'accès par défaut, configurez le principal et le keytab requis pour l'authentification Kerberos.
-
Cliquez sur Confirm pour terminer la configuration des mappages de comptes de cluster.
Étapes suivantes
Une fois la ressource de calcul Serverless Spark configurée, vous pouvez l'utiliser pour développer des tâches de nœud dans Data Studio. Pour plus d'informations, consultez Nœud EMR Spark, Nœud EMR Spark SQL, Nœud EMR Spark Streaming, Nœud EMR Kyuubi, Nœud Serverless Spark Batch, Nœud Serverless Spark SQL et Nœud Serverless Kyuubi.