Le développement des jobs s'effectue au sein d'un workspace. Vous devez donc en créer un au préalable. Cette rubrique explique comment créer un workspace dans la console E-MapReduce.
Prérequis
Vous disposez d'un compte Alibaba Cloud et avez effectué la vérification du nom réel.
-
Vous devez disposer d'un compte disposant des autorisations nécessaires pour créer un workspace :
Si vous utilisez votre compte Alibaba Cloud, consultez la rubrique Assigner des rôles à un compte Alibaba Cloud pour obtenir des détails sur l'autorisation.
Si vous utilisez un utilisateur RAM ou un rôle RAM, assurez-vous que les stratégies d'accès AliyunEMRServerlessSparkFullAccess, AliyunOSSFullAccess et AliyunDLFFullAccess sont jointes à l'utilisateur ou au rôle RAM. Ensuite, sur la page Access Control, ajoutez l'utilisateur ou le rôle RAM et attribuez-lui le rôle d'administrateur. Pour plus d'informations, consultez les rubriques Accorder des permissions à un utilisateur RAM et Gérer les utilisateurs et les rôles.
Data Lake Formation (DLF) est activé. Pour plus d'informations, consultez la rubrique Démarrage rapide. Pour consulter la liste des régions prenant en charge DLF, reportez-vous à la rubrique Régions et endpoints.
Object Storage Service (OSS) est activé et un bucket a été créé. Pour plus d'informations, consultez les rubriques Activer le service OSS et Créer un bucket.
Précautions
Vous êtes responsable de la gestion et de la configuration de l'environnement d'exécution de votre code.
Créer un workspace par abonnement
-
Accédez à la page EMR Serverless Spark.
Connectez-vous à la console EMR.
Dans le volet de navigation de gauche, choisissez EMR Serverless > Spark.
-
Dans la barre de navigation supérieure, sélectionnez une région selon vos besoins.
ImportantVous ne pouvez pas modifier la région d'un workspace après sa création.
Cliquez sur Create Workspace.
-
Sur la page Create Workspace, configurez les paramètres suivants.
Parameter
Description
Example
Region
Sélectionnez la région où se trouvent vos données.
China (Hangzhou)
Billing Method
Sélectionnez Subscription.
abonnement
Workspace Name
Le nom doit comporter entre 1 et 64 caractères et ne peut contenir que des caractères chinois, des lettres, des chiffres, des traits d'union (-) et des traits de soulignement (_).
RemarqueSi vous saisissez un nom déjà utilisé, le système vous invite à en choisir un autre.
emr-serverless-spark
CU Quota
Nombre maximal d'unités de calcul (CU) concurrentes disponibles pour le traitement des jobs dans le workspace.
RemarqueLe quota maximal de CU pour un workspace est de 1 000 CU. Si vous avez besoin d'un quota supérieur, .
1000
Workspace Directory
Répertoire utilisé pour stocker les fichiers de données, tels que les journaux de job, les événements d'exécution et les ressources.
Sélectionnez un bucket avec OSS-HDFS activé pour une compatibilité native de l'interface HDFS. Si votre cas d'utilisation ne nécessite pas HDFS, vous pouvez sélectionner un bucket OSS standard.
RemarqueVous pouvez spécifier soit un répertoire parent, soit un sous-répertoire pour le chemin OSS selon vos besoins. Spark crée automatiquement un répertoire nommé d'après l'ID du workspace sous le chemin OSS spécifié pour stocker les données suivantes :
<workspace-ID>/spark/logs/: journaux de job Spark
<workspace-ID>/spark/eventlogs/: journaux d'événements Spark
<workspace-ID>/spark/snapshot/: données de snapshot Spark
emr-oss-hdfs
DLF for Metadata Storage
Stocke et gère vos métadonnées. Vous pouvez sélectionner un catalogue DLF ou DLF-Legacy.
Si DLF est activé, EMR utilise par défaut un catalogue DLF. Si seul DLF-Legacy est configuré, EMR utilise par défaut le catalogue DLF-Legacy portant le même nom que votre UID. Pour utiliser différents catalogues de données pour différents clusters, créez un nouveau catalogue :
Cliquez sur Create Catalog. Dans la boîte de dialogue qui s'affiche, saisissez un Catalog Name et cliquez sur Create Catalog. Pour plus d'informations, consultez la rubrique Créer un catalogue.
Dans la liste déroulante, sélectionnez le catalogue de données que vous avez créé.
emr-dlf
Execution Role
Spécifie le rôle que Serverless Spark assume pour exécuter les jobs. Le rôle par défaut est AliyunEMRSparkJobRunDefaultRole.
Serverless Spark utilise ce rôle pour accéder à vos ressources dans d'autres services, tels qu'OSS et DLF. Si vous souhaitez contrôler les autorisations du rôle d'exécution, vous pouvez utiliser un rôle d'exécution personnalisé. Pour plus d'informations, consultez la rubrique Rôle d'exécution.
AliyunEMRSparkJobRunDefaultRole
(Facultatif) Advanced Settings
Tags : les tags sont des identifiants pour vos ressources cloud. Vous pouvez utiliser les tags pour classer, rechercher et regrouper les ressources partageant les mêmes caractéristiques, ce qui améliore l'efficacité de la gestion des ressources. Vous pouvez associer jusqu'à 20 tags à chaque workspace. Chaque tag se compose d'une clé de tag personnalisée et d'une valeur de tag. Les tags permettent également la répartition des coûts et la gestion fine des ressources en paiement à l'utilisation.
Vous pouvez associer des tags lors de la création d'un workspace, ou ajouter ou modifier des tags à tout moment sur la page de liste des workspaces. L'association de tags aux ressources vous aide à les classer et à optimiser les opérations.
Pour plus d'informations sur les tags, consultez la rubrique Qu'est-ce qu'un tag ?.
Saisissez une clé de tag et une valeur de tag personnalisées
Cliquez sur Create Workspace.
-
Cliquez sur Confirm Order et effectuez le paiement.
Une fois le paiement effectué, vous pouvez voir le Workspace en cours de création sur la page EMR Serverless > Spark. La création du workspace prend généralement entre 3 et 5 minutes.
Créer un workspace en paiement à l'utilisation
-
Accédez à la page EMR Serverless Spark.
Connectez-vous à la console EMR.
Dans le volet de navigation de gauche, choisissez EMR Serverless > Spark.
-
Dans la barre de navigation supérieure, sélectionnez une région selon vos besoins.
ImportantVous ne pouvez pas modifier la région d'un workspace après sa création.
Cliquez sur Create Workspace.
-
Sur la page Create Workspace, configurez les paramètres suivants.
Parameter
Description
Example
Region
Sélectionnez la région où se trouvent vos données.
China (Hangzhou)
Billing Method
Sélectionnez Subscription.
paiement à l'utilisation
Workspace Name
Le nom doit comporter entre 1 et 64 caractères et ne peut contenir que des caractères chinois, des lettres, des chiffres, des traits d'union (-) et des traits de soulignement (_).
RemarqueSi vous saisissez un nom déjà utilisé, le système vous invite à en choisir un autre.
emr-serverless-spark
Maximum Quota
Unités de calcul (CU) maximales disponibles pour l'exécution concurrente de jobs dans le workspace.
RemarqueLe quota maximal de burst pour un workspace est de 5 000 CU. Si vous avez besoin d'un quota supérieur, .
1000
Workspace Directory
Répertoire utilisé pour stocker les fichiers de données, tels que les journaux de job, les événements d'exécution et les ressources.
Sélectionnez un bucket avec OSS-HDFS activé pour une compatibilité native de l'interface HDFS. Si votre cas d'utilisation ne nécessite pas HDFS, vous pouvez sélectionner un bucket OSS standard.
RemarqueVous pouvez spécifier soit un répertoire parent, soit un sous-répertoire pour le chemin OSS selon vos besoins. Spark crée automatiquement un répertoire nommé d'après l'ID du workspace sous le chemin OSS spécifié pour stocker les données suivantes :
<workspace-ID>/spark/logs/: journaux de job Spark
<workspace-ID>/spark/eventlogs/: journaux d'événements Spark
<workspace-ID>/spark/snapshot/: données de snapshot Spark
emr-oss-hdfs
DLF for Metadata Storage
Stocke et gère vos métadonnées. Vous pouvez sélectionner un catalogue DLF ou DLF-Legacy.
Si DLF est activé, EMR utilise par défaut un catalogue DLF. Si seul DLF-Legacy est configuré, EMR utilise par défaut le catalogue DLF-Legacy portant le même nom que votre UID. Pour utiliser différents catalogues de données pour différents clusters, créez un nouveau catalogue :
Cliquez sur Create Catalog. Dans la boîte de dialogue qui s'affiche, saisissez un Catalog Name et cliquez sur Create Catalog. Pour plus d'informations, consultez la rubrique Créer un catalogue.
Dans la liste déroulante, sélectionnez le catalogue de données que vous avez créé.
emr-dlf
Execution Role
Spécifie le rôle que Serverless Spark assume pour exécuter les jobs. Le rôle par défaut est AliyunEMRSparkJobRunDefaultRole.
Serverless Spark utilise ce rôle pour accéder à vos ressources dans d'autres services, tels qu'OSS et DLF. Si vous souhaitez contrôler les autorisations du rôle d'exécution, vous pouvez utiliser un rôle d'exécution personnalisé. Pour plus d'informations, consultez la rubrique Rôle d'exécution.
AliyunEMRSparkJobRunDefaultRole
(Facultatif) Advanced Settings
Tags : les tags sont des identifiants pour vos ressources cloud. Vous pouvez utiliser les tags pour classer, rechercher et regrouper les ressources partageant les mêmes caractéristiques, ce qui améliore l'efficacité de la gestion des ressources. Vous pouvez associer jusqu'à 20 tags à chaque workspace. Chaque tag se compose d'une clé de tag personnalisée et d'une valeur de tag. Les tags permettent également la répartition des coûts et la gestion fine des ressources en paiement à l'utilisation.
Vous pouvez associer des tags lors de la création d'un workspace, ou ajouter ou modifier des tags à tout moment sur la page de liste des workspaces. L'association de tags aux ressources vous aide à les classer et à optimiser les opérations.
Pour plus d'informations sur les tags, consultez la rubrique Qu'est-ce qu'un tag ?.
Saisissez une clé de tag et une valeur de tag personnalisées
Cliquez sur Create Workspace.
Documentation connexe
Après avoir créé un workspace, vous pouvez commencer à développer des jobs, tels que des jobs SparkSQL. Pour plus d'informations, consultez la rubrique Démarrage rapide du développement SparkSQL.