L'environnement Python pour EMR Serverless Spark inclut par défaut matplotlib, NumPy et pandas. Pour utiliser d'autres bibliothèques tierces, créez un environnement d'exécution qui regroupe les bibliothèques requises.
Prérequis
Vous avez créé un espace de travail. Pour plus d'informations, consultez la rubrique Gérer les espaces de travail.
Créer un environnement d'exécution
-
Accédez à la page de gestion des environnements d'exécution.
Connectez-vous à la console E-MapReduce.
Dans le volet de navigation de gauche, sélectionnez EMR Serverless > Spark.
Sur la page Spark, cliquez sur le nom de l'espace de travail cible.
Sur la page EMR Serverless Spark, sélectionnez Environment dans la barre de navigation de gauche.
Cliquez sur Create Environment.
-
Sur la page Create Environment, configurez les paramètres suivants.
Paramètre
Obligatoire
Description
Name
Oui
Saisissez un nom pour l'environnement d'exécution.
Description
Non
Saisissez une description pour l'environnement d'exécution.
Resource Queue
Oui
Sélectionnez une file d'attente de ressources pour l'initialisation. La création de l'environnement d'exécution consomme 1 cœur et 4 Go de ressources de cette file d'attente. Ces ressources sont libérées automatiquement après l'initialisation.
Normal Network Connection
Non
Pour ajouter des bibliothèques PyPI depuis une source autre que la source Alibaba Cloud, sélectionnez une connexion réseau appropriée. L'environnement d'exécution utilise cette connexion pour accéder à l'adresse source lors de la création.
Pour plus d'informations sur la création d'une connexion réseau, consultez la rubrique Établir une connectivité réseau entre EMR Serverless Spark et d'autres VPC.
Python version
Oui
La valeur par défaut est Python 3.8. Vous pouvez sélectionner une autre version en fonction de vos besoins métier.
Assurez-vous que la version Python sélectionnée est compatible avec vos bibliothèques Python cibles afin d'éviter les échecs d'empaquetage ou les erreurs d'exécution dues à des incompatibilités de versions.
-
Ajoutez les informations de bibliothèque.
Cliquez sur Add Library.
-
Dans la boîte de dialogue New Library, sélectionnez un Type, configurez les paramètres associés, puis cliquez sur OK.
Paramètre
Description
PyPI
-
Paquet PyPI : Saisissez le nom de la bibliothèque et, éventuellement, la version. Si vous omettez la version, le système installe la dernière version. La source Alibaba Cloud est utilisée par défaut.
Par exemple,
PlotlyouPlotly==4.9.0. -
Package Source : Spécifiez une URL de source PyPI personnalisée. Si vous laissez ce champ vide, la source Alibaba Cloud est utilisée par défaut. Si vous utilisez une source personnalisée, assurez-vous d'avoir sélectionné une connexion réseau appropriée.
Workspace
Dans la liste déroulante Workspace, sélectionnez une ressource de fichier de l'espace de travail actuel. Si aucune ressource n'est disponible, téléchargez-en une sur la page Artifacts.
Types de fichiers pris en charge :
.zip,.tar,.whl,.tar.gz,.jaret.txt.RemarqueSi vous sélectionnez un fichier
.txt, le système le traite comme un fichier de requirements et installe les bibliothèques Python et les versions répertoriées dans le fichier.OSS
Dans le champ OSS, saisissez le chemin d'accès d'un fichier stocké dans Object Storage Service (OSS).
Types de fichiers pris en charge :
.zip,.tar,.whl,.tar.gz,.jaret.txt.RemarqueSi vous spécifiez un fichier
.txt, le système le traite comme un fichier de requirements et installe les bibliothèques Python et les versions répertoriées dans le fichier. -
-
Cliquez sur create.
L'environnement commence à s'initialiser après sa création.
Modifier un environnement d'exécution
Modifiez un environnement d'exécution pour mettre à jour les bibliothèques qu'il contient.
Sur la page Environment, recherchez l'environnement d'exécution cible et cliquez sur Edit dans la colonne Actions.
Sur la page Edit Environment, mettez à jour la configuration de l'environnement d'exécution.
-
Cliquez sur Save Changes.
L'enregistrement des modifications entraîne la réinitialisation de l'environnement selon la nouvelle configuration.
RemarqueAprès la réinitialisation d'un environnement, les modifications ne s'appliquent pas immédiatement aux sessions Notebook actives. Pour utiliser le dernier environnement d'exécution dans une session Notebook, redémarrez les ressources de la session Notebook.
Utiliser un environnement d'exécution
Une fois qu'un environnement d'exécution est à l'état Ready, vous pouvez l'utiliser pour le développement de données ou dans les sessions correspondantes.
Tâche par lot PySpark : au démarrage d'une tâche, le système préinstalle les bibliothèques nécessaires à partir de l'environnement d'exécution sélectionné.
Orchestration de tâches : lorsque vous ajoutez un nœud Notebook à un workflow, vous pouvez sélectionner l'environnement d'exécution correspondant.
Session Notebook : au démarrage d'une session Notebook, le système préinstalle les bibliothèques en fonction de l'environnement sélectionné.
Passerelle Livy : lorsque vous soumettez une tâche via la passerelle Livy, le système préconfigure les ressources requises pour exécuter la tâche en fonction de l'environnement sélectionné.
Lors de la soumission de tâches à l'aide de Spark Submit, Apache Airflow et Livy, spécifiez l'environnement d'exécution en transmettant l'ID de l'environnement en tant que paramètre de configuration :
--conf spark.emr.serverless.environmentId=<environment_id>.