Rédigez des scripts Python intégrant votre logique métier personnalisée, téléchargez-les sur EMR Serverless Spark et exécutez des travaux PySpark. Un exemple complet est fourni.
Prérequis
Vous disposez d'un compte Alibaba Cloud. Pour plus d'informations, consultez la page Inscription à un compte.
Assurez-vous de disposer des rôles requis. Pour en savoir plus, consultez la rubrique Autorisation de rôle pour un compte Alibaba Cloud.
Vous avez créé un espace de travail. Pour plus de détails, reportez-vous à la section Créer un espace de travail.
Procédure
Étape 1 : Préparation des fichiers d'exemple
EMR Serverless Spark vous permet de développer des fichiers Python sur une plateforme locale ou indépendante, puis de les soumettre en tant que travaux. Des fichiers d'exemple sont fournis ci-dessous pour vous aider à démarrer.
Cliquez sur DataFrame.py et employee.csv pour télécharger les fichiers d'exemple.
DataFrame.py est un extrait de code qui utilise le framework Apache Spark pour traiter les données dans OSS.
employee.csv est un fichier de données contenant les noms des employés, leurs départements et leurs salaires.
Étape 2 : Téléchargement des fichiers d'exemple
-
Téléchargez le fichier Python vers EMR Serverless Spark.
-
Accédez à la page de téléchargement des ressources.
Connectez-vous à la console EMR.
Dans le volet de navigation de gauche, sélectionnez EMR Serverless > Spark.
Sur la page Spark, cliquez sur le nom de l'espace de travail cible.
Sur la page EMR Serverless Spark, cliquez sur Artifacts dans le volet de navigation de gauche.
Sur la page Artifacts, cliquez sur Upload File.
-
Dans la boîte de dialogue Upload File, cliquez sur la zone de téléchargement pour sélectionner un fichier Python, ou faites glisser le fichier dans cette zone.
Dans cet exemple, téléchargez DataFrame.py.
-
Téléchargez le fichier de données (employee.csv) vers OSS. Pour plus d'informations, consultez la rubrique Télécharger des fichiers.
Étape 3 : Développement et exécution du travail
Sur la page EMR Serverless Spark, cliquez sur Development dans le volet de navigation de gauche.
Sous l'onglet Development, cliquez sur l'icône
.Dans la boîte de dialogue, saisissez un nom, sélectionnez comme type, puis cliquez sur OK.
-
Dans le coin supérieur droit, sélectionnez une file d'attente.
Pour savoir comment ajouter une file d'attente, consultez la rubrique Gérer les files d'attente de ressources.
-
Dans le nouvel onglet de développement, configurez les paramètres suivants, conservez les valeurs par défaut pour les autres champs, puis cliquez sur Run.
Parameter
Description
Main Python Resources
Sélectionnez le fichier Python que vous avez téléchargé sur la page Artifacts à l'étape précédente. Dans cet exemple, sélectionnez DataFrame.py.
Execution Parameters
Saisissez le chemin OSS vers le fichier de données employee.csv. Exemple : oss://<yourBucketName>/employee.csv.
Une fois le travail exécuté, dans la section Execution Records ci-dessous, cliquez sur Log Exploration dans la colonne Actions du travail.
-
Sous l'onglet Log Exploration, vous pouvez consulter les informations de journalisation.
Cet onglet comprend les sous-onglets driver log, executor log et startup log. Chaque sous-onglet prend en charge trois types de sortie : Stdout, Stderr et Log4j. Dans cet exemple, la sortie Stdout du sous-onglet driver log affiche les résultats de la requête Spark DataFrame, notamment les détails des salaires des employés (employee_name, department, salary) ainsi que les données de salaire agrégées par département.
Étape 4 : Publication du travail
Un travail publié peut être utilisé comme tâche dans un nœud de workflow.
Une fois le travail terminé, cliquez sur Publish à droite de la page Development.
Dans la boîte de dialogue de publication du travail, saisissez les informations de publication et cliquez sur OK.
Étape 5 : Consultation de l'interface utilisateur Spark
Après l'exécution réussie du travail, vous pouvez consulter ses détails d'exécution dans l'interface utilisateur Spark.
Dans le volet de navigation de gauche, cliquez sur Job History.
Sur la page Application, cliquez sur Spark UI dans la colonne Actions du travail cible.
-
Sur la page Spark Jobs, vous pouvez afficher les détails du travail.
La page affiche les informations de base de l'application (telles que User : root, Total Uptime et Scheduling Mode : FIFO) ainsi que la liste Completed Jobs. Le tableau inclut des colonnes telles que Job Id, Description, Submitted, Duration, Stages: Succeeded/Total et Tasks. Pour chaque travail, vous pouvez consulter sa description, sa durée et les détails d'achèvement des étapes et des tâches.
Rubriques connexes
Une fois un travail publié, vous pouvez le planifier dans un workflow. Pour plus d'informations, consultez la rubrique Gérer les workflows. Pour un exemple complet du processus de développement d'orchestration de travaux, reportez-vous à la section Démarrage rapide pour le développement Spark SQL.
Pour un exemple de développement d'un travail de streaming PySpark, consultez la rubrique Soumettre un travail de streaming PySpark à l'aide de Serverless Spark.