Tous les produits
Search
Centre de documentation

E-MapReduce:Quick start for PySpark development

Dernière mise à jour :Aug 09, 2026

Rédigez des scripts Python intégrant votre logique métier personnalisée, téléchargez-les sur EMR Serverless Spark et exécutez des travaux PySpark. Un exemple complet est fourni.

Prérequis

Procédure

Étape 1 : Préparation des fichiers d'exemple

EMR Serverless Spark vous permet de développer des fichiers Python sur une plateforme locale ou indépendante, puis de les soumettre en tant que travaux. Des fichiers d'exemple sont fournis ci-dessous pour vous aider à démarrer.

Cliquez sur DataFrame.py et employee.csv pour télécharger les fichiers d'exemple.

Remarque
  • DataFrame.py est un extrait de code qui utilise le framework Apache Spark pour traiter les données dans OSS.

  • employee.csv est un fichier de données contenant les noms des employés, leurs départements et leurs salaires.

Étape 2 : Téléchargement des fichiers d'exemple

  1. Téléchargez le fichier Python vers EMR Serverless Spark.

    1. Accédez à la page de téléchargement des ressources.

      1. Connectez-vous à la console EMR.

      2. Dans le volet de navigation de gauche, sélectionnez EMR Serverless > Spark.

      3. Sur la page Spark, cliquez sur le nom de l'espace de travail cible.

      4. Sur la page EMR Serverless Spark, cliquez sur Artifacts dans le volet de navigation de gauche.

    2. Sur la page Artifacts, cliquez sur Upload File.

    3. Dans la boîte de dialogue Upload File, cliquez sur la zone de téléchargement pour sélectionner un fichier Python, ou faites glisser le fichier dans cette zone.

      Dans cet exemple, téléchargez DataFrame.py.

  2. Téléchargez le fichier de données (employee.csv) vers OSS. Pour plus d'informations, consultez la rubrique Télécharger des fichiers.

Étape 3 : Développement et exécution du travail

  1. Sur la page EMR Serverless Spark, cliquez sur Development dans le volet de navigation de gauche.

  2. Sous l'onglet Development, cliquez sur l'icône image.

  3. Dans la boîte de dialogue, saisissez un nom, sélectionnez Application > PySpark comme type, puis cliquez sur OK.

  4. Dans le coin supérieur droit, sélectionnez une file d'attente.

    Pour savoir comment ajouter une file d'attente, consultez la rubrique Gérer les files d'attente de ressources.

  5. Dans le nouvel onglet de développement, configurez les paramètres suivants, conservez les valeurs par défaut pour les autres champs, puis cliquez sur Run.

    Parameter

    Description

    Main Python Resources

    Sélectionnez le fichier Python que vous avez téléchargé sur la page Artifacts à l'étape précédente. Dans cet exemple, sélectionnez DataFrame.py.

    Execution Parameters

    Saisissez le chemin OSS vers le fichier de données employee.csv. Exemple : oss://<yourBucketName>/employee.csv.

  6. Une fois le travail exécuté, dans la section Execution Records ci-dessous, cliquez sur Log Exploration dans la colonne Actions du travail.

  7. Sous l'onglet Log Exploration, vous pouvez consulter les informations de journalisation.

    Cet onglet comprend les sous-onglets driver log, executor log et startup log. Chaque sous-onglet prend en charge trois types de sortie : Stdout, Stderr et Log4j. Dans cet exemple, la sortie Stdout du sous-onglet driver log affiche les résultats de la requête Spark DataFrame, notamment les détails des salaires des employés (employee_name, department, salary) ainsi que les données de salaire agrégées par département.

Étape 4 : Publication du travail

Important

Un travail publié peut être utilisé comme tâche dans un nœud de workflow.

  1. Une fois le travail terminé, cliquez sur Publish à droite de la page Development.

  2. Dans la boîte de dialogue de publication du travail, saisissez les informations de publication et cliquez sur OK.

Étape 5 : Consultation de l'interface utilisateur Spark

Après l'exécution réussie du travail, vous pouvez consulter ses détails d'exécution dans l'interface utilisateur Spark.

  1. Dans le volet de navigation de gauche, cliquez sur Job History.

  2. Sur la page Application, cliquez sur Spark UI dans la colonne Actions du travail cible.

  3. Sur la page Spark Jobs, vous pouvez afficher les détails du travail.

    La page affiche les informations de base de l'application (telles que User : root, Total Uptime et Scheduling Mode : FIFO) ainsi que la liste Completed Jobs. Le tableau inclut des colonnes telles que Job Id, Description, Submitted, Duration, Stages: Succeeded/Total et Tasks. Pour chaque travail, vous pouvez consulter sa description, sa durée et les détails d'achèvement des étapes et des tâches.

Rubriques connexes