Tous les produits
Search
Centre de documentation

DataWorks:Nœud ADB Spark

Dernière mise à jour :Aug 20, 2026

Utilisez un nœud ADB Spark dans DataWorks pour développer, planifier périodiquement et intégrer des tâches AnalyticDB Spark avec d'autres jobs. Cette rubrique décrit le flux de travail principal pour le développement de tâches à l'aide d'un nœud ADB Spark.

Informations générales

ADB Spark est un moteur de calcul intégré au service AnalyticDB, conçu pour exécuter des tâches de traitement de données Apache Spark à grande échelle. Il prend en charge l'analyse de données en temps réel, les requêtes complexes et les applications d'apprentissage automatique. Compatible avec Java, Scala et Python, il simplifie le développement et s'adapte automatiquement pour optimiser les performances et les coûts. Vous pouvez configurer les tâches en téléchargeant les fichiers Jar ou .py pertinents. ADB Spark convient parfaitement à divers secteurs nécessitant un traitement efficace de volumes massifs de données et l'obtention d'informations en temps réel. Cela permet aux entreprises d'extraire des informations précieuses de leurs données afin de stimuler leur croissance commerciale.

Prérequis

Prérequis pour AnalyticDB for MySQL :

  • Vous avez créé un cluster AnalyticDB for MySQL Basic Edition dans la même région que votre espace de travail DataWorks. Pour plus d'informations, consultez la rubrique Création d'un cluster.

  • Vous avez configuré un groupe de ressources de job dans votre cluster AnalyticDB for MySQL. Pour plus d'informations, consultez la rubrique Création d'un groupe de ressources de job.

    Remarque

    Lorsque vous utilisez DataWorks pour développer des applications Spark, vous devez créer un groupe de ressources de job.

  • Si vous utilisez OSS pour le stockage, assurez-vous que le bucket OSS se trouve dans la même région que votre cluster AnalyticDB for MySQL.

Prérequis pour DataWorks :

  • Vous disposez d'un espace de travail avec l'option Use Data Studio (New Version) sélectionnée et un groupe de ressources associé. Pour plus d'informations, consultez la rubrique Création d'un espace de travail.

  • Le groupe de ressources doit se trouver dans le même VPC que le cluster AnalyticDB for MySQL, et vous devez ajouter les adresses IP du groupe de ressources à la liste d'autorisation du cluster AnalyticDB for MySQL. Pour plus d'informations, consultez la rubrique Configuration d'une liste d'autorisation.

  • Vous avez ajouté l'instance de cluster AnalyticDB for MySQL à DataWorks en tant que moteur de calcul. Le type de moteur de calcul doit être AnalyticDB for Spark. DataWorks teste la connectivité du moteur de calcul à l'aide du groupe de ressources. Pour plus d'informations, consultez la rubrique Association d'un moteur de calcul.

  • Vous avez créé un dossier de workflow. Pour plus d'informations, consultez la rubrique Dossier de workflow.

  • Vous avez créé un nœud ADB Spark. Pour plus d'informations, consultez la rubrique Création d'un nœud pour un workflow.

Étape 1 : Développement du nœud ADB Spark

Dans l'éditeur de nœuds ADB Spark, configurez le contenu du nœud selon le type de Language sélectionné, en utilisant le package exemple spark-examples_2.12-3.2.0.jar ou le fichier spark_oss.py. Pour plus d'informations sur le développement du contenu du nœud, consultez la rubrique Développement d'une application Spark à l'aide de l'outil de ligne de commande spark-submit.

Java et Scala

Préparation du fichier JAR

Téléchargez le package JAR exemple vers OSS. Ce package est requis par le nœud pour exécuter la tâche.

  1. Préparez le package JAR exemple.

    Téléchargez le package JAR exemple spark-examples_2.12-3.2.0.jar destiné à être utilisé dans le nœud ADB Spark.

  2. Téléchargez le code exemple vers OSS.

    1. Connectez-vous à la console OSS. Dans le volet de navigation de gauche, cliquez sur Buckets.

    2. Sur la page Buckets, cliquez sur Create Bucket. Dans le panneau Create Bucket, créez un bucket dans la même région que votre cluster AnalyticDB for MySQL.

      Remarque

      Cette rubrique utilise un bucket nommé dw-1127 à titre d'exemple.

    3. Créez un répertoire de stockage externe.

      Une fois la création terminée, cliquez sur Go to Bucket. Sur la page Files, cliquez sur Create Directory, puis définissez le paramètre Catalog Name sur db_home.

    4. Téléchargez le fichier de code exemple spark-examples_2.12-3.2.0.jar dans le répertoire db_home. Pour plus d'informations, consultez la rubrique Téléchargement d'objets.

Configuration du nœud ADB Spark

Configurez le contenu du nœud ADB Spark en vous basant sur les descriptions de paramètres suivantes.

Langage

Paramètre

Description

Java/Scala

Main JAR Resource

Le chemin OSS vers le package JAR. Exemple : oss://dw-1127/db_home/spark-examples_2.12-3.2.0.jar.

Main Class

La classe principale de votre package JAR compilé. Le nom de la classe principale dans le code exemple est org.apache.spark.examples.SparkPi.

Parameter

Les arguments à transmettre à votre code. Vous pouvez configurer ce champ avec des paramètres dynamiques au format ${var}.

Remarque

Dans cet exemple, le paramètre dynamique ${var} peut être défini sur 1000.

Configuration Item

Les paramètres d'exécution du programme Spark. Pour plus d'informations, consultez la rubrique Paramètres de configuration des applications Spark. Exemple :

spark.driver.resourceSpec:medium

Python

Préparation du fichier Python et des données

Suivez ces étapes pour télécharger le fichier de données de test et le code exemple vers OSS. Cela permet au code exemple de la configuration du nœud de lire le fichier de données de test.

  1. Préparez les données de test.

    Créez un fichier nommé data.txt et ajoutez-y le contenu suivant.

    Hello,Dataworks
    Hello,OSS
  2. Rédigez le code exemple.

    Créez un fichier nommé spark_oss.py et ajoutez le contenu suivant au fichier spark_oss.py.

    import sys
    
    from pyspark.sql import SparkSession
    
    # Initialize Spark.
    spark = SparkSession.builder.appName('OSS Example').getOrCreate()
    # Read the specified file. The file path is specified by the value of the argument passed to the job.
    textFile = spark.sparkContext.textFile(sys.argv[1])
    # Calculate and print the number of lines in the file.
    print("File total lines: " + str(textFile.count()))
    # Print the first line of the file.
    print("First line is: " + textFile.first())
    
  3. Téléchargez les données de test et le code exemple vers OSS.

    1. Connectez-vous à la console OSS. Dans le volet de navigation de gauche, cliquez sur Buckets.

    2. Sur la page Buckets, cliquez sur Create Bucket. Dans le panneau Create Bucket, créez un bucket dans la même région que votre cluster AnalyticDB for MySQL.

      Remarque

      Cette rubrique utilise un bucket nommé dw-1127 à titre d'exemple.

    3. Créez un répertoire de stockage externe.

      Une fois la création terminée, cliquez sur Enter Bucket. Sur la page Files, cliquez sur Create Directory, puis définissez le paramètre Catalog Name sur db_home.

    4. Téléchargez le fichier de données de test data.txt et le fichier de code exemple spark_oss.py dans le répertoire db_home. Pour plus d'informations, consultez la rubrique Téléchargement d'objets.

Configuration du nœud ADB Spark

Configurez le contenu du nœud ADB Spark en vous basant sur les descriptions de paramètres suivantes.

Langage

Paramètre

Description

Python

Main Package

Le chemin vers le fichier de code exemple. Exemple : oss://dw-1127/db_home/spark_oss.py.

Parameter

Les arguments à transmettre à votre code. Pour cet exemple, utilisez le chemin de stockage du fichier de données de test. Exemple : oss://dw-1127/db_home/data.txt.

Configuration Item

Les paramètres d'exécution du programme Spark. Pour plus d'informations, consultez la rubrique Paramètres de configuration des applications Spark. Exemple :

spark.driver.resourceSpec:medium

Étape 2 : Débogage du nœud ADB Spark

  1. Configurez les propriétés de débogage du nœud ADB Spark.

    Dans le volet Run Configuration situé à droite de l'éditeur de nœuds, configurez les paramètres Compute Resource, ADB Computing Resource Group, Resource Group et Compute Units.

    Type de paramètre

    Paramètre

    Description

    Compute Resource

    Compute Resource

    Sélectionnez le moteur de calcul AnalyticDB for Spark associé.

    ADB Computing Resource Group

    Sélectionnez le groupe de ressources de job que vous avez créé dans le cluster AnalyticDB for MySQL. Pour plus d'informations, consultez la rubrique Présentation des groupes de ressources.

    Resource Group

    Resource Group

    Sélectionnez le groupe de ressources qui a réussi le test de connectivité lors de l'association du moteur de calcul.

    Compute Units

    Ce nœud utilise le nombre d'unités de calcul (CU) par défaut. Vous n'avez pas besoin de modifier cette valeur.

  2. Déboguez et exécutez le nœud ADB Spark.

    Pour exécuter la tâche du nœud, cliquez sur Save puis sur Run.

Étape 3 : Planification du nœud ADB Spark

  1. Configurez les propriétés de planification du nœud ADB Spark.

    Pour exécuter la tâche du nœud périodiquement, ouvrez le volet Scheduling Settings situé à droite de l'éditeur de nœuds. Dans la section Scheduling Policy, configurez les paramètres suivants selon vos besoins. Pour plus d'informations sur les autres paramètres, consultez la rubrique Configuration de la planification d'un nœud.

    Paramètre

    Description

    Compute Resource

    Sélectionnez le moteur de calcul AnalyticDB for Spark associé.

    ADB Computing Resource Group

    Sélectionnez le groupe de ressources de job que vous avez créé dans le cluster AnalyticDB for MySQL. Pour plus d'informations, consultez la rubrique Présentation des groupes de ressources.

    Resource Group

    Sélectionnez le groupe de ressources qui a réussi le test de connectivité lors de l'association du moteur de calcul.

    Compute Units

    Ce nœud utilise le nombre d'unités de calcul (CU) par défaut. Vous n'avez pas besoin de modifier cette valeur.

  2. Publiez le nœud ADB Spark.

    Après avoir configuré la tâche du nœud, vous devez publier le nœud. Pour plus d'informations, consultez la rubrique Publication d'un nœud ou d'un workflow.

Étapes suivantes

Après la publication de la tâche, vous pouvez consulter son statut d'exécution dans Operation Center. Pour plus d'informations, consultez la rubrique Prise en main d'Operation Center.