Utilisez un nœud ADB Spark dans DataWorks pour développer, planifier périodiquement et intégrer des tâches AnalyticDB Spark avec d'autres jobs. Cette rubrique décrit le flux de travail principal pour le développement de tâches à l'aide d'un nœud ADB Spark.
Informations générales
ADB Spark est un moteur de calcul intégré au service AnalyticDB, conçu pour exécuter des tâches de traitement de données Apache Spark à grande échelle. Il prend en charge l'analyse de données en temps réel, les requêtes complexes et les applications d'apprentissage automatique. Compatible avec Java, Scala et Python, il simplifie le développement et s'adapte automatiquement pour optimiser les performances et les coûts. Vous pouvez configurer les tâches en téléchargeant les fichiers Jar ou .py pertinents. ADB Spark convient parfaitement à divers secteurs nécessitant un traitement efficace de volumes massifs de données et l'obtention d'informations en temps réel. Cela permet aux entreprises d'extraire des informations précieuses de leurs données afin de stimuler leur croissance commerciale.
Prérequis
Prérequis pour AnalyticDB for MySQL :
Vous avez créé un cluster AnalyticDB for MySQL Basic Edition dans la même région que votre espace de travail DataWorks. Pour plus d'informations, consultez la rubrique Création d'un cluster.
-
Vous avez configuré un groupe de ressources de job dans votre cluster AnalyticDB for MySQL. Pour plus d'informations, consultez la rubrique Création d'un groupe de ressources de job.
RemarqueLorsque vous utilisez DataWorks pour développer des applications Spark, vous devez créer un groupe de ressources de job.
Si vous utilisez OSS pour le stockage, assurez-vous que le bucket OSS se trouve dans la même région que votre cluster AnalyticDB for MySQL.
Prérequis pour DataWorks :
Vous disposez d'un espace de travail avec l'option Use Data Studio (New Version) sélectionnée et un groupe de ressources associé. Pour plus d'informations, consultez la rubrique Création d'un espace de travail.
Le groupe de ressources doit se trouver dans le même VPC que le cluster AnalyticDB for MySQL, et vous devez ajouter les adresses IP du groupe de ressources à la liste d'autorisation du cluster AnalyticDB for MySQL. Pour plus d'informations, consultez la rubrique Configuration d'une liste d'autorisation.
Vous avez ajouté l'instance de cluster AnalyticDB for MySQL à DataWorks en tant que moteur de calcul. Le type de moteur de calcul doit être AnalyticDB for Spark. DataWorks teste la connectivité du moteur de calcul à l'aide du groupe de ressources. Pour plus d'informations, consultez la rubrique Association d'un moteur de calcul.
Vous avez créé un dossier de workflow. Pour plus d'informations, consultez la rubrique Dossier de workflow.
Vous avez créé un nœud ADB Spark. Pour plus d'informations, consultez la rubrique Création d'un nœud pour un workflow.
Étape 1 : Développement du nœud ADB Spark
Dans l'éditeur de nœuds ADB Spark, configurez le contenu du nœud selon le type de Language sélectionné, en utilisant le package exemple spark-examples_2.12-3.2.0.jar ou le fichier spark_oss.py. Pour plus d'informations sur le développement du contenu du nœud, consultez la rubrique Développement d'une application Spark à l'aide de l'outil de ligne de commande spark-submit.
Java et Scala
Préparation du fichier JAR
Téléchargez le package JAR exemple vers OSS. Ce package est requis par le nœud pour exécuter la tâche.
-
Préparez le package JAR exemple.
Téléchargez le package JAR exemple spark-examples_2.12-3.2.0.jar destiné à être utilisé dans le nœud ADB Spark.
-
Téléchargez le code exemple vers OSS.
Connectez-vous à la console OSS. Dans le volet de navigation de gauche, cliquez sur Buckets.
-
Sur la page Buckets, cliquez sur Create Bucket. Dans le panneau Create Bucket, créez un bucket dans la même région que votre cluster AnalyticDB for MySQL.
RemarqueCette rubrique utilise un bucket nommé
dw-1127à titre d'exemple. -
Créez un répertoire de stockage externe.
Une fois la création terminée, cliquez sur Go to Bucket. Sur la page Files, cliquez sur Create Directory, puis définissez le paramètre Catalog Name sur
db_home. Téléchargez le fichier de code exemple
spark-examples_2.12-3.2.0.jardans le répertoiredb_home. Pour plus d'informations, consultez la rubrique Téléchargement d'objets.
Configuration du nœud ADB Spark
Configurez le contenu du nœud ADB Spark en vous basant sur les descriptions de paramètres suivantes.
|
Langage |
Paramètre |
Description |
|
Java/Scala |
Main JAR Resource |
Le chemin OSS vers le package JAR. Exemple : |
|
Main Class |
La classe principale de votre package JAR compilé. Le nom de la classe principale dans le code exemple est |
|
|
Parameter |
Les arguments à transmettre à votre code. Vous pouvez configurer ce champ avec des paramètres dynamiques au format Remarque
Dans cet exemple, le paramètre dynamique |
|
|
Configuration Item |
Les paramètres d'exécution du programme Spark. Pour plus d'informations, consultez la rubrique Paramètres de configuration des applications Spark. Exemple :
|
Python
Préparation du fichier Python et des données
Suivez ces étapes pour télécharger le fichier de données de test et le code exemple vers OSS. Cela permet au code exemple de la configuration du nœud de lire le fichier de données de test.
-
Préparez les données de test.
Créez un fichier nommé
data.txtet ajoutez-y le contenu suivant.Hello,Dataworks Hello,OSS -
Rédigez le code exemple.
Créez un fichier nommé
spark_oss.pyet ajoutez le contenu suivant au fichierspark_oss.py.import sys from pyspark.sql import SparkSession # Initialize Spark. spark = SparkSession.builder.appName('OSS Example').getOrCreate() # Read the specified file. The file path is specified by the value of the argument passed to the job. textFile = spark.sparkContext.textFile(sys.argv[1]) # Calculate and print the number of lines in the file. print("File total lines: " + str(textFile.count())) # Print the first line of the file. print("First line is: " + textFile.first()) -
Téléchargez les données de test et le code exemple vers OSS.
Connectez-vous à la console OSS. Dans le volet de navigation de gauche, cliquez sur Buckets.
-
Sur la page Buckets, cliquez sur Create Bucket. Dans le panneau Create Bucket, créez un bucket dans la même région que votre cluster AnalyticDB for MySQL.
RemarqueCette rubrique utilise un bucket nommé
dw-1127à titre d'exemple. -
Créez un répertoire de stockage externe.
Une fois la création terminée, cliquez sur Enter Bucket. Sur la page Files, cliquez sur Create Directory, puis définissez le paramètre Catalog Name sur
db_home. Téléchargez le fichier de données de test
data.txtet le fichier de code exemplespark_oss.pydans le répertoiredb_home. Pour plus d'informations, consultez la rubrique Téléchargement d'objets.
Configuration du nœud ADB Spark
Configurez le contenu du nœud ADB Spark en vous basant sur les descriptions de paramètres suivantes.
|
Langage |
Paramètre |
Description |
|
Python |
Main Package |
Le chemin vers le fichier de code exemple. Exemple : |
|
Parameter |
Les arguments à transmettre à votre code. Pour cet exemple, utilisez le chemin de stockage du fichier de données de test. Exemple : |
|
|
Configuration Item |
Les paramètres d'exécution du programme Spark. Pour plus d'informations, consultez la rubrique Paramètres de configuration des applications Spark. Exemple :
|
Étape 2 : Débogage du nœud ADB Spark
-
Configurez les propriétés de débogage du nœud ADB Spark.
Dans le volet Run Configuration situé à droite de l'éditeur de nœuds, configurez les paramètres Compute Resource, ADB Computing Resource Group, Resource Group et Compute Units.
Type de paramètre
Paramètre
Description
Compute Resource
Compute Resource
Sélectionnez le moteur de calcul AnalyticDB for Spark associé.
ADB Computing Resource Group
Sélectionnez le groupe de ressources de job que vous avez créé dans le cluster AnalyticDB for MySQL. Pour plus d'informations, consultez la rubrique Présentation des groupes de ressources.
Resource Group
Resource Group
Sélectionnez le groupe de ressources qui a réussi le test de connectivité lors de l'association du moteur de calcul.
Compute Units
Ce nœud utilise le nombre d'unités de calcul (CU) par défaut. Vous n'avez pas besoin de modifier cette valeur.
-
Déboguez et exécutez le nœud ADB Spark.
Pour exécuter la tâche du nœud, cliquez sur Save puis sur Run.
Étape 3 : Planification du nœud ADB Spark
-
Configurez les propriétés de planification du nœud ADB Spark.
Pour exécuter la tâche du nœud périodiquement, ouvrez le volet Scheduling Settings situé à droite de l'éditeur de nœuds. Dans la section Scheduling Policy, configurez les paramètres suivants selon vos besoins. Pour plus d'informations sur les autres paramètres, consultez la rubrique Configuration de la planification d'un nœud.
Paramètre
Description
Compute Resource
Sélectionnez le moteur de calcul AnalyticDB for Spark associé.
ADB Computing Resource Group
Sélectionnez le groupe de ressources de job que vous avez créé dans le cluster AnalyticDB for MySQL. Pour plus d'informations, consultez la rubrique Présentation des groupes de ressources.
Resource Group
Sélectionnez le groupe de ressources qui a réussi le test de connectivité lors de l'association du moteur de calcul.
Compute Units
Ce nœud utilise le nombre d'unités de calcul (CU) par défaut. Vous n'avez pas besoin de modifier cette valeur.
-
Publiez le nœud ADB Spark.
Après avoir configuré la tâche du nœud, vous devez publier le nœud. Pour plus d'informations, consultez la rubrique Publication d'un nœud ou d'un workflow.
Étapes suivantes
Après la publication de la tâche, vous pouvez consulter son statut d'exécution dans Operation Center. Pour plus d'informations, consultez la rubrique Prise en main d'Operation Center.