Utilisez les nœuds Serverless Kyuubi pour développer et planifier périodiquement des tâches Kyuubi sur des ressources de calcul EMR Serverless Spark et les intégrer à d'autres jobs DataWorks.
Remarques relatives à l'utilisation
-
Limitations des ressources de calcul : seules les ressources de calcul EMR Serverless Spark liées sont prises en charge. Assurez-vous que le groupe de ressources et la ressource de calcul peuvent communiquer via le réseau.
Contraintes relatives aux groupes de ressources : seuls les groupes de ressources serverless peuvent exécuter ce type de tâche.
-
(Facultatif, pour les utilisateurs RAM) L'utilisateur Resource Access Management (RAM) chargé du développement des tâches doit être ajouté à l'espace de travail et recevoir le rôle Development ou Workspace Administrator (ce rôle inclut des autorisations étendues et doit être accordé avec prudence). Pour plus d'informations, consultez la rubrique Ajouter des membres à un espace de travail.
Si vous utilisez un compte racine, ignorez cette étape.
Créer un nœud
Pour obtenir des instructions, consultez la rubrique Créer un nœud.
Développer le nœud
Rédigez le code de la tâche dans l'éditeur SQL. Définissez les variables à l'aide de la syntaxe ${nom_variable}, puis attribuez-leur des valeurs dans la section Scheduling Parameters des Scheduling Settings situées à droite. Le système remplace les variables par les valeurs attribuées au moment de l'exécution. Pour plus d'informations, consultez la rubrique Sources et expressions des paramètres de planification. Exemple :
SHOW TABLES; SELECT * FROM kyuubi040702 WHERE age >= '${a}'; -- Use with a scheduling parameter.
Une instruction SQL ne peut pas dépasser 130 Ko.
Déboguer le nœud
-
Dans la section Run Configuration, configurez les paramètres tels que Compute Resource et Resource Group.
Paramètre
Description
Compute Resource
Sélectionnez une ressource de calcul EMR Serverless Spark liée. Vous devez d'abord lier une ressource de calcul EMR Serverless Spark. Si aucune ressource de calcul n'est disponible, sélectionnez Create Compute Resource dans la liste déroulante pour en créer une.
Resource Group
Sélectionnez un groupe de ressources lié à l'espace de travail.
Script Parameters
Si vous définissez des variables à l'aide de la syntaxe
${nom_parametre}dans le contenu du nœud, spécifiez le Parameter name et la Parameter Value dans la section Script Parameters. Le système remplace les variables par les valeurs réelles au moment de l'exécution. Pour plus d'informations, consultez la rubrique Sources et expressions des paramètres de planification.ServerlessSpark Node Parameters
Paramètres de propriété Spark intégrés. Pour plus d'informations, consultez les paramètres de propriété Spark open source et les paramètres de configuration EMR Serverless Spark. Format de configuration :
"spark.eventLog.enabled": false.RemarqueVous pouvez définir des paramètres Spark globaux au niveau de l'espace de travail pour les appliquer à tous les modules DataWorks, et configurer s'ils ont la priorité sur les paramètres au niveau du module. Pour plus d'informations, consultez la rubrique Configurer les paramètres Spark globaux.
-
Dans la barre d'outils située en haut de l'éditeur de nœud, cliquez sur Run pour exécuter la tâche.
ImportantAvant de déployer le nœud, synchronisez les Serverlessspark Node Parameters depuis la section Run Configuration vers la section Serverlessspark Node Parameters des Scheduling Settings.
Étapes suivantes
Configurer la planification des nœuds : si vous devez exécuter un nœud périodiquement, configurez sa Scheduling Policy dans le volet Scheduling Settings situé à droite.
Publier un nœud : pour exécuter une tâche dans l'environnement de production, cliquez sur l'icône
afin de publier le nœud. Un nœud n'est exécuté selon la planification qu'après sa publication dans l'environnement de production.O&M des tâches : après la publication d'une tâche, surveillez ses exécutions périodiques dans le Operation Center. Pour plus d'informations, consultez la rubrique Prise en main du Operation Center.