Le nœud Lindorm Spark SQL dans DataWorks vous permet de développer et de planifier périodiquement des tâches Lindorm Spark SQL. Cette rubrique décrit la procédure principale pour utiliser un nœud Lindorm Spark SQL lors du développement de tâches.
Contexte
Lindorm est un service de calcul distribué bâti sur une architecture cloud-native. Il prend en charge les modèles de calcul de l'édition communautaire, est compatible avec les interfaces Spark et s'intègre profondément au moteur de stockage Lindorm. En tirant parti des fonctionnalités sous-jacentes de stockage des données et des capacités d'indexation, il exécute efficacement les jobs distribués. Il est idéal pour des scénarios tels que le traitement de volumes massifs de données, l'analyse interactive, l'apprentissage automatique et le calcul graphique.
Prérequis
-
(Facultatif, requis pour les utilisateurs RAM) L'utilisateur RAM qui développe les tâches doit être ajouté à l'espace de travail cible et se voir attribuer le rôle Development ou Workspace Administrator (à attribuer avec prudence en raison des autorisations étendues). Pour plus de détails sur l'ajout de membres, consultez la rubrique Ajouter des membres à un espace de travail.
RemarqueSi vous utilisez un compte Alibaba Cloud, ignorez cette étape.
Une instance Lindorm a été créée et associée à l'espace de travail DataWorks. Pour plus de détails, consultez la rubrique Associer une ressource de calcul Lindorm.
Créer un nœud Lindorm Spark SQL
Pour obtenir des instructions sur la création d'un nœud, consultez la rubrique Créer un nœud Lindorm Spark SQL.
Développer un nœud Lindorm Spark SQL
Lorsque vous écrivez le code de tâche dans l'éditeur SQL, vous pouvez définir des variables au format ${variable_name} et leur attribuer des valeurs dans le volet Run Configuration ou Scheduling Settings situé à droite de la page d'édition du nœud. Voici un exemple.
CREATE TABLE IF NOT EXISTS lindorm_table_job (
id INT,
name STRING,
data STRING
)
USING parquet
PARTITIONED BY (partition_date DATE);
INSERT OVERWRITE TABLE lindorm_table_job PARTITION (partition_date='${var}')
VALUES (1, 'Alice', 'Sample data 1'), (2, 'Bob', 'Sample data 2');
Dans l'exemple, le paramètre de variable ${var} peut être défini sur 2025-04-25. La définition de ce paramètre insère des données dans une partition spécifique de la table lindorm_table_job, ce qui permet le passage dynamique de paramètres dans les scénarios de planification. Pour plus de détails sur les paramètres de planification, consultez la rubrique Sources et expressions des paramètres de planification.
Pour plus d'informations sur les opérations Lindorm Spark SQL, consultez la rubrique Référence SQL.
Déboguer un nœud Lindorm Spark SQL
-
Configurez les propriétés de débogage.
Dans le volet Run Configuration situé à droite du nœud, configurez les éléments Compute Resource, Lindorm Resource Group et Resource Group. Les paramètres sont décrits ci-dessous.
Paramètre
Description
Compute Resource
Sélectionnez la ressource de calcul Lindorm associée.
Lindorm Resource Group
Sélectionnez le groupe de ressources Lindorm spécifié lors de l'association de la ressource de calcul Lindorm.
Resource Group
Sélectionnez un groupe de ressources ayant réussi le test de connectivité lors de l'association de la ressource de calcul Lindorm Spark.
Script parameters
Lorsque vous configurez le contenu du nœud, définissez des variables au format
${parameter_name}. Dans Script Parameters, configurez le Parameter name et la Parameter Value. Lors de l'exécution de la tâche, les variables sont remplacées dynamiquement par leurs valeurs réelles. Pour plus de détails, consultez la rubrique Sources et expressions des paramètres de planification.Spark parameter
Paramètres d'exécution pour le programme Spark. Pour plus d'informations sur la configuration des propriétés Spark, consultez la rubrique Configurations des jobs.
-
Déboguez et exécutez le nœud.
Pour exécuter la tâche du nœud, cliquez sur Save puis sur Run pour lancer la tâche.
Étapes suivantes
Configurer la planification des nœuds : Si les nœuds du répertoire du projet doivent être planifiés et exécutés périodiquement, configurez la Scheduling Policy dans le volet Scheduling Settings situé à droite du nœud afin de définir les propriétés de planification correspondantes.
Déployer un nœud : Si la tâche doit être déployée dans l'environnement de production pour s'exécuter, cliquez sur l'icône
de la page pour initier le processus de déploiement et déployer la tâche dans l'environnement de production. Les nœuds du répertoire du projet ne sont planifiés périodiquement qu'après leur déploiement dans l'environnement de production.Data Map (données de table Lindorm) : Accédez à Data Map pour collecter les informations de métadonnées pour Lindorm.