Spark SQL est un moteur de requêtes distribué qui traite efficacement les données structurées. Dans DataWorks, utilisez un nœud CDH Spark SQL pour développer, planifier et intégrer des tâches CDH Spark SQL à d'autres jobs. Cette rubrique décrit la configuration et l'utilisation d'un nœud CDH Spark SQL.
Prérequis
-
Vous avez créé un cluster CDH Alibaba Cloud et l'avez associé à un espace de travail DataWorks. Pour plus d'informations, consultez la rubrique Associer un moteur de calcul CDH.
ImportantVous avez installé le composant Spark sur le cluster CDH et configuré les informations relatives à Spark lors de la liaison du cluster.
-
(Facultatif, pour les utilisateurs RAM) L'utilisateur RAM chargé du développement des tâches a été ajouté à l'espace de travail correspondant et s'est vu attribuer le rôle Development ou Workspace Administrator. Le rôle Workspace Administrator dispose d'autorisations étendues ; attribuez-le avec prudence. Pour plus d'informations sur l'ajout de membres, consultez la rubrique Ajouter des membres à un espace de travail.
RemarqueSi vous utilisez un compte Alibaba Cloud, ignorez cette étape.
Vous avez configuré une source de données Hive dans DataWorks et vérifié que celle-ci a réussi le test de connectivité. Pour plus d'informations, consultez la rubrique Gérer les sources de données.
Créer un nœud
Pour obtenir des instructions, consultez la rubrique Créer un nœud.
Développer le nœud
Rédigez le code de votre tâche dans l'éditeur SQL. Vous pouvez définir des variables dans votre code au format ${nom_variable}, puis leur attribuer des valeurs dans la section Scheduling Parameters du panneau Scheduling Settings. Cela permet de transmettre dynamiquement des paramètres au code lors des exécutions planifiées. Pour plus d'informations sur les paramètres de planification, consultez la rubrique Sources et expressions des paramètres de planification. L'exemple de code suivant illustre cette procédure :
CREATE TABLE IF NOT EXISTS test_spark.test_lineage_table_f1 (`id` BIGINT, `name` STRING)
PARTITIONED BY (`ds` STRING);
CREATE TABLE IF NOT EXISTS test_spark.test_lineage_table_t2 AS SELECT * FROM test_spark.test_lineage_table_f1;
INSERT INTO test_spark.test_lineage_table_t2 SELECT id,${var} FROM test_spark.test_lineage_table_f1;
Cet exemple crée les tables
test_lineage_table_f1ettest_lineage_table_t2dans la base de donnéestest_sparket copie les données de la tabletest_lineage_table_f1vers la tabletest_lineage_table_t2. Cet exemple est fourni à titre indicatif uniquement. Pour une utilisation réelle, remplacez l'environnement de base de données par le vôtre.Le paramètre
${var}est défini sur le champname.
Déboguer le nœud
-
Dans la section Compute Resource de la configuration Run Configuration, configurez les éléments Compute Resource et Resource Group.
Pour Compute Resource, sélectionnez le nom du cluster CDH que vous avez enregistré dans DataWorks.
Pour Resource group, sélectionnez un groupe de ressources de planification ayant réussi le test de connectivité à la source de données. Pour plus d'informations, consultez la rubrique Solution de connectivité réseau.
Dans la barre d'outils en haut de l'éditeur de nœud, cliquez sur Run.
Étapes suivantes
Configurer la planification des nœuds : Si vous devez exécuter un nœud périodiquement, configurez sa Scheduling Policy dans le panneau Scheduling Settings situé à droite.
Publier un nœud : Pour exécuter une tâche dans l'environnement de production, cliquez sur l'icône
afin de publier le nœud. Un nœud ne s'exécute selon la planification qu'après sa publication dans l'environnement de production.O&M des tâches : Une fois une tâche publiée, surveillez ses exécutions périodiques dans le Operation Center. Pour plus d'informations, consultez la rubrique Prise en main du Operation Center.