Tous les produits
Search
Centre de documentation

DataWorks:Nœud CDH MR

Dernière mise à jour :Aug 10, 2026

Dans DataWorks, créez un nœud CDH MR (MapReduce) pour traiter des ensembles de données massifs. Cette rubrique décrit la configuration et l'utilisation des nœuds CDH MR dans DataWorks.

Prérequis

  • Créez un cluster Alibaba Cloud CDH et associez-le à un espace de travail DataWorks. Pour plus d'informations, consultez la section Associer un moteur de calcul CDH.

  • (Facultatif, pour les utilisateurs RAM) Ajoutez l'utilisateur RAM chargé du développement des tâches à l'espace de travail correspondant et attribuez-lui le rôle Development ou Workspace Administrator. Le rôle Workspace Administrator dispose d'autorisations étendues ; attribuez-le avec prudence. Pour plus d'informations sur l'ajout de membres, consultez la section Ajouter des membres à un espace de travail.

    Remarque

    Si vous utilisez un compte Alibaba Cloud, ignorez cette étape.

  • Configurez une source de données Hive dans DataWorks et vérifiez que celle-ci a passé le test de connectivité. Pour plus d'informations, consultez la section Gérer les sources de données.

Créer une ressource CDH JAR

Téléchargez le package JAR de votre tâche vers DataWorks, puis planifiez son exécution périodique en tant que tâche CDH Spark.

  1. Pour plus d'informations, consultez la section Gestion des ressources. Téléchargez le package JAR depuis votre machine locale vers le répertoire de stockage des ressources JAR. Cliquez sur Upload pour télécharger la ressource JAR.

  2. Sélectionnez le chemin de stockage, la source de données et le groupe de ressources.

  3. Cliquez sur Save.

Créer un nœud

Pour obtenir des instructions, consultez la section Créer un nœud.

Développer le nœud

Sur la page de l'éditeur du nœud CDH MR, procédez comme suit.

  1. Ouvrez le nœud CDH MR créé précédemment et accédez à la page d'édition du code.

  2. Dans le volet de navigation de gauche, localisez la ressource à référencer sous Resource Management, cliquez dessus avec le bouton droit de la souris, puis sélectionnez Reference Resource.

  3. Une fois la ressource référencée, si une instruction au format ##@resource_reference{""} apparaît sur la page d'édition du code du nœud CDH, le référencement est réussi. Exécutez ensuite la commande suivante pour lancer la tâche. Le package de ressources, le nom du bucket et les informations de chemin dans la commande sont fournis à titre d'exemple. Remplacez-les par vos propres informations.

##@resource_reference{"onaliyun_mr_wordcount-1.0-SNAPSHOT.jar"}
onaliyun_mr_wordcount-1.0-SNAPSHOT.jar cn.apache.hadoop.onaliyun.examples.EmrWordCount oss://onaliyun-bucket-2/cdh/datas/wordcount02/inputs oss://onaliyun-bucket-2/cdh/datas/wordcount02/outputs

Déboguer le nœud

  1. Dans la section Compute Resource de Run Configuration, configurez la ressource de calcul et le groupe de ressources.

    1. Pour Compute Resource, sélectionnez le cluster CDH enregistré dans DataWorks.

    2. Pour Resource Group, sélectionnez le groupe de ressources de planification qui a passé le test de connectivité avec la source de données. Pour plus d'informations, consultez la section Solutions de connectivité réseau.

  2. Dans la barre d'outils située en haut de l'éditeur de nœud, cliquez sur Run.

Étapes suivantes

  • Configurer la planification des nœuds : Pour exécuter un nœud périodiquement, configurez sa Scheduling Policy dans le panneau Scheduling Settings situé à droite.

  • Publier un nœud : Pour exécuter une tâche dans l'environnement de production, cliquez sur l'icône image afin de publier le nœud. Un nœud ne s'exécute selon la planification qu'après sa publication dans l'environnement de production.

  • Task O&M : Après la publication d'une tâche, surveillez ses exécutions périodiques dans Operation Center. Pour plus d'informations, consultez la section Prise en main de Operation Center.