Tous les produits
Search
Centre de documentation

DataWorks:Associer une ressource de calcul CDH

Dernière mise à jour :Aug 25, 2026

Associez un cluster Cloudera Distribution for Hadoop (CDH) à votre espace de travail DataWorks en tant que ressource de calcul pour la synchronisation et le développement des données.

Prérequis

  • L'utilisateur RAM doit être membre de l'espace de travail et disposer du rôle d'administrateur de l'espace de travail.

  • Un cluster CDH est déployé.

    Remarque

    DataWorks prend en charge les clusters CDH déployés en dehors des instances ECS Alibaba Cloud, à condition que l'environnement de déploiement soit connecté à un VPC Alibaba Cloud. Vous pouvez généralement utiliser la méthode de connectivité réseau pour les sources de données locales afin d'établir une connexion stable.

  • Un groupe de ressources est associé à l'espace de travail et la connectivité réseau a été vérifiée.

Limites

  • Régions : Cette fonctionnalité est disponible dans les régions Chine (Pékin), Chine (Shanghai), Chine (Shenzhen), Chine (Hangzhou), Chine (Zhangjiakou), Chine (Chengdu) et Allemagne (Francfort).

  • Autorisations :

    Opérateur

    Autorisations requises

    Compte Alibaba Cloud

    Aucune autorisation supplémentaire n'est requise.

    Utilisateur RAM/Rôle RAM

Accéder à la page de liste des ressources de calcul

  1. Connectez-vous à la console DataWorks. Dans le volet de navigation de gauche, basculez vers la région cible et cliquez sur More > Management Center. Sélectionnez votre espace de travail dans la liste déroulante et cliquez sur Go to Management Center.

  2. Dans le volet de navigation de gauche, cliquez sur Computing Resources pour ouvrir la page de liste des ressources de calcul.

Associer une ressource de calcul CDH

Sur la page des ressources de calcul, configurez et associez une ressource de calcul CDH.

  1. Sélectionnez le type de ressource de calcul.

    1. Cliquez sur Associate Computing Resources pour accéder à la page Associate Computing Resources.

    2. Sur la page Associate Computing Resources, sélectionnez CDH comme type de ressource de calcul. La page de configuration Associate CDH Computing Resource s'affiche.

  2. Configurez la ressource de calcul CDH.

    Sur la page Associate CDH Computing Resource, configurez les paramètres suivants.

    Paramètre

    Description

    Cluster Version

    Sélectionnez la version du cluster que vous souhaitez enregistrer.

    DataWorks prend nativement en charge les versions CDH 5.16.2, CDH 6.1.1, CDH 6.2.1, CDH 6.3.2 et CDP 7.1.7, avec toutes les versions des composants figées dans les informations de connexion au cluster. Si aucune de ces versions ne répond à vos besoins, sélectionnez Custom Version et configurez les versions des composants selon vos besoins.

    Remarque
    • Les composants requis varient selon la version du cluster et sont affichés sur la page de configuration.

    • Si vous enregistrez un cluster avec une Custom Version, seuls les groupes de ressources exclusifs hérités pour la planification sont pris en charge. Après l'enregistrement, vous devez soumettre un ticket pour demander au support technique d'initialiser l'environnement.

    Cluster Name

    Sélectionnez le nom d'un cluster enregistré dans un autre espace de travail pour charger sa configuration, ou spécifiez un nom personnalisé pour créer une nouvelle configuration.

    Cluster Connection Information

    Informations de connexion Hive

    Utilisées pour soumettre des tâches Hive au cluster.

    • Format de configuration HiveServer2 : jdbc:hive2://<host>:<port>/<database>

    • Format de configuration Metastore : thrift://<host>:<port>

    Comment obtenir les paramètres : Pour plus d'informations, consultez la rubrique Obtenir les informations du cluster CDH ou CDP et configurer la connectivité réseau.

    Sélection de la version des composants : Le système détecte automatiquement les versions des composants pour le cluster actuel.

    Remarque

    Si vous utilisez un groupe de ressources serverless pour accéder aux composants CDH par nom de domaine, vous devez configurer la résolution faisant autorité pour les noms de domaine et définir leur portée d'application dans PrivateZone d'Alibaba Cloud DNS.

    Informations de connexion Impala

    Utilisées pour soumettre des tâches Impala.

    Format de configuration : jdbc:impala://<host>:<port>/<schema>.

    Informations de connexion Spark

    Sélectionnez une version Spark par défaut et configurez la connexion.

    Informations de connexion Yarn

    Configurations pour la soumission des tâches et l'affichage des détails des tâches.

    • Format de configuration Yarn.Resourcemanager.Address : http://<host>:<port>

      Remarque

      Adresse de soumission pour les tâches Spark ou MapReduce.

    • Format de configuration Jobhistory.Webapp.Address : http://<host>:<port2>

      Remarque

      Adresse de l'interface web du serveur JobHistory permettant d'afficher les détails des tâches terminées.

    Informations de connexion MapReduce

    Sélectionnez une version MapReduce par défaut et configurez la connexion.

    Informations de connexion Presto

    Utilisées pour soumettre des tâches Presto.

    Format de configuration de l'adresse JDBC : jdbc:presto://<host>:<port>/<catalog>/<schema>

    Remarque

    Il ne s'agit pas d'un composant CDH par défaut. Configurez ce composant selon vos besoins.

    Cluster Configuration File

    Configurer le fichier core-site

    Contient les configurations globales de la bibliothèque Hadoop Core, telles que les paramètres d'E/S communs pour HDFS et MapReduce.

    Téléchargez ce fichier pour exécuter des tâches Spark ou MapReduce.

    Configurer le fichier hdfs-site

    Contient les configurations liées à HDFS, telles que la taille des blocs de données, le nombre de réplicas et les noms de chemins.

    Configurer le fichier mapred-site

    Configure les paramètres MapReduce tels que le mode d'exécution et le comportement de planification.

    Téléchargez ce fichier pour exécuter des tâches MapReduce.

    Configurer le fichier yarn-site

    Contient toutes les configurations liées aux daemons YARN, telles que les paramètres d'environnement pour le gestionnaire de ressources, les gestionnaires de nœuds et l'exécution des applications.

    Téléchargez ce fichier si vous prévoyez d'exécuter des tâches Spark ou MapReduce ou d'utiliser Kerberos pour le mappage des comptes.

    Configurer le fichier hive-site

    Configure les paramètres Hive tels que les informations de connexion à la base de données, les paramètres Hive Metastore et le moteur d'exécution.

    Téléchargez ce fichier si vous sélectionnez Kerberos comme type de mappage de compte.

    Configurer le fichier spark-defaults

    Spécifie les configurations par défaut des tâches Spark, telles que la taille de la mémoire et le nombre de cœurs CPU. Les applications Spark appliquent ces paramètres lors de l'exécution.

    Téléchargez ce fichier pour exécuter des tâches Spark.

    Configurer le fichier config.properties

    Contient les configurations liées au serveur Presto, telles que les propriétés globales pour les nœuds coordinateur et worker du cluster Presto.

    Téléchargez ce fichier si vous utilisez le composant Presto et sélectionnez OPEN LDAP ou Kerberos comme type de mappage de compte.

    Configurer le fichier presto.jks

    Stocke les certificats de sécurité (clés privées et certificats de clé publique) pour la communication chiffrée SSL/TLS entre les processus Presto.

    Default Access Identity

    Pour utiliser une identité associée à un compte de cluster mappé, accédez à la page Computing Resources, puis, sous l'onglet Account Mappings, définissez le mappage d'identité du cluster.

    • Environnement de développement : Vous pouvez utiliser un compte de cluster ou le compte de cluster mappé de l'exécuteur de la tâche.

    • Environnement de production : Vous pouvez utiliser un compte de cluster, le compte de cluster mappé du propriétaire de la tâche, le compte de cluster mappé du compte Alibaba Cloud ou le compte de cluster mappé d'un utilisateur RAM.

    Computing Resource Instance Name

    Spécifiez un nom personnalisé pour l'instance de ressource de calcul. Lors de l'exécution, vous pouvez sélectionner une ressource de calcul pour une tâche en fonction de ce nom.

  3. Cliquez sur Confirm pour terminer la configuration.

Initialiser le groupe de ressources

Lorsque vous enregistrez un cluster pour la première fois ou modifiez les configurations des services du cluster (telles que core-site.xml), initialisez le groupe de ressources afin de garantir qu'il puisse accéder au cluster CDH après avoir configuré la connectivité réseau.

  1. Sur la page Computing Resources, localisez la ressource de calcul CDH que vous avez créée. Dans le coin supérieur droit, cliquez sur Initialize Resource Group.

  2. Cliquez sur Initialize à côté du groupe de ressources que vous souhaitez utiliser. Une fois le groupe de ressources initialisé, cliquez sur Determine.

(Facultatif) Configurer la file d'attente des ressources YARN

Sur la page Computing Resources, localisez votre cluster CDH associé. Sous l'onglet YARN Resource Queue, cliquez sur Edit YARN Resource Queue pour définir une file d'attente de ressources YARN dédiée pour les tâches de différents modules.

(Facultatif) Configurer les paramètres Spark

Vous pouvez définir des paramètres Spark dédiés pour les tâches de différents modules.

  1. Sur la page Computing Resources, localisez votre cluster CDH associé.

  2. Sous l'onglet Spark-related Parameter, cliquez sur Edit Spark Parameters pour accéder à la page où vous pouvez modifier les paramètres Spark du cluster CDH.

  3. Vous pouvez configurer les propriétés Spark en cliquant sur le bouton Add situé sous le module et en saisissant le Spark Property Name et la Spark Property Value.

(Facultatif) Configurer les paramètres d'hôte

La soumission des tâches peut échouer lorsqu'un groupe de ressources serverless DataWorks se connecte à un cluster CDH activé pour Kerberos.

Cela se produit car Kerberos s'appuie sur les noms d'hôte pour l'authentification. Si le DNS ne peut pas résoudre une adresse IP de cluster en son nom d'hôte enregistré auprès de Kerberos, l'authentification échoue.

La fonctionnalité de configuration d'hôte vous permet de définir un mappage statique IP-nom d'hôte pour une ressource de calcul CDH. DataWorks donne la priorité à ce mappage lors de l'accès au cluster, garantissant ainsi une authentification Kerberos réussie.

  1. Localisez la ressource de calcul CDH que vous souhaitez configurer et cliquez sur Host Configuration.

  2. Dans la boîte de dialogue qui s'affiche, saisissez la relation de mappage au format IP address hostname . Saisissez un seul mappage par ligne.

  3. Cliquez sur OK pour enregistrer la configuration.

  4. Après l'enregistrement, les informations de nom d'hôte configurées apparaissent sur la carte de la ressource de calcul, confirmant que la configuration est active.

Important
  • Exigence de format : L'IP address et le hostname doivent être séparés par un ou plusieurs espaces.

  • Intégrité de la configuration : Configurez des mappages corrects pour tous les nœuds critiques impliqués dans l'authentification Kerberos et l'exécution des tâches, tels que les NameNodes, les ResourceManagers et les NodeManagers.

  • Portée : Cette configuration d'hôte s'applique uniquement à la ressource de calcul actuelle, et non aux autres ressources de l'espace de travail.

Étapes suivantes

Après avoir configuré la ressource de calcul CDH, utilisez les nœuds liés à CDH dans Data Studio pour le développement des données.