Tous les produits
Search
Centre de documentation

DataWorks:DataStudio (legacy) : Enregistrer une ressource de calcul CDH

Dernière mise à jour :Aug 10, 2026

Enregistrez des clusters Cloudera’s Distribution Including Apache Hadoop (CDH) ou Cloudera Data Platform (CDP) dans DataWorks pour réaliser des opérations de développement et de gouvernance des données, telles que le développement de tâches, la planification, Data Map (gestion des métadonnées) et Data Quality.

Informations générales

  • CDH est la distribution open source de Cloudera. Elle inclut des fonctionnalités prêtes à l'emploi, telles que la gestion, la surveillance et le diagnostic du cluster, et prend en charge divers composants pour exécuter des workflows big data de bout en bout.

  • CDP est une plateforme de données publique qui collecte et consolide les données clients provenant de plusieurs plateformes. Elle rassemble des données en temps réel pour créer des profils de données utilisateur individuels.

Vous pouvez enregistrer des clusters CDH et CDP dans DataWorks pour le développement de tâches, la planification, la gestion des métadonnées dans Data Map et les vérifications Data Quality.

Prérequis

Limites

  • Vous ne pouvez exécuter des tâches sur un cluster CDH ou CDP qu'en utilisant le nouveau groupe de ressources serverless (recommandé) ou un groupe de ressources exclusif hérité pour la planification.

    Remarque
    • Un groupe de ressources serverless est un groupe de ressources polyvalent utilisable dans divers scénarios, tels que la synchronisation des données et la planification des tâches. Pour savoir comment acheter un groupe de ressources serverless, consultez la rubrique Utiliser un groupe de ressources serverless. Si vous avez déjà acheté un groupe de ressources exclusif hérité pour la planification, vous pouvez également l'utiliser pour exécuter des tâches CDH ou CDP. Pour plus d'informations, consultez la rubrique Utiliser un groupe de ressources exclusif pour la planification.

    • Les nouveaux utilisateurs ne peuvent acheter que des groupes de ressources serverless.

    • Si vous utilisez un cluster d'une Custom Version pour l'enregistrement dans DataWorks, vous ne pouvez utiliser qu'un groupe de ressources exclusif hérité pour la planification. Pour plus d'informations sur les versions de cluster, consultez l'étape Étape 2 : Enregistrer un cluster CDH ou CDP.

  • Vous pouvez enregistrer des clusters CDH ou CDP uniquement dans les régions suivantes : Chine (Pékin), Chine (Shanghai), Chine (Hangzhou), Chine (Shenzhen), Chine (Zhangjiakou), Chine (Chengdu) et Allemagne (Francfort).

Étape 1 : Accéder à la page d'enregistrement

  1. Connectez-vous à la console DataWorks. Dans la région cible, cliquez sur More > Management Center dans le volet de navigation de gauche. Sélectionnez un espace de travail dans la liste déroulante et cliquez sur Go to Management Center.

  2. Dans le volet de navigation de gauche, cliquez sur Clusters pour accéder à la page Clusters. Cliquez sur Register Cluster, sélectionnez CDH pour Open Source Cluster Type, puis accédez à la page d'enregistrement du cluster.

Étape 2 : Enregistrer un cluster CDH ou CDP

Remarque
  • Si votre espace de travail est en mode standard, vous devez enregistrer des clusters distincts pour l'environnement de développement et l'environnement de production. Pour plus d'informations sur les modes d'espace de travail, consultez la rubrique Différences entre les modes d'espace de travail.

  • Les opérations de développement pour CDP et CDH dans DataWorks sont presque identiques. Cette rubrique utilise un cluster CDH comme exemple.

  1. Configurez les informations de base du cluster.

    Paramètre

    Description

    Display Name of Cluster

    Le nom d'affichage du cluster dans DataWorks. Le nom doit être unique.

    Cluster Version

    Sélectionnez la version du cluster à enregistrer.

    DataWorks propose les versions suivantes : CDH 5.16.2, CDH 6.1.1, CDH 6.2.1, CDH 6.3.2 et CDP 7.1.7. Les versions des composants associées à ces versions de cluster sont fixes. Pour plus d'informations, consultez Informations de connexion au cluster. Si ces versions de cluster ne répondent pas à vos besoins professionnels, vous pouvez sélectionner Custom Version et configurer les versions des composants selon vos besoins.

    Remarque
    • Consultez l'interface utilisateur pour obtenir les informations les plus récentes.

    • Si vous utilisez un cluster d'une Custom Version pour l'enregistrement dans DataWorks, vous ne pouvez utiliser qu'un groupe de ressources exclusif hérité pour la planification. Une fois l'enregistrement terminé, vous devez soumettre un ticket pour demander au support technique d'initialiser l'environnement.

    Cluster Name

    La source des informations de configuration du cluster que vous enregistrez. Sélectionnez un cluster déjà enregistré dans un autre espace de travail ou créez un nouveau cluster.

    • Cluster enregistré : Réutilise la configuration d'un cluster déjà enregistré dans un autre espace de travail.

    • Nouveau cluster : Vous devez configurer les informations du cluster que vous enregistrez.

  2. Configurez les informations de connexion au cluster.

    Sélectionnez les versions des composants de votre cluster et saisissez les informations de point de terminaison obtenues. Pour plus d'informations, consultez la rubrique Préparatifs : Obtenir les informations du cluster CDH ou CDP et configurer la connectivité réseau. Sur le nœud principal du cluster CDH, exécutez la commande java -jar dw-tools.jar admin admin pour obtenir les informations d'hôte et d'URL pour chaque composant du cluster. Utilisez ensuite les adresses de connexion renvoyées pour remplir les champs suivants : HiveServer2 (format : jdbc:hive2://<host>:<port>/<database>), Metastore (format : thrift://<host>:<port>), Impala JDBC URL (format : jdbc:impala://<host>:<port>/<schema>), Yarn.ResourceManager.Address (format : http://<host>:<port>), Jobhistory.Webapp.Address (modifiez le port de l'adresse Yarn ResourceManager en 8088) et Presto JDBC URL (format : jdbc:presto://<host>:<port>/<catalog>/<schema>). Presto n'est pas un composant CDH par défaut. Spécifiez l'adresse d'accès en fonction de votre déploiement.

    Remarque

    Si vous accédez aux composants CDH par nom de domaine depuis un groupe de ressources serverless, vous devez configurer la résolution DNS faisant autorité pour les noms de domaine des composants CDH dans Alibaba Cloud DNS PrivateZone. Pour plus d'informations, consultez les rubriques Ajouter un domaine faisant autorité intégré et Définir une portée pour un nom de domaine.

  3. Ajoutez des fichiers de configuration du cluster.

    Vous pouvez télécharger des fichiers de configuration pour les composants requis. Pour obtenir les fichiers de configuration, consultez la rubrique Préparatifs : Obtenir les informations du cluster CDH ou CDP et configurer la connectivité réseau.

    Le tableau suivant décrit les fichiers de configuration.

    Fichier de configuration

    Description

    Scénarios

    core-site.xml

    Contient les configurations globales de la bibliothèque Hadoop Core, telles que les paramètres d'E/S courants pour HDFS et MapReduce.

    Ce fichier doit être téléchargé pour exécuter des tâches Spark ou MapReduce.

    hdfs-site.xml

    Contient les configurations liées à HDFS, telles que la taille des blocs de données, le nombre de réplicas et les noms de chemin.

    mapred-site.xml

    Configure les paramètres liés à MapReduce, tels que la méthode d'exécution et le comportement de planification des jobs MapReduce.

    Ce fichier doit être téléchargé pour exécuter des tâches MapReduce.

    yarn-site.xml

    Contient toutes les configurations liées aux démons YARN, telles que le gestionnaire de ressources, le gestionnaire de nœuds et l'environnement d'exécution des applications.

    Ce fichier doit être téléchargé pour exécuter des tâches Spark ou MapReduce, ou lorsque Kerberos est sélectionné comme type de mappage d'identité.

    hive-site.xml

    Contient divers paramètres pour configurer Hive, tels que les informations de connexion à la base de données, les paramètres Hive Metastore et le moteur d'exécution.

    Ce fichier doit être téléchargé lorsque Kerberos est sélectionné comme type de mappage d'identité.

    spark-defaults.conf

    Définit les configurations par défaut pour l'exécution des jobs Spark. Utilisez le fichier spark-defaults.conf pour prédéfinir des propriétés telles que la taille de la mémoire et le nombre de cœurs CPU. Les applications Spark appliquent ces paramètres lors de l'exécution.

    Ce fichier doit être téléchargé pour exécuter des tâches Spark.

    config.properties

    Contient les configurations du serveur Presto, telles que les propriétés globales pour les nœuds coordinateur et worker dans un cluster Presto.

    Ce fichier doit être téléchargé lorsque vous utilisez le composant Presto et sélectionnez OPEN LDAP ou Kerberos comme type de mappage d'identité.

    presto.jks

    Un fichier Java KeyStore (JKS) qui stocke les certificats de sécurité, y compris les clés privées et les certificats de clé publique. Dans Presto, le fichier presto.jks permet une communication chiffrée SSL/TLS entre les processus Presto pour un transfert sécurisé des données.

  4. Configurez l'identité d'accès par défaut.

    Compte utilisé pour accéder au cluster CDH lorsque DataWorks exécute des tâches. Les types de comptes pris en charge varient selon l'environnement.

    Remarque

    Lors de l'enregistrement d'un cluster, si vous définissez l'Default Access Identity sur un compte non lié au cluster et qu'aucun mappage d'identité n'est configuré (ou si le type de mappage est défini sur aucune authentification), toutes les tâches échouent.

    Environnement

    Identité d'accès par défaut

    Informations connexes

    Environnement de développement

    • Compte de cluster : Un compte de cluster spécifié accède au cluster CDH, indépendamment de la personne qui exécute la tâche CDH dans DataWorks, tel qu'un compte Alibaba Cloud ou un utilisateur RAM disposant d'autorisations de développement uniquement.

    • Compte mappé : Nécessite un mappage d'identité entre le compte de l'utilisateur et un compte de cluster. Lorsque la tâche s'exécute, le compte mappé accède au cluster CDH.

    Pour configurer un mappage d'identité, consultez la rubrique Configurer les mappages d'identité du cluster.

    Environnement de production

    • Compte de cluster : Un compte de cluster spécifié accède au cluster CDH, indépendamment de la personne qui exécute la tâche CDH dans DataWorks, tel que le propriétaire de la tâche, un compte Alibaba Cloud ou un utilisateur RAM.

    • Compte mappé : Nécessite un mappage d'identité entre le compte correspondant (propriétaire de la tâche, compte Alibaba Cloud ou utilisateur RAM) et un compte de cluster. Lorsque la tâche s'exécute, le compte mappé accède au cluster CDH.

  5. Cliquez sur Complete Registration pour enregistrer le cluster dans DataWorks.

Étape 3 : Initialiser le groupe de ressources

Initialisez le groupe de ressources lors du premier enregistrement d'un cluster ou après avoir modifié la configuration du service du cluster, ou après avoir mis à niveau une version de composant (par exemple, en modifiant le fichier core-site.xml). Cela garantit que le groupe de ressources peut accéder au cluster CDH et est correctement configuré pour exécuter des tâches de cluster CDH. Sur la page Clusters, recherchez le cluster CDH enregistré et cliquez sur Initialize Resource Group dans le coin supérieur droit. Sélectionnez le groupe de ressources requis et initialisez-le.

Remarque
  • DataWorks prend en charge l'exécution des tâches de cluster CDH uniquement en utilisant le nouveau groupe de ressources serverless (recommandé) ou un groupe de ressources exclusif hérité pour la planification. Par conséquent, vous ne pouvez initialiser que ces deux types de groupes de ressources. Si aucun groupe de ressources n'est disponible, créez-en un selon vos besoins. Pour plus d'informations, consultez les rubriques Utiliser un groupe de ressources serverless et Utiliser un groupe de ressources exclusif pour la planification.

  • Si vous utilisez un cluster d'une Custom Version pour l'enregistrement dans DataWorks, vous ne pouvez utiliser qu'un groupe de ressources exclusif hérité pour la planification. Une fois l'enregistrement terminé, vous devez soumettre un ticket pour demander au support technique d'initialiser l'environnement.

(Facultatif) Configurer une file d'attente de ressources YARN

Les files d'attente de ressources YARN partitionnent et isolent les ressources du cluster, garantissant que différents types de tâches utilisent les ressources de calcul équitablement sans interférence. Pour configurer une file d'attente de ressources YARN dédiée aux tâches d'un module spécifique, recherchez votre cluster CDH enregistré sur la page Clusters. Sous l'onglet YARN Resource Queue, cliquez sur Edit YARN resource queue pour configurer les paramètres.

(Facultatif) Configurer les propriétés Spark

Définissez des propriétés Spark dédiées pour les tâches dans différents modules.

  1. Sur la page Clusters, recherchez votre cluster CDH enregistré.

  2. Sous l'onglet Spark-related Parameter, cliquez sur le bouton Edit Spark properties pour accéder à la page de modification des propriétés Spark pour le cluster CDH.

  3. Cliquez sur le bouton Add sous un module, et saisissez le Spark Property Name et la Spark Property Value correspondante pour définir les propriétés Spark.

Étapes suivantes

  • Configurer les mappages d'identité du cluster : Si l'identité d'accès par défaut du cluster CDH n'est pas un compte de cluster spécifique, vous devez configurer un mappage d'identité entre le compte Alibaba Cloud et un compte de cluster. Ce mappage permet au compte Alibaba Cloud d'accéder au cluster CDH avec l'identité de cluster mappée pour l'isolation et le contrôle des autorisations de données.

  • Après avoir enregistré la ressource de calcul CDH, utilisez les nœuds liés à CDH dans DataStudio pour effectuer des opérations de développement de données.