Associez un cluster Cloudera Distribution for Hadoop (CDH) à votre espace de travail DataWorks en tant que ressource de calcul pour la synchronisation et le développement des données.
Prérequis
L'utilisateur RAM doit être membre de l'espace de travail et disposer du rôle d'administrateur de l'espace de travail.
-
Un cluster CDH est déployé.
RemarqueDataWorks prend en charge les clusters CDH déployés en dehors des instances ECS Alibaba Cloud, à condition que l'environnement de déploiement soit connecté à un VPC Alibaba Cloud. Vous pouvez généralement utiliser la méthode de connectivité réseau pour les sources de données locales afin d'établir une connexion stable.
-
Un groupe de ressources est associé à l'espace de travail et la connectivité réseau a été vérifiée.
Si vous utilisez un groupe de ressources serverless, il vous suffit de garantir la connectivité entre la ressource de calcul CDH et le groupe de ressources serverless.
Si vous utilisez un groupe de ressources exclusif hérité, vous devez garantir la connectivité entre la ressource de calcul CDH et le groupe de ressources exclusif pour la planification.
Limites
Régions : Cette fonctionnalité est disponible dans les régions Chine (Pékin), Chine (Shanghai), Chine (Shenzhen), Chine (Hangzhou), Chine (Zhangjiakou), Chine (Chengdu) et Allemagne (Francfort).
-
Autorisations :
Opérateur
Autorisations requises
Compte Alibaba Cloud
Aucune autorisation supplémentaire n'est requise.
Utilisateur RAM/Rôle RAM
-
Seuls les membres de l'espace de travail disposant du rôle O&M, du rôle administrateur de l'espace de travail ou de l'autorisation
AliyunDataWorksFullAccesspeuvent créer une ressource de calcul. Pour plus d'informations sur l'attribution des autorisations, consultez la rubrique Accorder aux utilisateurs des autorisations d'administrateur d'espace de travail.
-
Accéder à la page de liste des ressources de calcul
Connectez-vous à la console DataWorks. Dans le volet de navigation de gauche, basculez vers la région cible et cliquez sur . Sélectionnez votre espace de travail dans la liste déroulante et cliquez sur Go to Management Center.
Dans le volet de navigation de gauche, cliquez sur Computing Resources pour ouvrir la page de liste des ressources de calcul.
Associer une ressource de calcul CDH
Sur la page des ressources de calcul, configurez et associez une ressource de calcul CDH.
-
Sélectionnez le type de ressource de calcul.
Cliquez sur Associate Computing Resources pour accéder à la page Associate Computing Resources.
Sur la page Associate Computing Resources, sélectionnez CDH comme type de ressource de calcul. La page de configuration Associate CDH Computing Resource s'affiche.
-
Configurez la ressource de calcul CDH.
Sur la page Associate CDH Computing Resource, configurez les paramètres suivants.
Paramètre
Description
Cluster Version
Sélectionnez la version du cluster que vous souhaitez enregistrer.
DataWorks prend nativement en charge les versions CDH 5.16.2, CDH 6.1.1, CDH 6.2.1, CDH 6.3.2 et CDP 7.1.7, avec toutes les versions des composants figées dans les informations de connexion au cluster. Si aucune de ces versions ne répond à vos besoins, sélectionnez Custom Version et configurez les versions des composants selon vos besoins.
Remarque-
Les composants requis varient selon la version du cluster et sont affichés sur la page de configuration.
-
Si vous enregistrez un cluster avec une Custom Version, seuls les groupes de ressources exclusifs hérités pour la planification sont pris en charge. Après l'enregistrement, vous devez soumettre un ticket pour demander au support technique d'initialiser l'environnement.
Cluster Name
Sélectionnez le nom d'un cluster enregistré dans un autre espace de travail pour charger sa configuration, ou spécifiez un nom personnalisé pour créer une nouvelle configuration.
Cluster Connection Information
Informations de connexion Hive
Utilisées pour soumettre des tâches Hive au cluster.
-
Format de configuration HiveServer2 :
jdbc:hive2://<host>:<port>/<database> -
Format de configuration Metastore :
thrift://<host>:<port>
Comment obtenir les paramètres : Pour plus d'informations, consultez la rubrique Obtenir les informations du cluster CDH ou CDP et configurer la connectivité réseau.
Sélection de la version des composants : Le système détecte automatiquement les versions des composants pour le cluster actuel.
RemarqueSi vous utilisez un groupe de ressources serverless pour accéder aux composants CDH par nom de domaine, vous devez configurer la résolution faisant autorité pour les noms de domaine et définir leur portée d'application dans PrivateZone d'Alibaba Cloud DNS.
Informations de connexion Impala
Utilisées pour soumettre des tâches Impala.
Format de configuration :
jdbc:impala://<host>:<port>/<schema>.Informations de connexion Spark
Sélectionnez une version Spark par défaut et configurez la connexion.
Informations de connexion Yarn
Configurations pour la soumission des tâches et l'affichage des détails des tâches.
-
Format de configuration Yarn.Resourcemanager.Address :
http://<host>:<port>RemarqueAdresse de soumission pour les tâches Spark ou MapReduce.
-
Format de configuration Jobhistory.Webapp.Address :
http://<host>:<port2>RemarqueAdresse de l'interface web du serveur JobHistory permettant d'afficher les détails des tâches terminées.
Informations de connexion MapReduce
Sélectionnez une version MapReduce par défaut et configurez la connexion.
Informations de connexion Presto
Utilisées pour soumettre des tâches Presto.
Format de configuration de l'adresse JDBC :
jdbc:presto://<host>:<port>/<catalog>/<schema>RemarqueIl ne s'agit pas d'un composant CDH par défaut. Configurez ce composant selon vos besoins.
Cluster Configuration File
Configurer le fichier core-site
Contient les configurations globales de la bibliothèque Hadoop Core, telles que les paramètres d'E/S communs pour HDFS et MapReduce.
Téléchargez ce fichier pour exécuter des tâches Spark ou MapReduce.
Configurer le fichier hdfs-site
Contient les configurations liées à HDFS, telles que la taille des blocs de données, le nombre de réplicas et les noms de chemins.
Configurer le fichier mapred-site
Configure les paramètres MapReduce tels que le mode d'exécution et le comportement de planification.
Téléchargez ce fichier pour exécuter des tâches MapReduce.
Configurer le fichier yarn-site
Contient toutes les configurations liées aux daemons YARN, telles que les paramètres d'environnement pour le gestionnaire de ressources, les gestionnaires de nœuds et l'exécution des applications.
Téléchargez ce fichier si vous prévoyez d'exécuter des tâches Spark ou MapReduce ou d'utiliser Kerberos pour le mappage des comptes.
Configurer le fichier hive-site
Configure les paramètres Hive tels que les informations de connexion à la base de données, les paramètres Hive Metastore et le moteur d'exécution.
Téléchargez ce fichier si vous sélectionnez Kerberos comme type de mappage de compte.
Configurer le fichier spark-defaults
Spécifie les configurations par défaut des tâches Spark, telles que la taille de la mémoire et le nombre de cœurs CPU. Les applications Spark appliquent ces paramètres lors de l'exécution.
Téléchargez ce fichier pour exécuter des tâches Spark.
Configurer le fichier config.properties
Contient les configurations liées au serveur Presto, telles que les propriétés globales pour les nœuds coordinateur et worker du cluster Presto.
Téléchargez ce fichier si vous utilisez le composant Presto et sélectionnez OPEN LDAP ou Kerberos comme type de mappage de compte.
Configurer le fichier presto.jks
Stocke les certificats de sécurité (clés privées et certificats de clé publique) pour la communication chiffrée SSL/TLS entre les processus Presto.
Default Access Identity
Pour utiliser une identité associée à un compte de cluster mappé, accédez à la page Computing Resources, puis, sous l'onglet Account Mappings, définissez le mappage d'identité du cluster.
-
Environnement de développement : Vous pouvez utiliser un compte de cluster ou le compte de cluster mappé de l'exécuteur de la tâche.
-
Environnement de production : Vous pouvez utiliser un compte de cluster, le compte de cluster mappé du propriétaire de la tâche, le compte de cluster mappé du compte Alibaba Cloud ou le compte de cluster mappé d'un utilisateur RAM.
Computing Resource Instance Name
Spécifiez un nom personnalisé pour l'instance de ressource de calcul. Lors de l'exécution, vous pouvez sélectionner une ressource de calcul pour une tâche en fonction de ce nom.
-
Cliquez sur Confirm pour terminer la configuration.
Initialiser le groupe de ressources
Lorsque vous enregistrez un cluster pour la première fois ou modifiez les configurations des services du cluster (telles que core-site.xml), initialisez le groupe de ressources afin de garantir qu'il puisse accéder au cluster CDH après avoir configuré la connectivité réseau.
Sur la page Computing Resources, localisez la ressource de calcul CDH que vous avez créée. Dans le coin supérieur droit, cliquez sur Initialize Resource Group.
Cliquez sur Initialize à côté du groupe de ressources que vous souhaitez utiliser. Une fois le groupe de ressources initialisé, cliquez sur Determine.
(Facultatif) Configurer la file d'attente des ressources YARN
Sur la page Computing Resources, localisez votre cluster CDH associé. Sous l'onglet YARN Resource Queue, cliquez sur Edit YARN Resource Queue pour définir une file d'attente de ressources YARN dédiée pour les tâches de différents modules.
(Facultatif) Configurer les paramètres Spark
Vous pouvez définir des paramètres Spark dédiés pour les tâches de différents modules.
Sur la page Computing Resources, localisez votre cluster CDH associé.
Sous l'onglet Spark-related Parameter, cliquez sur Edit Spark Parameters pour accéder à la page où vous pouvez modifier les paramètres Spark du cluster CDH.
Vous pouvez configurer les propriétés Spark en cliquant sur le bouton Add situé sous le module et en saisissant le Spark Property Name et la Spark Property Value.
(Facultatif) Configurer les paramètres d'hôte
La soumission des tâches peut échouer lorsqu'un groupe de ressources serverless DataWorks se connecte à un cluster CDH activé pour Kerberos.
Cela se produit car Kerberos s'appuie sur les noms d'hôte pour l'authentification. Si le DNS ne peut pas résoudre une adresse IP de cluster en son nom d'hôte enregistré auprès de Kerberos, l'authentification échoue.
La fonctionnalité de configuration d'hôte vous permet de définir un mappage statique IP-nom d'hôte pour une ressource de calcul CDH. DataWorks donne la priorité à ce mappage lors de l'accès au cluster, garantissant ainsi une authentification Kerberos réussie.
Localisez la ressource de calcul CDH que vous souhaitez configurer et cliquez sur Host Configuration.
Dans la boîte de dialogue qui s'affiche, saisissez la relation de mappage au format
IP address hostname. Saisissez un seul mappage par ligne.Cliquez sur OK pour enregistrer la configuration.
Après l'enregistrement, les informations de nom d'hôte configurées apparaissent sur la carte de la ressource de calcul, confirmant que la configuration est active.
Exigence de format : L'
IP addresset lehostnamedoivent être séparés par un ou plusieurs espaces.Intégrité de la configuration : Configurez des mappages corrects pour tous les nœuds critiques impliqués dans l'authentification Kerberos et l'exécution des tâches, tels que les NameNodes, les ResourceManagers et les NodeManagers.
Portée : Cette configuration d'hôte s'applique uniquement à la ressource de calcul actuelle, et non aux autres ressources de l'espace de travail.
Étapes suivantes
Après avoir configuré la ressource de calcul CDH, utilisez les nœuds liés à CDH dans Data Studio pour le développement des données.