Enregistrez des clusters Cloudera’s Distribution Including Apache Hadoop (CDH) ou Cloudera Data Platform (CDP) dans DataWorks pour réaliser des opérations de développement et de gouvernance des données, telles que le développement de tâches, la planification, Data Map (gestion des métadonnées) et Data Quality.
Informations générales
CDH est la distribution open source de Cloudera. Elle inclut des fonctionnalités prêtes à l'emploi, telles que la gestion, la surveillance et le diagnostic du cluster, et prend en charge divers composants pour exécuter des workflows big data de bout en bout.
CDP est une plateforme de données publique qui collecte et consolide les données clients provenant de plusieurs plateformes. Elle rassemble des données en temps réel pour créer des profils de données utilisateur individuels.
Vous pouvez enregistrer des clusters CDH et CDP dans DataWorks pour le développement de tâches, la planification, la gestion des métadonnées dans Data Map et les vérifications Data Quality.
Prérequis
-
Pour enregistrer un cluster CDH ou CDP, vous devez disposer de l'un des rôles ou autorisations suivants dans l'espace de travail actuel :
Vous utilisez un compte Alibaba Cloud.
Vous êtes membre de l'espace de travail avec le rôle Workspace Administrator. Pour plus d'informations, reportez-vous à la rubrique Ajouter des membres à l'espace de travail et gérer leurs rôles et autorisations.
Vous êtes membre de l'espace de travail avec la stratégie AliyunDataWorksFullAccess. Pour accorder cette stratégie, consultez les rubriques Accorder des autorisations à un utilisateur RAM et Accorder des autorisations à un rôle RAM. Pour ajouter un membre à l'espace de travail, consultez la rubrique Ajouter des membres à l'espace de travail et gérer leurs rôles et autorisations.
Vous avez déployé le cluster CDH ou CDP et obtenu les informations de configuration requises pour l'enregistrement du cluster. Pour plus d'informations, consultez la rubrique Préparatifs : Obtenir les informations du cluster CDH ou CDP et configurer la connectivité réseau.
Limites
-
Vous ne pouvez exécuter des tâches sur un cluster CDH ou CDP qu'en utilisant le nouveau groupe de ressources serverless (recommandé) ou un groupe de ressources exclusif hérité pour la planification.
RemarqueUn groupe de ressources serverless est un groupe de ressources polyvalent utilisable dans divers scénarios, tels que la synchronisation des données et la planification des tâches. Pour savoir comment acheter un groupe de ressources serverless, consultez la rubrique Utiliser un groupe de ressources serverless. Si vous avez déjà acheté un groupe de ressources exclusif hérité pour la planification, vous pouvez également l'utiliser pour exécuter des tâches CDH ou CDP. Pour plus d'informations, consultez la rubrique Utiliser un groupe de ressources exclusif pour la planification.
Les nouveaux utilisateurs ne peuvent acheter que des groupes de ressources serverless.
Si vous utilisez un cluster d'une Custom Version pour l'enregistrement dans DataWorks, vous ne pouvez utiliser qu'un groupe de ressources exclusif hérité pour la planification. Pour plus d'informations sur les versions de cluster, consultez l'étape Étape 2 : Enregistrer un cluster CDH ou CDP.
Vous pouvez enregistrer des clusters CDH ou CDP uniquement dans les régions suivantes : Chine (Pékin), Chine (Shanghai), Chine (Hangzhou), Chine (Shenzhen), Chine (Zhangjiakou), Chine (Chengdu) et Allemagne (Francfort).
Étape 1 : Accéder à la page d'enregistrement
-
Connectez-vous à la console DataWorks. Dans la région cible, cliquez sur dans le volet de navigation de gauche. Sélectionnez un espace de travail dans la liste déroulante et cliquez sur Go to Management Center.
Dans le volet de navigation de gauche, cliquez sur Clusters pour accéder à la page Clusters. Cliquez sur Register Cluster, sélectionnez CDH pour Open Source Cluster Type, puis accédez à la page d'enregistrement du cluster.
Étape 2 : Enregistrer un cluster CDH ou CDP
Si votre espace de travail est en mode standard, vous devez enregistrer des clusters distincts pour l'environnement de développement et l'environnement de production. Pour plus d'informations sur les modes d'espace de travail, consultez la rubrique Différences entre les modes d'espace de travail.
Les opérations de développement pour CDP et CDH dans DataWorks sont presque identiques. Cette rubrique utilise un cluster CDH comme exemple.
-
Configurez les informations de base du cluster.
Paramètre
Description
Display Name of Cluster
Le nom d'affichage du cluster dans DataWorks. Le nom doit être unique.
Cluster Version
Sélectionnez la version du cluster à enregistrer.
DataWorks propose les versions suivantes : CDH 5.16.2, CDH 6.1.1, CDH 6.2.1, CDH 6.3.2 et CDP 7.1.7. Les versions des composants associées à ces versions de cluster sont fixes. Pour plus d'informations, consultez Informations de connexion au cluster. Si ces versions de cluster ne répondent pas à vos besoins professionnels, vous pouvez sélectionner Custom Version et configurer les versions des composants selon vos besoins.
Remarque-
Consultez l'interface utilisateur pour obtenir les informations les plus récentes.
-
Si vous utilisez un cluster d'une Custom Version pour l'enregistrement dans DataWorks, vous ne pouvez utiliser qu'un groupe de ressources exclusif hérité pour la planification. Une fois l'enregistrement terminé, vous devez soumettre un ticket pour demander au support technique d'initialiser l'environnement.
Cluster Name
La source des informations de configuration du cluster que vous enregistrez. Sélectionnez un cluster déjà enregistré dans un autre espace de travail ou créez un nouveau cluster.
-
Cluster enregistré : Réutilise la configuration d'un cluster déjà enregistré dans un autre espace de travail.
-
Nouveau cluster : Vous devez configurer les informations du cluster que vous enregistrez.
-
-
Configurez les informations de connexion au cluster.
Sélectionnez les versions des composants de votre cluster et saisissez les informations de point de terminaison obtenues. Pour plus d'informations, consultez la rubrique Préparatifs : Obtenir les informations du cluster CDH ou CDP et configurer la connectivité réseau. Sur le nœud principal du cluster CDH, exécutez la commande
java -jar dw-tools.jar admin adminpour obtenir les informations d'hôte et d'URL pour chaque composant du cluster. Utilisez ensuite les adresses de connexion renvoyées pour remplir les champs suivants : HiveServer2 (format :jdbc:hive2://<host>:<port>/<database>), Metastore (format :thrift://<host>:<port>), Impala JDBC URL (format :jdbc:impala://<host>:<port>/<schema>), Yarn.ResourceManager.Address (format :http://<host>:<port>), Jobhistory.Webapp.Address (modifiez le port de l'adresse Yarn ResourceManager en 8088) et Presto JDBC URL (format :jdbc:presto://<host>:<port>/<catalog>/<schema>). Presto n'est pas un composant CDH par défaut. Spécifiez l'adresse d'accès en fonction de votre déploiement.RemarqueSi vous accédez aux composants CDH par nom de domaine depuis un groupe de ressources serverless, vous devez configurer la résolution DNS faisant autorité pour les noms de domaine des composants CDH dans Alibaba Cloud DNS PrivateZone. Pour plus d'informations, consultez les rubriques Ajouter un domaine faisant autorité intégré et Définir une portée pour un nom de domaine.
-
Ajoutez des fichiers de configuration du cluster.
Vous pouvez télécharger des fichiers de configuration pour les composants requis. Pour obtenir les fichiers de configuration, consultez la rubrique Préparatifs : Obtenir les informations du cluster CDH ou CDP et configurer la connectivité réseau.
Le tableau suivant décrit les fichiers de configuration.
Fichier de configuration
Description
Scénarios
core-site.xml
Contient les configurations globales de la bibliothèque Hadoop Core, telles que les paramètres d'E/S courants pour HDFS et MapReduce.
Ce fichier doit être téléchargé pour exécuter des tâches Spark ou MapReduce.
hdfs-site.xml
Contient les configurations liées à HDFS, telles que la taille des blocs de données, le nombre de réplicas et les noms de chemin.
mapred-site.xml
Configure les paramètres liés à MapReduce, tels que la méthode d'exécution et le comportement de planification des jobs MapReduce.
Ce fichier doit être téléchargé pour exécuter des tâches MapReduce.
yarn-site.xml
Contient toutes les configurations liées aux démons YARN, telles que le gestionnaire de ressources, le gestionnaire de nœuds et l'environnement d'exécution des applications.
Ce fichier doit être téléchargé pour exécuter des tâches Spark ou MapReduce, ou lorsque Kerberos est sélectionné comme type de mappage d'identité.
hive-site.xml
Contient divers paramètres pour configurer Hive, tels que les informations de connexion à la base de données, les paramètres Hive Metastore et le moteur d'exécution.
Ce fichier doit être téléchargé lorsque Kerberos est sélectionné comme type de mappage d'identité.
spark-defaults.conf
Définit les configurations par défaut pour l'exécution des jobs Spark. Utilisez le fichier
spark-defaults.confpour prédéfinir des propriétés telles que la taille de la mémoire et le nombre de cœurs CPU. Les applications Spark appliquent ces paramètres lors de l'exécution.Ce fichier doit être téléchargé pour exécuter des tâches Spark.
config.properties
Contient les configurations du serveur Presto, telles que les propriétés globales pour les nœuds coordinateur et worker dans un cluster Presto.
Ce fichier doit être téléchargé lorsque vous utilisez le composant Presto et sélectionnez OPEN LDAP ou Kerberos comme type de mappage d'identité.
presto.jks
Un fichier Java KeyStore (JKS) qui stocke les certificats de sécurité, y compris les clés privées et les certificats de clé publique. Dans Presto, le fichier
presto.jkspermet une communication chiffrée SSL/TLS entre les processus Presto pour un transfert sécurisé des données. -
Configurez l'identité d'accès par défaut.
Compte utilisé pour accéder au cluster CDH lorsque DataWorks exécute des tâches. Les types de comptes pris en charge varient selon l'environnement.
RemarqueLors de l'enregistrement d'un cluster, si vous définissez l'Default Access Identity sur un compte non lié au cluster et qu'aucun mappage d'identité n'est configuré (ou si le type de mappage est défini sur aucune authentification), toutes les tâches échouent.
Environnement
Identité d'accès par défaut
Informations connexes
Environnement de développement
-
Compte de cluster : Un compte de cluster spécifié accède au cluster CDH, indépendamment de la personne qui exécute la tâche CDH dans DataWorks, tel qu'un compte Alibaba Cloud ou un utilisateur RAM disposant d'autorisations de développement uniquement.
-
Compte mappé : Nécessite un mappage d'identité entre le compte de l'utilisateur et un compte de cluster. Lorsque la tâche s'exécute, le compte mappé accède au cluster CDH.
Pour configurer un mappage d'identité, consultez la rubrique Configurer les mappages d'identité du cluster.
Environnement de production
-
Compte de cluster : Un compte de cluster spécifié accède au cluster CDH, indépendamment de la personne qui exécute la tâche CDH dans DataWorks, tel que le propriétaire de la tâche, un compte Alibaba Cloud ou un utilisateur RAM.
-
Compte mappé : Nécessite un mappage d'identité entre le compte correspondant (propriétaire de la tâche, compte Alibaba Cloud ou utilisateur RAM) et un compte de cluster. Lorsque la tâche s'exécute, le compte mappé accède au cluster CDH.
-
Cliquez sur Complete Registration pour enregistrer le cluster dans DataWorks.
Étape 3 : Initialiser le groupe de ressources
Initialisez le groupe de ressources lors du premier enregistrement d'un cluster ou après avoir modifié la configuration du service du cluster, ou après avoir mis à niveau une version de composant (par exemple, en modifiant le fichier core-site.xml). Cela garantit que le groupe de ressources peut accéder au cluster CDH et est correctement configuré pour exécuter des tâches de cluster CDH. Sur la page Clusters, recherchez le cluster CDH enregistré et cliquez sur Initialize Resource Group dans le coin supérieur droit. Sélectionnez le groupe de ressources requis et initialisez-le.
DataWorks prend en charge l'exécution des tâches de cluster CDH uniquement en utilisant le nouveau groupe de ressources serverless (recommandé) ou un groupe de ressources exclusif hérité pour la planification. Par conséquent, vous ne pouvez initialiser que ces deux types de groupes de ressources. Si aucun groupe de ressources n'est disponible, créez-en un selon vos besoins. Pour plus d'informations, consultez les rubriques Utiliser un groupe de ressources serverless et Utiliser un groupe de ressources exclusif pour la planification.
Si vous utilisez un cluster d'une Custom Version pour l'enregistrement dans DataWorks, vous ne pouvez utiliser qu'un groupe de ressources exclusif hérité pour la planification. Une fois l'enregistrement terminé, vous devez soumettre un ticket pour demander au support technique d'initialiser l'environnement.
(Facultatif) Configurer une file d'attente de ressources YARN
Les files d'attente de ressources YARN partitionnent et isolent les ressources du cluster, garantissant que différents types de tâches utilisent les ressources de calcul équitablement sans interférence. Pour configurer une file d'attente de ressources YARN dédiée aux tâches d'un module spécifique, recherchez votre cluster CDH enregistré sur la page Clusters. Sous l'onglet YARN Resource Queue, cliquez sur Edit YARN resource queue pour configurer les paramètres.
(Facultatif) Configurer les propriétés Spark
Définissez des propriétés Spark dédiées pour les tâches dans différents modules.
Sur la page Clusters, recherchez votre cluster CDH enregistré.
Sous l'onglet Spark-related Parameter, cliquez sur le bouton Edit Spark properties pour accéder à la page de modification des propriétés Spark pour le cluster CDH.
Cliquez sur le bouton Add sous un module, et saisissez le Spark Property Name et la Spark Property Value correspondante pour définir les propriétés Spark.
Étapes suivantes
Configurer les mappages d'identité du cluster : Si l'identité d'accès par défaut du cluster CDH n'est pas un compte de cluster spécifique, vous devez configurer un mappage d'identité entre le compte Alibaba Cloud et un compte de cluster. Ce mappage permet au compte Alibaba Cloud d'accéder au cluster CDH avec l'identité de cluster mappée pour l'isolation et le contrôle des autorisations de données.
Après avoir enregistré la ressource de calcul CDH, utilisez les nœuds liés à CDH dans DataStudio pour effectuer des opérations de développement de données.