Le catalogue de données est l'entité de métadonnées de niveau supérieur dans Data Lake Formation (DLF). Il peut contenir plusieurs bases de données. Vous pouvez créer, consulter, modifier et supprimer des catalogues de données, ainsi que les associer à des moteurs de calcul pour isoler les métadonnées.
Cas d'usage
Les catalogues de données servent principalement à isoler les métadonnées. Par exemple, vous pouvez associer plusieurs clusters E-MapReduce (EMR) à des catalogues de données distincts afin de rendre les métadonnées invisibles entre les clusters.
Opérations de base
Créer un catalogue de données
Connectez-vous à la console Data Lake Formation.
Dans le volet de navigation de gauche, choisissez .
Cliquez sur l'onglet Catalogs, puis sur New Catalog.
-
Configurez les paramètres suivants, puis cliquez sur OK.
Catalog ID : obligatoire. Identifiant unique du catalogue de données.
Description : facultatif. Description du catalogue de données.
Location : facultatif. Chemin de stockage par défaut. Seuls les chemins OSS sont pris en charge.
Consulter les catalogues de données
Dans le volet de navigation de gauche, choisissez .
Cliquez sur l'onglet Catalogs pour afficher la liste des catalogues de données.
Modifier un catalogue de données
Dans le volet de navigation de gauche, choisissez .
Cliquez sur l'onglet Catalogs.
Dans la liste des catalogues de données, localisez celui à modifier et cliquez sur Modify dans la colonne Actions.
-
Modifiez les paramètres selon vos besoins, puis cliquez sur OK.
Description : facultatif. Description du catalogue de données.
Location : facultatif. Chemin de stockage par défaut. Seuls les chemins OSS sont pris en charge.
Supprimer un catalogue de données
Cette action est irréversible. La suppression d'un catalogue de données et de son contenu est définitive. Soyez prudent.
Dans le volet de navigation de gauche, choisissez .
Cliquez sur l'onglet Catalogs.
Dans la liste des catalogues de données, localisez celui à supprimer et cliquez sur Delete dans la colonne Actions.
Dans la boîte de dialogue, cliquez sur Delete.
Intégration des moteurs de calcul
Changer le catalogue de données d'un cluster E-MapReduce
La modification de l'ID du catalogue Data Lake Formation (DLF) associé à un cluster E-MapReduce (EMR) redirige le cluster vers le nouvel ID. Cette opération invalide les accès aux bases de données et tables du catalogue d'origine et provoque l'échec des tâches en cours. Assurez-vous de bien comprendre ces conséquences avant de poursuivre.
Intégration du moteur Hive
-
Dans le fichier core-site.xml du service Hive, ajoutez l'élément de configuration suivant. Pour plus d'informations, consultez Ajouter des éléments de configuration.
Paramètre
Valeur
dlf.catalog.id
ID du catalogue de données DLF.
-
Appliquez la configuration.
Cliquez sur Save. Une fois la configuration enregistrée, cliquez sur Deploy Client Configuration.
Dans la boîte de dialogue, saisissez une Execution Reason et cliquez sur OK.
-
Redémarrez le service Hive.
Sur la page de configuration du service Hive, choisissez .
-
Dans la boîte de dialogue, saisissez une Execution Reason et cliquez sur OK.
Après le redémarrage, l'état du service Hive passe à Healthy, ce qui confirme la modification de l'ID du catalogue.
Intégration du moteur Spark
Modifiez le fichier hive-site.xml du service Spark. Pour connaître la procédure détaillée, reportez-vous à la section Intégration du moteur Hive.
Pour les versions EMR 5.6.0, 3.40.0 et antérieures, modifiez uniquement la configuration Hive, car Spark l'utilise automatiquement.
Intégration du moteur Presto
Modifiez le fichier hive.properties du service Presto. Pour connaître la procédure détaillée, reportez-vous à la section Intégration du moteur Hive.
Cette fonctionnalité est prise en charge uniquement à partir des versions EMR 5.8.0 et 3.42.0.
Intégration du moteur Impala
Modifiez uniquement la configuration Hive, car Impala l'utilise automatiquement.