Un catalogue de données est l'entité de niveau supérieur pour les services de métadonnées externes tels que Data Lake Formation (DLF) ou Hive Metastore. Il peut contenir plusieurs bases de données. Dans EMR Serverless Spark, vous pouvez consulter les bases de données et les tables d'un catalogue de données connecté. Vous pouvez également ajouter des catalogues de données existants, ce qui s'avère utile dans les scénarios nécessitant une isolation des métadonnées.
Présentation des catalogues
EMR Serverless Spark propose un système de gestion de catalogues flexible prenant en charge divers types de catalogues, tels que Paimon, Iceberg et StarRocks. Outre le type standard de catalogue de données, le système prend également en charge un catalogue intégré et des catalogues personnalisés. Cette section décrit les types de catalogues disponibles dans EMR Serverless Spark ainsi que leur configuration et leur utilisation.
Type de catalogue | Sources de données prises en charge | Méthode d'ajout | Description | Utilisation |
Catalogue de données |
| Ajoutez manuellement un catalogue sur la page Catalog. | Après l'ajout d'un catalogue, redémarrez toutes les sessions en cours d'exécution pour que les modifications prennent effet. |
|
Catalogue personnalisé | Paimon, Iceberg et autres | Modifiez une session et ajoutez les paramètres requis dans l'onglet Spark Configuration. | Ce type nécessite une configuration manuelle des paramètres et peut être étendu pour prendre en charge diverses sources de données. Pour plus d'informations, consultez Utiliser Iceberg et Guide d'utilisation de Paimon. | |
Ajouter un catalogue de données
-
Accédez à la page Data Catalogs.
Connectez-vous à la console EMR.
Dans le volet de navigation de gauche, choisissez EMR Serverless > Spark.
Sur la page Spark, cliquez sur le nom de l'espace de travail cible.
-
Sur la page EMR Serverless Spark, cliquez sur Catalog dans le volet de navigation de gauche.
RemarqueLa page Data Catalogs affiche les bases de données et les tables du catalogue de données Data Lake Formation que vous avez sélectionné lors de la création de l'espace de travail.
Cliquez sur Add Catalog.
Dans la boîte de dialogue Add Catalog, sélectionnez un type de catalogue, configurez les paramètres requis, puis cliquez sur Add. Les types de catalogues suivants sont pris en charge.
Catalogue de données DLF
Le service DLF Catalog permet de gérer et d'interroger les métadonnées d'un lac de données. En sélectionnant un catalogue de données DLF existant ou en en créant un nouveau, vous pouvez accéder rapidement aux métadonnées de votre lac de données.
Pour créer un nouveau catalogue de données DLF, cliquez sur Create Catalog afin d'accéder à la console Data Lake Formation. Pour plus d'informations, consultez Gérer les métadonnées.
Lorsque vous utilisez un catalogue de données DLF, seules les versions de moteur suivantes sont prises en charge : esr-4.3.0 ou ultérieure, esr-3.3.0 ou ultérieure, et esr-2.7.0 ou ultérieure.
Catalogue de données Hive Metastore (HMS)
Le service External Hive Metastore est un service de métadonnées indépendant, généralement utilisé pour gérer les métadonnées des tables Hive. Vous pouvez configurer ce service pour intégrer les métadonnées d'un Hive Metastore externe dans votre environnement actuel.
Assurez-vous qu'une connexion réseau existe entre EMR Serverless Spark et le VPC où se trouve le Hive Metastore externe.
Paramètre | Description |
Network Connection | La connexion réseau au VPC où se trouve le Hive Metastore externe. Sélectionnez une connexion réseau existante dans la liste déroulante. Pour plus d'informations, consultez Étape 1 : Ajouter une connexion réseau. Remarque
|
Metastore service address | L'adresse du service du Hive Metastore externe, au format Où :
|
Authentification Kerberos | Si l'authentification Kerberos est activée pour votre Hive Metastore externe, spécifiez le chemin d'accès au fichier keytab et le nom du principal.
|
Pour ajouter un Hive Metastore externe, consultez Se connecter à un Hive Metastore externe.
Catalogue de données StarRocks
StarRocks est une base de données analytique haute performance. L'ajout d'un catalogue de données StarRocks enregistre les métadonnées d'une instance StarRocks dans EMR Serverless Spark. Une fois le catalogue ajouté, vous pouvez lire et écrire des données StarRocks directement depuis vos tâches et sessions sans configurer les paramètres de connexion pour chaque tâche. Assurez-vous qu'une connexion réseau existe entre EMR Serverless Spark et le VPC où se trouve l'instance StarRocks.
Après avoir ajouté le catalogue, vous pouvez utiliser un identifiant en trois parties dans SQL pour lire et écrire des données dans StarRocks. Par exemple : SELECT * FROM <catalogName>.<dbName>.<tableName>;
Les catalogues de données StarRocks ne sont pris en charge que sur les versions de moteur suivantes : esr-4.8.0 ou ultérieure et esr-5.2.0 ou ultérieure.
Paramètre | Description |
Catalog Name | Le nom du catalogue de données StarRocks. Ce nom, qui doit être unique au sein de l'espace de travail, est utilisé pour référencer le catalogue dans SQL. |
Normal Network Connection | La connexion réseau au VPC où se trouve l'instance StarRocks. Sélectionnez une connexion réseau existante dans la liste déroulante. Pour plus d'informations, consultez Étape 1 : Ajouter une connexion réseau. Remarque
|
Endpoint | L'adresse d'accès frontend (FE) pour StarRocks, par exemple |
Query Port | Le port de requête FE pour StarRocks. Il s'agit généralement du port 9030. |
Username | Le nom d'utilisateur pour accéder à StarRocks. Les tâches Spark utilisent ce nom d'utilisateur pour l'authentification lors de la lecture ou de l'écriture de données StarRocks. |
Password | Le mot de passe associé au nom d'utilisateur spécifié. |
Pour savoir comment lire et écrire des données StarRocks dans vos tâches, consultez Lire et écrire des données StarRocks.
Catalogue de données Hologres
Hologres est un entrepôt de données en temps réel qui prend en charge les écritures en temps réel à haut débit et l'analyse en temps réel de données à grande échelle. L'ajout d'un catalogue de données Hologres enregistre les métadonnées d'une instance Hologres dans EMR Serverless Spark. Une fois le catalogue ajouté, vous pouvez lire et écrire des données Hologres directement depuis vos tâches et sessions sans configurer les paramètres de connexion pour chaque tâche. Assurez-vous qu'une connexion réseau existe entre EMR Serverless Spark et le VPC où se trouve l'instance Hologres.
Après avoir ajouté le catalogue, vous pouvez utiliser un identifiant en trois parties dans SQL pour lire et écrire des données dans Hologres. Chaque catalogue est strictement lié à une seule base de données Hologres et l'accès inter-bases de données n'est pas pris en charge. Autrement dit, vous ne pouvez pas utiliser un seul catalogue pour accéder à plusieurs bases de données Hologres. La structure logique du catalogue est cohérente avec celle de Hologres :
|
Concept Spark |
Concept Hologres |
Description |
|
Catalogue |
Base de données |
Par exemple, |
|
Espace de noms |
Schema |
Par exemple, |
|
Table |
Table |
Vous devez spécifier explicitement la table sous la forme |
Les catalogues de données Hologres ne sont pris en charge que sur les versions de moteur suivantes : esr-4.9.0 ou ultérieure.
Paramètre | Description |
Catalog Name | Le nom du catalogue de données Hologres. Ce nom, qui doit être unique au sein de l'espace de travail, est utilisé pour référencer le catalogue dans SQL. |
Normal Network Connection | La connexion réseau au VPC où se trouve l'instance Hologres. Sélectionnez une connexion réseau existante dans la liste déroulante. Pour plus d'informations, consultez Étape 1 : Ajouter une connexion réseau. Remarque
|
Endpoint | L'adresse d'accès de l'instance Hologres. Vous pouvez la trouver sur la page des détails de l'instance dans la console Hologres. |
Query Port | Le port de l'instance Hologres. Il s'agit généralement du port 80. |
Username | Le nom d'utilisateur pour accéder à Hologres. Les tâches Spark utilisent ce nom d'utilisateur pour l'authentification lors de la lecture ou de l'écriture de données Hologres.
|
Password | Le mot de passe associé au nom d'utilisateur spécifié.
|
Pour savoir comment lire et écrire des données Hologres dans vos tâches, consultez Lire et écrire des données Hologres.
Consulter les bases de données et les tables
-
Sur la page Catalog, cliquez sur l'ID d'un catalogue de données.
Toutes les bases de données du catalogue de données s'affichent.
-
Dans la colonne Actions, cliquez sur Table.
Toutes les tables de la base de données sélectionnée s'affichent.
-
Dans la colonne Actions, cliquez sur Field.
Le schéma et les détails des colonnes de la table sélectionnée s'affichent.