Tous les produits
Search
Centre de documentation

E-MapReduce:Gérer les catalogues de données

Dernière mise à jour :Aug 22, 2026

Un catalogue de données est l'entité de niveau supérieur pour les services de métadonnées externes tels que Data Lake Formation (DLF) ou Hive Metastore. Il peut contenir plusieurs bases de données. Dans EMR Serverless Spark, vous pouvez consulter les bases de données et les tables d'un catalogue de données connecté. Vous pouvez également ajouter des catalogues de données existants, ce qui s'avère utile dans les scénarios nécessitant une isolation des métadonnées.

Présentation des catalogues

EMR Serverless Spark propose un système de gestion de catalogues flexible prenant en charge divers types de catalogues, tels que Paimon, Iceberg et StarRocks. Outre le type standard de catalogue de données, le système prend également en charge un catalogue intégré et des catalogues personnalisés. Cette section décrit les types de catalogues disponibles dans EMR Serverless Spark ainsi que leur configuration et leur utilisation.

Type de catalogue

Sources de données prises en charge

Méthode d'ajout

Description

Utilisation

Catalogue de données

Ajoutez manuellement un catalogue sur la page Catalog.

Après l'ajout d'un catalogue, redémarrez toutes les sessions en cours d'exécution pour que les modifications prennent effet.

  • Sur la page Development, sélectionnez le catalogue cible dans l'éditeur SQL.

  • Exécutez directement USE <catalogName>; dans l'éditeur SQL.

  • Exécutez directement SELECT * FROM <catalogName>.db.tbl; dans l'éditeur SQL.

Catalogue personnalisé

Paimon, Iceberg et autres

Modifiez une session et ajoutez les paramètres requis dans l'onglet Spark Configuration.

Ce type nécessite une configuration manuelle des paramètres et peut être étendu pour prendre en charge diverses sources de données. Pour plus d'informations, consultez Utiliser Iceberg et Guide d'utilisation de Paimon.

-- Switch to the custom catalog
USE <catalogName>;

-- Or reference the table directly
SELECT * FROM <catalogName>.db.tbl;

Ajouter un catalogue de données

  1. Accédez à la page Data Catalogs.

    1. Connectez-vous à la console EMR.

    2. Dans le volet de navigation de gauche, choisissez EMR Serverless > Spark.

    3. Sur la page Spark, cliquez sur le nom de l'espace de travail cible.

    4. Sur la page EMR Serverless Spark, cliquez sur Catalog dans le volet de navigation de gauche.

      Remarque

      La page Data Catalogs affiche les bases de données et les tables du catalogue de données Data Lake Formation que vous avez sélectionné lors de la création de l'espace de travail.

  2. Cliquez sur Add Catalog.

  3. Dans la boîte de dialogue Add Catalog, sélectionnez un type de catalogue, configurez les paramètres requis, puis cliquez sur Add. Les types de catalogues suivants sont pris en charge.

Catalogue de données DLF

Le service DLF Catalog permet de gérer et d'interroger les métadonnées d'un lac de données. En sélectionnant un catalogue de données DLF existant ou en en créant un nouveau, vous pouvez accéder rapidement aux métadonnées de votre lac de données.

Pour créer un nouveau catalogue de données DLF, cliquez sur Create Catalog afin d'accéder à la console Data Lake Formation. Pour plus d'informations, consultez Gérer les métadonnées.

Remarque

Lorsque vous utilisez un catalogue de données DLF, seules les versions de moteur suivantes sont prises en charge : esr-4.3.0 ou ultérieure, esr-3.3.0 ou ultérieure, et esr-2.7.0 ou ultérieure.

Catalogue de données Hive Metastore (HMS)

Le service External Hive Metastore est un service de métadonnées indépendant, généralement utilisé pour gérer les métadonnées des tables Hive. Vous pouvez configurer ce service pour intégrer les métadonnées d'un Hive Metastore externe dans votre environnement actuel.

Assurez-vous qu'une connexion réseau existe entre EMR Serverless Spark et le VPC où se trouve le Hive Metastore externe.

Paramètre

Description

Network Connection

La connexion réseau au VPC où se trouve le Hive Metastore externe.

Sélectionnez une connexion réseau existante dans la liste déroulante. Pour plus d'informations, consultez Étape 1 : Ajouter une connexion réseau.

Remarque
  • Tous les catalogues de données ajoutés doivent partager la même connexion réseau. La connexion sélectionnée pour le premier catalogue est automatiquement utilisée pour tous les suivants.

  • Cette connexion réseau devient la valeur par défaut pour toutes les ressources de calcul lancées dans l'espace de travail et sert à tester la connectivité avec le catalogue de données.

  • Pour utiliser une connexion réseau différente pour un catalogue de données spécifique, spécifiez-la lors de la soumission d'une tâche ou de la création d'une session. Une connexion spécifiée manuellement est prioritaire.

Metastore service address

L'adresse du service du Hive Metastore externe, au format thrift://<metastore-host>:<port>.

Où :

  • <metastore-host> : le nom d'hôte ou l'adresse IP du service Hive Metastore.

  • <port> : le numéro de port du service Hive Metastore. La valeur par défaut est 9083.

Authentification Kerberos

Si l'authentification Kerberos est activée pour votre Hive Metastore externe, spécifiez le chemin d'accès au fichier keytab et le nom du principal.

  • Kerberos keytab file : le chemin d'accès au fichier keytab Kerberos.

  • Kerberos principal : le nom du principal dans le fichier keytab, utilisé pour s'authentifier auprès du service Kerberos.

    Remarque

    Vous pouvez utiliser la commande klist -kt <keytab_file> pour afficher le nom du principal dans le fichier keytab cible.

Pour ajouter un Hive Metastore externe, consultez Se connecter à un Hive Metastore externe.

Catalogue de données StarRocks

StarRocks est une base de données analytique haute performance. L'ajout d'un catalogue de données StarRocks enregistre les métadonnées d'une instance StarRocks dans EMR Serverless Spark. Une fois le catalogue ajouté, vous pouvez lire et écrire des données StarRocks directement depuis vos tâches et sessions sans configurer les paramètres de connexion pour chaque tâche. Assurez-vous qu'une connexion réseau existe entre EMR Serverless Spark et le VPC où se trouve l'instance StarRocks.

Après avoir ajouté le catalogue, vous pouvez utiliser un identifiant en trois parties dans SQL pour lire et écrire des données dans StarRocks. Par exemple : SELECT * FROM <catalogName>.<dbName>.<tableName>;

Remarque

Les catalogues de données StarRocks ne sont pris en charge que sur les versions de moteur suivantes : esr-4.8.0 ou ultérieure et esr-5.2.0 ou ultérieure.

Paramètre

Description

Catalog Name

Le nom du catalogue de données StarRocks. Ce nom, qui doit être unique au sein de l'espace de travail, est utilisé pour référencer le catalogue dans SQL.

Normal Network Connection

La connexion réseau au VPC où se trouve l'instance StarRocks. Sélectionnez une connexion réseau existante dans la liste déroulante. Pour plus d'informations, consultez Étape 1 : Ajouter une connexion réseau.

Remarque
  • Tous les catalogues de données ajoutés doivent partager la même connexion réseau. La connexion sélectionnée pour le premier catalogue est automatiquement utilisée pour tous les suivants.

  • Cette connexion réseau devient la valeur par défaut pour toutes les ressources de calcul lancées dans l'espace de travail et sert à tester la connectivité avec le catalogue de données.

  • Pour utiliser une connexion réseau différente pour un catalogue de données spécifique, spécifiez-la lors de la soumission d'une tâche ou de la création d'une session. Une connexion spécifiée manuellement est prioritaire.

Endpoint

L'adresse d'accès frontend (FE) pour StarRocks, par exemple fe--internal.starrocks.aliyuncs.com.

Query Port

Le port de requête FE pour StarRocks. Il s'agit généralement du port 9030.

Username

Le nom d'utilisateur pour accéder à StarRocks. Les tâches Spark utilisent ce nom d'utilisateur pour l'authentification lors de la lecture ou de l'écriture de données StarRocks.

Password

Le mot de passe associé au nom d'utilisateur spécifié.

Pour savoir comment lire et écrire des données StarRocks dans vos tâches, consultez Lire et écrire des données StarRocks.

Catalogue de données Hologres

Hologres est un entrepôt de données en temps réel qui prend en charge les écritures en temps réel à haut débit et l'analyse en temps réel de données à grande échelle. L'ajout d'un catalogue de données Hologres enregistre les métadonnées d'une instance Hologres dans EMR Serverless Spark. Une fois le catalogue ajouté, vous pouvez lire et écrire des données Hologres directement depuis vos tâches et sessions sans configurer les paramètres de connexion pour chaque tâche. Assurez-vous qu'une connexion réseau existe entre EMR Serverless Spark et le VPC où se trouve l'instance Hologres.

Après avoir ajouté le catalogue, vous pouvez utiliser un identifiant en trois parties dans SQL pour lire et écrire des données dans Hologres. Chaque catalogue est strictement lié à une seule base de données Hologres et l'accès inter-bases de données n'est pas pris en charge. Autrement dit, vous ne pouvez pas utiliser un seul catalogue pour accéder à plusieurs bases de données Hologres. La structure logique du catalogue est cohérente avec celle de Hologres :

Concept Spark

Concept Hologres

Description

Catalogue

Base de données

Par exemple, hologres_external_test_db correspond à la base de données test_db dans Hologres.

Espace de noms

Schema

Par exemple, public ou test_schema. L'espace de noms par défaut est public. Vous pouvez exécuter USE pour basculer vers un autre espace de noms.

Table

Table

Vous devez spécifier explicitement la table sous la forme namespace.table_name (par exemple, public.test), ou exécuter d'abord USE namespace puis référencer directement le nom de la table.

Remarque

Les catalogues de données Hologres ne sont pris en charge que sur les versions de moteur suivantes : esr-4.9.0 ou ultérieure.

Paramètre

Description

Catalog Name

Le nom du catalogue de données Hologres. Ce nom, qui doit être unique au sein de l'espace de travail, est utilisé pour référencer le catalogue dans SQL.

Normal Network Connection

La connexion réseau au VPC où se trouve l'instance Hologres. Sélectionnez une connexion réseau existante dans la liste déroulante. Pour plus d'informations, consultez Étape 1 : Ajouter une connexion réseau.

Remarque
  • Tous les catalogues de données ajoutés doivent partager la même connexion réseau. La connexion sélectionnée pour le premier catalogue est automatiquement utilisée pour tous les suivants.

  • Cette connexion réseau devient la valeur par défaut pour toutes les ressources de calcul lancées dans l'espace de travail et sert à tester la connectivité avec le catalogue de données.

  • Pour utiliser une connexion réseau différente pour un catalogue de données spécifique, spécifiez-la lors de la soumission d'une tâche ou de la création d'une session. Une connexion spécifiée manuellement est prioritaire.

Endpoint

L'adresse d'accès de l'instance Hologres. Vous pouvez la trouver sur la page des détails de l'instance dans la console Hologres.

Query Port

Le port de l'instance Hologres. Il s'agit généralement du port 80.

Username

Le nom d'utilisateur pour accéder à Hologres. Les tâches Spark utilisent ce nom d'utilisateur pour l'authentification lors de la lecture ou de l'écriture de données Hologres.

  • Pour un compte personnalisé, utilisez le nom d'utilisateur au format BASIC$<user_name>.

  • Pour un compte Alibaba Cloud ou un utilisateur RAM, utilisez l'AccessKey ID.

Password

Le mot de passe associé au nom d'utilisateur spécifié.

  • Pour un compte personnalisé, utilisez le mot de passe du compte.

  • Pour un compte Alibaba Cloud ou un utilisateur RAM, utilisez l'AccessKey Secret.

Pour savoir comment lire et écrire des données Hologres dans vos tâches, consultez Lire et écrire des données Hologres.

Consulter les bases de données et les tables

  1. Sur la page Catalog, cliquez sur l'ID d'un catalogue de données.

    Toutes les bases de données du catalogue de données s'affichent.

  2. Dans la colonne Actions, cliquez sur Table.

    Toutes les tables de la base de données sélectionnée s'affichent.

  3. Dans la colonne Actions, cliquez sur Field.

    Le schéma et les détails des colonnes de la table sélectionnée s'affichent.