Tous les produits
Search
Centre de documentation

AnalyticDB:Importation de données Hive

Dernière mise à jour :Aug 21, 2026

AnalyticDB for MySQL prend en charge la migration des données de Hive vers OSS grâce à la fonctionnalité de migration de données. Cette rubrique explique comment ajouter une source de données Hive, créer et démarrer une tâche de migration, analyser les données après migration et gérer la tâche.

Fonctionnalités

AnalyticDB for MySQL vous permet de migrer les métadonnées et les données Hive vers OSS en un seul clic. Vous pouvez également migrer plusieurs bases de données et tables en parallèle.

Prérequis

  • Cluster E-MapReduce : le scénario d'activité du cluster est New Data Lake, le type de métadonnées est Self-managed RDS ou Built-in MySQL, et le service Hive est activé. Le Hive Storage Mode doit être HDFS, ce qui signifie que la case Data Lake Storage n'est pas cochée. Pour plus d'informations, consultez la section Créer un cluster.

    Important
    • Les clusters E-MapReduce dont le type de métadonnées est DLF Unified Metadata ne prennent pas en charge la migration des données Hive vers OSS.

    • Si le Data Lake Storage de votre cluster E-MapReduce est défini sur Data Lake Storage, les données se trouvent déjà dans OSS. Vous pouvez utiliser la fonctionnalité de découverte de métadonnées pour importer les données dans AnalyticDB for MySQL. Pour plus d'informations, consultez la section Importer des données à l'aide de la découverte de métadonnées.

  • Un cluster CDH auto-géré sur des instances ECS.

  • Créez des bases de données Hive et des tables partitionnées. Pour plus d'informations, consultez la section Opérations Hive de base.

Facturation

La migration des données vers OSS via la fonctionnalité de migration de données d'AnalyticDB for MySQL engendre les frais suivants.

  • Les frais de ressources élastiques pour les ACU de votre cluster AnalyticDB for MySQL. Pour plus d'informations sur les éléments facturables, consultez les sections Éléments facturables de Data Lakehouse Edition.

  • Les frais de stockage, les frais de requêtes GET ainsi que les frais de requêtes PUT et autres pour OSS. Pour plus d'informations sur les éléments facturables, consultez la section Présentation de la facturation.

Flux de travail

Créer une source de données Hive

Remarque

Si vous avez déjà ajouté une source de données Hive, ignorez cette étape et créez directement la tâche de migration. Pour plus d'informations, consultez la section Créer une tâche de migration de données.

  1. Connectez-vous à la console AnalyticDB for MySQL. Dans le coin supérieur gauche de la console, sélectionnez une région. Dans le volet de navigation de gauche, cliquez sur Clusters. Recherchez le cluster à gérer et cliquez sur son ID.

  2. Dans le volet de navigation de gauche, choisissez Data Ingestion>Data Sources.

  3. Dans le coin supérieur gauche, cliquez sur Create Data Source.

  4. Sur la page Create Data Source, configurez les paramètres. Les tableaux suivants décrivent ces paramètres.

    Alibaba Cloud Instance

    Parameter

    Description

    Data Source Type

    Select Hive.

    Data Source Name

    The system automatically generates a name based on the data source type and current time. You can edit this name as needed.

    Data Source Description

    A description of the data source, such as its use case and business constraints.

    Deployment Mode

    If you use the Hive service of E-MapReduce, select Alibaba Cloud Instance.

    Instance

    Select the E-MapReduce instance to which the data source points.

    Hive Metastore URI

    The connection address of the Hive Metastore. The format is thrift://<IP address of the master node>:<Port number>. The default port number is 9083.

    To view the IP address of the master node:

    Log on to the EMR on ECS console. On the Nodes tab, click the 加号..png icon next to the emr-master node to view the private IP address of the master node.

    Self-managed CDH on ECS

    Parameter

    Description

    Data Source Type

    Select Hive.

    Data Source Name

    The system automatically generates a name based on the data source type and current time. You can edit this name as needed.

    Data Source Description

    A description of the data source, such as its use case and business constraints.

    Deployment Mode

    If you have a self-managed CDH cluster on ECS instances, select Self-managed CDH on ECS.

    Instance

    Select the ECS instance to which the data source points.

    Hive Metastore URI

    The connection address of the Hive Metastore. This is the public IP address of the ECS instance that corresponds to the CDH master node. The format is thrift://<IP address of the master node>:<Port number>. The default port number is 9083.

    Host Configuration Information

    Enter each host-to-IP mapping on a new line.

    Example:

    192.168.2.153 master.cdh

    192.168.2.154 node1.cdh

    192.168.2.155 node2.cdh

  5. Une fois les paramètres configurés, cliquez sur Create.

Créer une tâche de migration de données

  1. Dans le volet de navigation de gauche, cliquez sur Data Migration.

  2. Dans le coin supérieur droit, cliquez sur Create Migration Job.

  3. Sur la page Create Migration Job, configurez les paramètres dans les sections Source and Destination Settings, Database/Table Migration Settings et Migration Settings.

    Source and destination settings

    Parameter

    Description

    Job Name

    The name of the data migration job. The system automatically generates a name based on the data source type and current time. You can edit this name as needed.

    Data Source

    Select an existing Hive data source or create a new one.

    Destination Type

    Only Data Lake - OSS Storage is supported.

    OSS Path

    The storage path in OSS for the data of the AnalyticDB for MySQL Data Lakehouse Edition cluster.

    Important
    • All buckets in the same region as the AnalyticDB for MySQL cluster are displayed. You can select any one of them. Plan the storage path with caution. You cannot change the storage path after it is created.

    • We recommend that you select an empty directory and ensure that its OSS path does not have a prefix relationship with the OSS paths of other jobs. This prevents data from being overwritten. For example, if the OSS paths of two data migration jobs are oss://adb_demo/test/sls1/ and oss://adb_demo/test/, the paths have a prefix relationship, which may cause data to be overwritten during data migration.

    Database/table migration settings

    Important

    Si un nom de base de données ou de table figure à la fois dans la liste blanche et dans la liste noire, la liste noire est prioritaire et le service ne migre pas la base de données ou la table concernée.

    Parameter

    Description

    Database/Table Migration Whitelist

    La tâche migre les bases de données et les tables correspondant à une expression. Saisissez des expressions régulières pour les noms de bases de données et de tables. Séparez plusieurs expressions par des virgules (,).

    Database/Table Migration Blacklist

    La tâche ne migre pas les bases de données et les tables correspondant à une expression. Saisissez des expressions régulières pour les noms de bases de données et de tables. Séparez plusieurs expressions par des virgules (,).

    Migration settings

    Parameter

    Description

    Handling Same Named Destination Table

    Specifies how to handle a destination table that already exists:

    • Skip this table (do not migrate): Skips only the current table. The migration of other tables continues.

    • Report error and pause migration: Pauses the migration job. The migration for the table with the same name and all other tables stops.

    Job Resource Group

    Specify the job resource group in which the job runs.

    Required ACUs

    Specify the number of ACUs for the job resource group. The minimum value is 4. The maximum value is the number of available computing resources in the job resource group. Allocate more ACUs to improve migration performance and job stability.

    Parallel Tasks

    The default value is 1. The maximum value is 8.

    If you increase this value, multiple migration tasks are started at the same time, and each task migrates one table. However, each task requires at least 4 ACUs. If the number of ACUs is insufficient, the migration tasks run sequentially.

    Advanced Settings

    Allows you to specify custom configurations for the job. To do so, contact technical support.

  4. Une fois les paramètres configurés, cliquez sur Submit.

Démarrer la tâche de migration de données

  1. Sur la page Data Migration, recherchez la tâche de migration créée et cliquez sur Resume dans la colonne Actions.

  2. Cliquez sur Search dans le coin supérieur droit. Lorsque le statut passe à Starting, la tâche de migration a démarré.

Analyse des données

Une fois la tâche de migration réussie, vous pouvez également utiliser la fonctionnalité de découverte de métadonnées pour importer des données depuis OSS vers les éditions Data Lakehouse Edition, puis analyser les données importées dans les éditions Data Lakehouse Edition via Spark Jar. Pour plus d'informations sur le développement Spark, consultez les sections Éditeur de développement Spark et Développement d'applications Spark hors ligne.

    1. Dans le volet de navigation de gauche, cliquez sur Job Development > Spark JAR Development.

    2. Dans le modèle par défaut, saisissez les exemples d'instructions et cliquez sur Run Now.

      -- Here is just an example of SparkSQL. Modify the content and run your spark program.
      
      conf spark.driver.resourceSpec=medium;
      conf spark.executor.instances=2;
      conf spark.executor.resourceSpec=medium;
      conf spark.app.name=Spark SQL Test;
      conf spark.adb.connectors=oss;
      
      -- Here are your sql statements
      show tables from lakehouse20220413156_adbTest;
    3. Facultatif : Dans l'onglet Applications, cliquez sur Logs dans la colonne Actions pour afficher le journal d'exécution de la tâche Spark SQL.

Gestion des tâches

Sur la page Data Migration, vous pouvez effectuer les opérations suivantes dans la colonne Actions.

Actions

Description

Start

Démarrez la tâche de migration de données.

View Details

Consultez la configuration détaillée de la tâche, le nombre de tables migrées et les détails de la migration.

Edit

Modifiez les propriétés de configuration de la tâche.

Pause

Mettez en pause la tâche de migration en cours.

Delete

Supprimez la tâche de migration en cours.