AnalyticDB for MySQL prend en charge la migration des données de Hive vers OSS grâce à la fonctionnalité de migration de données. Cette rubrique explique comment ajouter une source de données Hive, créer et démarrer une tâche de migration, analyser les données après migration et gérer la tâche.
Fonctionnalités
AnalyticDB for MySQL vous permet de migrer les métadonnées et les données Hive vers OSS en un seul clic. Vous pouvez également migrer plusieurs bases de données et tables en parallèle.
Prérequis
Un cluster AnalyticDB for MySQL Enterprise Edition, Basic Edition ou Data Lakehouse Edition est créé.
Un groupe de ressources de tâches est créé pour le cluster AnalyticDB for MySQL.
-
Un compte de base de données est créé pour le cluster AnalyticDB for MySQL.
Si vous utilisez un compte Alibaba Cloud, il vous suffit de créer un compte privilégié.
Si vous utilisez un utilisateur RAM (Resource Access Management), vous devez créer un compte privilégié et un compte standard puis associer le compte standard à l'utilisateur RAM.
Créez un cluster E-MapReduce ou un cluster CDH auto-géré sur des instances ECS dans la même région que le cluster AnalyticDB for MySQL. Le cluster doit répondre aux exigences suivantes :
-
Cluster E-MapReduce : le scénario d'activité du cluster est New Data Lake, le type de métadonnées est Self-managed RDS ou Built-in MySQL, et le service Hive est activé. Le Hive Storage Mode doit être HDFS, ce qui signifie que la case Data Lake Storage n'est pas cochée. Pour plus d'informations, consultez la section Créer un cluster.
ImportantLes clusters E-MapReduce dont le type de métadonnées est DLF Unified Metadata ne prennent pas en charge la migration des données Hive vers OSS.
Si le Data Lake Storage de votre cluster E-MapReduce est défini sur Data Lake Storage, les données se trouvent déjà dans OSS. Vous pouvez utiliser la fonctionnalité de découverte de métadonnées pour importer les données dans AnalyticDB for MySQL. Pour plus d'informations, consultez la section Importer des données à l'aide de la découverte de métadonnées.
Un cluster CDH auto-géré sur des instances ECS.
Créez des bases de données Hive et des tables partitionnées. Pour plus d'informations, consultez la section Opérations Hive de base.
Facturation
La migration des données vers OSS via la fonctionnalité de migration de données d'AnalyticDB for MySQL engendre les frais suivants.
Les frais de ressources élastiques pour les ACU de votre cluster AnalyticDB for MySQL. Pour plus d'informations sur les éléments facturables, consultez les sections Éléments facturables de Data Lakehouse Edition.
Les frais de stockage, les frais de requêtes GET ainsi que les frais de requêtes PUT et autres pour OSS. Pour plus d'informations sur les éléments facturables, consultez la section Présentation de la facturation.
Flux de travail
Étape 1 : Créer une source de données Hive.
Étape 2 : Créer une tâche de migration de données.
Étape 3 : Démarrer la tâche de migration de données.
Étape 4 : Analyser les données.
Étape 5 (facultative) : Gérer la tâche de migration de données.
Créer une source de données Hive
Si vous avez déjà ajouté une source de données Hive, ignorez cette étape et créez directement la tâche de migration. Pour plus d'informations, consultez la section Créer une tâche de migration de données.
Connectez-vous à la console AnalyticDB for MySQL. Dans le coin supérieur gauche de la console, sélectionnez une région. Dans le volet de navigation de gauche, cliquez sur Clusters. Recherchez le cluster à gérer et cliquez sur son ID.
Dans le volet de navigation de gauche, choisissez Data Ingestion>Data Sources.
Dans le coin supérieur gauche, cliquez sur Create Data Source.
-
Sur la page Create Data Source, configurez les paramètres. Les tableaux suivants décrivent ces paramètres.
Alibaba Cloud Instance
Parameter
Description
Data Source Type
Select Hive.
Data Source Name
The system automatically generates a name based on the data source type and current time. You can edit this name as needed.
Data Source Description
A description of the data source, such as its use case and business constraints.
Deployment Mode
If you use the Hive service of E-MapReduce, select Alibaba Cloud Instance.
Instance
Select the E-MapReduce instance to which the data source points.
Hive Metastore URI
The connection address of the Hive Metastore. The format is
thrift://<IP address of the master node>:<Port number>. The default port number is 9083.To view the IP address of the master node:
Log on to the EMR on ECS console. On the Nodes tab, click the
icon next to the emr-master node to view the private IP address of the master node.Self-managed CDH on ECS
Parameter
Description
Data Source Type
Select Hive.
Data Source Name
The system automatically generates a name based on the data source type and current time. You can edit this name as needed.
Data Source Description
A description of the data source, such as its use case and business constraints.
Deployment Mode
If you have a self-managed CDH cluster on ECS instances, select Self-managed CDH on ECS.
Instance
Select the ECS instance to which the data source points.
Hive Metastore URI
The connection address of the Hive Metastore. This is the public IP address of the ECS instance that corresponds to the CDH master node. The format is
thrift://<IP address of the master node>:<Port number>. The default port number is 9083.Host Configuration Information
Enter each host-to-IP mapping on a new line.
Example:
192.168.2.153 master.cdh
192.168.2.154 node1.cdh
192.168.2.155 node2.cdh
Une fois les paramètres configurés, cliquez sur Create.
Créer une tâche de migration de données
Dans le volet de navigation de gauche, cliquez sur Data Migration.
Dans le coin supérieur droit, cliquez sur Create Migration Job.
-
Sur la page Create Migration Job, configurez les paramètres dans les sections Source and Destination Settings, Database/Table Migration Settings et Migration Settings.
Source and destination settings
Parameter
Description
Job Name
The name of the data migration job. The system automatically generates a name based on the data source type and current time. You can edit this name as needed.
Data Source
Select an existing Hive data source or create a new one.
Destination Type
Only Data Lake - OSS Storage is supported.
OSS Path
The storage path in OSS for the data of the AnalyticDB for MySQL Data Lakehouse Edition cluster.
Important-
All buckets in the same region as the AnalyticDB for MySQL cluster are displayed. You can select any one of them. Plan the storage path with caution. You cannot change the storage path after it is created.
-
We recommend that you select an empty directory and ensure that its OSS path does not have a prefix relationship with the OSS paths of other jobs. This prevents data from being overwritten. For example, if the OSS paths of two data migration jobs are
oss://adb_demo/test/sls1/andoss://adb_demo/test/, the paths have a prefix relationship, which may cause data to be overwritten during data migration.
Database/table migration settings
ImportantSi un nom de base de données ou de table figure à la fois dans la liste blanche et dans la liste noire, la liste noire est prioritaire et le service ne migre pas la base de données ou la table concernée.
Parameter
Description
Database/Table Migration Whitelist
La tâche migre les bases de données et les tables correspondant à une expression. Saisissez des expressions régulières pour les noms de bases de données et de tables. Séparez plusieurs expressions par des virgules (,).
Database/Table Migration Blacklist
La tâche ne migre pas les bases de données et les tables correspondant à une expression. Saisissez des expressions régulières pour les noms de bases de données et de tables. Séparez plusieurs expressions par des virgules (,).
Migration settings
Parameter
Description
Handling Same Named Destination Table
Specifies how to handle a destination table that already exists:
-
Skip this table (do not migrate): Skips only the current table. The migration of other tables continues.
-
Report error and pause migration: Pauses the migration job. The migration for the table with the same name and all other tables stops.
Job Resource Group
Specify the job resource group in which the job runs.
Required ACUs
Specify the number of ACUs for the job resource group. The minimum value is 4. The maximum value is the number of available computing resources in the job resource group. Allocate more ACUs to improve migration performance and job stability.
Parallel Tasks
The default value is 1. The maximum value is 8.
If you increase this value, multiple migration tasks are started at the same time, and each task migrates one table. However, each task requires at least 4 ACUs. If the number of ACUs is insufficient, the migration tasks run sequentially.
Advanced Settings
Allows you to specify custom configurations for the job. To do so, contact technical support.
-
Une fois les paramètres configurés, cliquez sur Submit.
Démarrer la tâche de migration de données
Sur la page Data Migration, recherchez la tâche de migration créée et cliquez sur Resume dans la colonne Actions.
Cliquez sur Search dans le coin supérieur droit. Lorsque le statut passe à Starting, la tâche de migration a démarré.
Analyse des données
Une fois la tâche de migration réussie, vous pouvez également utiliser la fonctionnalité de découverte de métadonnées pour importer des données depuis OSS vers les éditions Data Lakehouse Edition, puis analyser les données importées dans les éditions Data Lakehouse Edition via Spark Jar. Pour plus d'informations sur le développement Spark, consultez les sections Éditeur de développement Spark et Développement d'applications Spark hors ligne.
-
Dans le volet de navigation de gauche, cliquez sur .
-
Dans le modèle par défaut, saisissez les exemples d'instructions et cliquez sur Run Now.
-- Here is just an example of SparkSQL. Modify the content and run your spark program. conf spark.driver.resourceSpec=medium; conf spark.executor.instances=2; conf spark.executor.resourceSpec=medium; conf spark.app.name=Spark SQL Test; conf spark.adb.connectors=oss; -- Here are your sql statements show tables from lakehouse20220413156_adbTest; Facultatif : Dans l'onglet Applications, cliquez sur Logs dans la colonne Actions pour afficher le journal d'exécution de la tâche Spark SQL.
Gestion des tâches
Sur la page Data Migration, vous pouvez effectuer les opérations suivantes dans la colonne Actions.
|
Actions |
Description |
|
Start |
Démarrez la tâche de migration de données. |
|
View Details |
Consultez la configuration détaillée de la tâche, le nombre de tables migrées et les détails de la migration. |
|
Edit |
Modifiez les propriétés de configuration de la tâche. |
|
Pause |
Mettez en pause la tâche de migration en cours. |
|
Delete |
Supprimez la tâche de migration en cours. |