Tous les produits
Search
Centre de documentation

MaxCompute:Présentation de MaxCompute Migration Service (MMS)

Dernière mise à jour :Aug 10, 2026

MaxCompute Migration Service (MMS) migre des données depuis diverses sources vers MaxCompute. Il s'intègre au moteur Spark de MaxCompute pour simplifier la migration de données à grande échelle depuis des sources autogérées, réduisant ainsi la complexité de configuration et les coûts d'exploitation et de maintenance (O&M).

Présentation

Architecture

MaxCompute Migration Service (MMS) migre à la fois les métadonnées et les données.

image
  • Migration des métadonnées : MMS récupère les métadonnées de la source de données via des API de métadonnées, telles que Hive Metastore SDK et Databricks SDK. Il génère ensuite des instructions DDL (Data Definition Language) MaxCompute et les exécute dans MaxCompute pour finaliser la migration des métadonnées.

  • Migration des données : Une fois les métadonnées synchronisées, MMS génère et soumet un ou plusieurs jobs Spark exécutés sur MaxCompute, selon la configuration du job de migration. Ces jobs Spark extraient les données de la source de données et les écrivent dans les tables cibles de MaxCompute. Le service MMS gère ce processus, éliminant ainsi le besoin de développer et de maintenir les jobs Spark.

Flux de migration

La figure suivante illustre le flux de travail de MaxCompute Migration Service (MMS). Le processus comprend les étapes principales suivantes :

  1. Chargement des métadonnées : Après la création d'un job de migration, MMS se connecte à la source de données externe pour lire et charger les métadonnées, telles que les schémas de table et les informations de partitionnement. MMS stocke ensuite ces métadonnées dans sa propre base de données pour une utilisation ultérieure.

  2. Création d'un job de migration : MMS prend en charge trois types de jobs de migration : migration complète de la base de données, migration partielle des tables et migration partielle des partitions. Chaque job de migration est divisé en plusieurs sous-tâches qui s'exécutent simultanément pour migrer les données.

  3. Transfert des données et des métadonnées : Chaque sous-tâche concurrente extrait indépendamment les données de la source de données. Elle crée d'abord la table ou la partition cible correspondante dans le projet de destination, puis écrit les données.

  4. Vérification des données (facultatif) : Une fois la migration des données terminée, MMS peut effectuer une vérification. Il vérifie l'intégrité des données en comparant le nombre de lignes dans les tables ou partitions source et destination.

image

Glossaire

  • Source de données

    • Objet à migrer, tel qu'une ou plusieurs bases de données Hive. Les différentes sources de données possèdent des couches de données distinctes. MMS mappe les couches de données de diverses sources sur trois niveaux : Database, Schema et Table. Le schéma est une propriété de la table. Le tableau suivant décrit les couches de données.

      |
      **Source de données**
      |
      **Couche de données**
      | | --- | --- | |
      Hive
      |
      `Database.Table`
      | |
      MaxCompute
      |
      `Project.Schema.Table` ou `Project.Table`
      |











    • Le tableau suivant décrit la méthode de lecture des données pour différentes sources de données :

      Type de source de données

      Service de stockage/API de données

      Moteur de calcul

      MaxCompute

      API de stockage

      • Spark

      • SQL

      BigQuery

      API de lecture du stockage

      Spark

      Hive

      • HDFS

      • S3

      • OSS

      Databricks

      • Azure BLOB Storage

      • Databricks JDBC

  • Job de migration

    Un job de migration définit les objets à migrer, qui peuvent être une base de données, plusieurs tables ou plusieurs partitions.

  • Tâche de migration

    Après avoir sélectionné les objets à migrer et soumis le job de migration, MMS divise le job en plusieurs tâches de migration indépendantes selon la configuration. Une tâche de migration constitue l'unité d'exécution réelle. Les types de tâches incluent les jobs Spark et SQL. Chaque tâche peut correspondre à une table non partitionnée ou à plusieurs partitions d'une table partitionnée. Le processus d'exécution de la tâche comprend la migration des métadonnées, la migration des données et la validation des données.

  • Validation des données

    Une fois la migration des données terminée, MMS effectue une vérification pour garantir la cohérence des données. La méthode de vérification consiste à exécuter SELECT COUNT(*) à la fois sur la source et sur la destination afin de comparer le nombre de lignes d'une table ou d'une partition. Cette opération valide l'intégrité des données. Les résultats de la vérification sont enregistrés dans les journaux des tâches.

Étapes de migration

FAQ

Quels frais sont engagés lors de l'utilisation de MMS pour la migration de données ?

L'utilisation de MaxCompute Migration Service (MMS) est gratuite. Les frais suivants sont engagés lors de la migration des données :

  • Frais de ressources de calcul à destination : MMS soumet des jobs Spark ou SQL dans un projet MaxCompute pour effectuer la migration des données. Ces jobs consomment des unités de calcul (CU) MaxCompute et sont facturés selon les standards de facturation de MaxCompute. Les modes de facturation pris en charge sont le paiement à l'utilisation et l'abonnement.

  • Frais de trafic réseau : Des connexions réseau sont nécessaires pendant la migration des données, ce qui engendre des frais de trafic réseau.

  • Frais de lecture des données à la source : Lors de la migration des données, MMS appelle les API de récupération des données de la source pour lire les données. Cela peut entraîner des frais de lecture de données facturés par la source, selon ses règles de facturation.

Comment choisir entre MMS et DataWorks Data Integration pour la migration de données ?

  • MMS : MMS convient aux migrations de données ponctuelles et par lots volumineux.

  • DataWorks Data Integration : Ce service est adapté à la synchronisation et à l'intégration continues et planifiées des données. Il prend également en charge un large éventail de sources de données.