O MaxCompute Migration Service (MMS) migra dados de diversas fontes para o MaxCompute. Ele se integra ao mecanismo MaxCompute Spark para simplificar a migração de dados em grande escala a partir de fontes autogerenciadas, reduzindo a complexidade de configuração e os custos de operações e manutenção (O&M).
Visão geral
Arquitetura
O MaxCompute Migration Service (MMS) migra metadados e dados.
Migração de metadados: O MMS obtém metadados da source de dados por meio de APIs de metadados, como Hive Metastore SDK e DataBricks SDK. Em seguida, gera instruções de Linguagem de Definição de Dados (DDL) do MaxCompute e as executa no MaxCompute para concluir a migração.
Migração de dados: Após a sincronização dos metadados, o MMS gera e envia um ou mais jobs do Spark para execução no MaxCompute, conforme a configuração do job de migração. Esses jobs extraem dados da source de dados e os gravam nas tabelas de destino no MaxCompute. O service MMS gerencia todo esse processo, eliminando a necessidade de desenvolver e manter jobs do Spark.
Fluxo de migração
A figura a seguir ilustra o fluxo de trabalho do MaxCompute Migration Service (MMS). O processo inclui estas etapas principais:
Carregar metadados: Após criar um job de migração, o MMS conecta-se à source de dados externa para ler e carregar metadados, como esquemas de tabela e informações de partição. O MMS armazena esses metadados em seu próprio banco de dados para uso posterior.
Criar um job de migração: O MMS oferece suporte a três tipos de jobs de migração: migração completa de banco de dados, migração parcial de tabelas e migração parcial de partições. Cada job divide-se em várias subtarefas executadas simultaneamente para migrar os dados.
Transferir dados e metadados: Cada subtarefa concorrente extrai dados da source de forma independente. Primeiro, cria a tabela ou partição correspondente no projeto de destino e, depois, grava os dados.
Verificar dados (opcional): Após a migração, o MMS pode executar uma etapa de verificação. Ele valida a integridade comparando o número de linhas nas tabelas ou partições de origem e de destino.
Glossário
-
Fonte de dados
-
Objeto a migrar, como um ou mais bancos de dados Hive. Fontes diferentes possuem camadas de dados distintas. O MMS mapeia essas camadas para três níveis: Database, Schema e Table. O schema é uma propriedade da tabela. A tabela a seguir descreve as camadas de dados.
Fonte de dados
Camada de dados
Hive
Database.TableMaxCompute
Project.Schema.TableouProject.Table -
A tabela a seguir descreve a leitura de dados em diferentes fontes:
Tipo de fonte de dados
Service/API de armazenamento de dados
Mecanismo de computação
MaxCompute
Storage API
-
Spark
-
SQL
BigQuery
Storage Read API
Spark
Hive
-
HDFS
-
S3
-
OSS
Databricks
-
Azure BLOB Storage
-
Databricks JDBC
-
-
-
Job de migração
Define os objetos a migrar, que podem ser um banco de dados, várias tabelas ou várias partições.
-
Tarefa de migração
Após selecionar os objetos e enviar o job de migração, o MMS divide o job em várias tarefas independentes conforme a configuração. A tarefa de migração é a unidade real de execução. Os tipos incluem jobs Spark e SQL. Cada tarefa pode corresponder a uma tabela não particionada ou a várias partições de uma tabela particionada. A execução envolve migração de metadados, migração de dados e validação de dados.
-
Validação de dados
Após concluir a migração, o MMS verifica a consistência dos dados. O método executa
SELECT COUNT(*)na origem e no destino para comparar o número de linhas na tabela ou partição, validando a integridade. Os resultados ficam registrados nos logs da tarefa.
Etapas de migração
Etapa 1: Conclua os preparations antes de usar o MaxCompute Migration Service (MMS).
Etapa 2: Prepare a source de dados para migração. Para obter mais informações sobre como configurar diferentes fontes, consulte Manage the Data Source.
Etapa 3: Create and run a migration job.
Etapa 4: Use o recurso de migration monitoring do MMS para visualizar o progresso e a velocidade do job de migração.
Perguntas frequentes
Quais taxas são aplicáveis ao usar o MMS para migração de dados?
O MaxCompute Migration Service (MMS) é gratuito. As seguintes taxas incidem durante a migração de dados:
Taxas de recursos de computação no destino: O MMS envia jobs Spark ou SQL em um projeto do MaxCompute para migrar os dados. Esses jobs consomem unidades de computação (CUs) do MaxCompute e seguem os padrões de faturamento do service. Os métodos suportados são pagamento conforme o uso e assinatura.
Taxas de tráfego de rede: A migração exige conexões de rede, o que gera taxas de tráfego.
Taxas de leitura de dados na origem: Durante a migração, o MMS chama as APIs de recuperação da origem para ler os dados. Isso pode gerar taxas de leitura na origem, conforme suas regras de faturamento.
Como escolher entre o MMS e o DataWorks Data Integration para migração de dados?
MMS: Recomendado para migrações únicas de grandes lotes de dados.
DataWorks Data Integration: Indicado para sincronização e integração contínua e agendada de dados. Também oferece suporte a uma ampla variedade de fontes.