Este tópico explica como usar o DTS para sincronizar dados de uma instância do ApsaraDB RDS for MySQL para um cluster Elasticsearch.
Pré-requisitos
É necessário ter um cluster Elasticsearch de destino. Para mais informações, consulte Criar um cluster Alibaba Cloud Elasticsearch.
O espaço de armazenamento disponível no cluster Elasticsearch de destino deve ser superior ao espaço utilizado pela instância de origem do ApsaraDB RDS for MySQL.
Precauções
Tipo | Descrição |
Limites do banco de dados de origem |
|
Outros limites |
|
Casos especiais |
|
Faturamento
|
Tipo de sincronização |
Preço |
|
Sincronização de esquema e sincronização completa de dados |
Gratuito. |
|
Sincronização incremental de dados |
Pago. Para mais informações, consulte Visão geral do faturamento. |
Operações SQL sincronizadas
|
Tipo de operação |
Instrução SQL |
|
DML |
INSERT, UPDATE e DELETE Nota
A remoção de colunas via UPDATE não é sincronizada. |
Permissões da conta do banco de dados
|
Banco de dados |
Permissões |
Ações |
|
Instância ApsaraDB RDS for MySQL de origem |
Permissões de leitura nos objetos a serem sincronizados. |
|
|
Instância Elasticsearch de destino |
O nome de usuário (elastic por padrão) e a senha definidos durante a criação da instância Elasticsearch. |
|
Para uma conta de banco de dados de origem criada fora do console do ApsaraDB RDS for MySQL, certifique-se de que ela tenha as permissões REPLICATION CLIENT, REPLICATION SLAVE, SHOW VIEW e SELECT.
Mapeamento de tipos de dados
-
Um banco de dados de origem e uma instância Elasticsearch suportam tipos de dados diferentes que nem sempre podem ser mapeados diretamente. Durante a inicialização da estrutura, o DTS mapeia os tipos de dados com base naqueles suportados pela instância Elasticsearch de destino. Para mais informações, consulte Mapeamento de tipos de dados para inicialização de estrutura.
NotaDurante o processo de migração de esquema do DTS, o parâmetro
dynamicemmappingnão é definido. O comportamento desse parâmetro depende das configurações da sua instância Elasticsearch. Se seus dados de origem forem do tipo JSON, garanta que, para uma chave específica, seus valores correspondentes tenham o mesmo tipo de dados em todas as linhas de uma tabela. Caso contrário, o DTS pode encontrar problemas de sincronização. Para mais informações, consulte dynamic. -
O mapeamento entre Elasticsearch e um banco de dados relacional varia conforme a versão do Elasticsearch.
ImportanteA partir do Elasticsearch 7.0, um índice não suporta mais múltiplos tipos, e os tipos foram completamente removidos no Elasticsearch 8.0. Por padrão, ao configurar uma tarefa de sincronização ou migração, o DTS mapeia uma tabela de um banco de dados relacional para um índice no Elasticsearch. É possível alterar esse mapeamento ao configurar os objetos a serem sincronizados ou migrados.
Elasticsearch 7.0 e posterior
Elasticsearch
Banco de dados relacional
index
table
document
row
field
column
mapping
schema
Versões anteriores ao Elasticsearch 7.0
Elasticsearch
Banco de dados relacional
index
database
type
table
document
row
field
column
mapping
schema
Procedimento
-
Acesse a página da lista de tarefas de sincronização da região de destino. Use um dos dois métodos a seguir:
Pelo console do DTS
Faça login no console do Data Transmission Service (DTS).
No painel de navegação à esquerda, clique em Data Synchronization.
No canto superior esquerdo da página, selecione a região onde a instância de sincronização está localizada.
Pelo console do DMS
NotaAs operações reais podem variar dependendo do modo e do layout do console DMS. Para mais informações, consulte Modo simples e Personalizar o layout e o estilo da interface do DMS.
Faça login no Data Management (DMS).
Na barra de menu superior, escolha .
À direita de Data Synchronization Tasks, selecione a região onde a instância de sincronização está localizada.
Clique em Create Task para abrir a página de configuração da tarefa.
-
Configure os bancos de dados de origem e de destino.
Categoria
Parâmetro
Descrição
N/A
Task Name
O DTS gera automaticamente um nome para a tarefa. Recomendamos especificar um nome descritivo para facilitar a identificação. O nome não precisa ser único.
Source Database
Select Existing Connection
-
Para usar uma instância de banco de dados que foi adicionada ao sistema (recém-criada ou salva), selecione a instância na lista suspensa. As informações do banco de dados serão configuradas automaticamente.
NotaNo console do DMS, este item de configuração chama-se Select a DMS database instance..
-
Se você não adicionou a instância de banco de dados ao sistema, ou se não precisa usar uma instância já adicionada, configure manualmente as seguintes informações do banco de dados.
Database Type
Selecione MySQL.
Connection Type
Selecione Alibaba Cloud Instance.
Instance Region
Selecione a região onde a instância ApsaraDB RDS for MySQL de origem está localizada.
Replicate Data Across Alibaba Cloud Accounts
Neste exemplo, os dados são sincronizados dentro da mesma conta Alibaba Cloud. Selecione No.
RDS Instance ID
Selecione o ID da instância ApsaraDB RDS for MySQL de origem.
Database Account
Insira a conta do banco de dados da instância ApsaraDB RDS for MySQL de origem. Para mais informações sobre as permissões necessárias, consulte Permissões necessárias para contas de banco de dados.
Database Password
Insira a senha correspondente à conta do banco de dados.
Encryption
Selecione Non-encrypted ou SSL-encrypted conforme necessário. Se selecionar SSL-encrypted, você deverá ativar a criptografia SSL para a instância RDS for MySQL antecipadamente. Para mais informações, consulte Usar um certificado cloud para ativar rapidamente a criptografia SSL.
Destination Database
Select Existing Connection
-
Para usar uma instância de banco de dados que foi adicionada ao sistema (recém-criada ou salva), selecione a instância na lista suspensa. As informações do banco de dados serão configuradas automaticamente.
NotaNo console do DMS, este item de configuração chama-se Select a DMS database instance..
-
Se você não adicionou a instância de banco de dados ao sistema, ou se não precisa usar uma instância já adicionada, configure manualmente as seguintes informações do banco de dados.
Database Type
Selecione Elasticsearch.
Connection Type
Selecione Alibaba Cloud Instance.
Instance Region
Selecione a região onde a instância Elasticsearch de destino está localizada.
Type
Selecione Cluster ou Serverless conforme necessário.
Instance ID
Selecione o ID da instância Elasticsearch de destino.
Database Account
Insira a conta usada para conectar à instância Elasticsearch. Este é o Username especificado durante a criação da instância Elasticsearch. A conta padrão é elastic.
Database Password
Insira a senha correspondente à conta do banco de dados.
Encryption
Selecione HTTP ou HTTPS conforme necessário.
-
-
Após concluir a configuração, clique em Test Connectivity and Proceed na parte inferior da página.
NotaCertifique-se de que os blocos CIDR de endereços IP dos servidores DTS estejam adicionados às configurações de segurança dos bancos de dados de origem e de destino para permitir o acesso desses servidores. Isso pode ser feito automática ou manualmente. Para mais informações, consulte Adicionar blocos CIDR de endereços IP dos servidores DTS a uma lista de permissões.
Se o banco de dados de origem ou de destino for autogerenciado (onde o Access Method não é Alibaba Cloud Instance), você também deve clicar em Test Connectivity na caixa de diálogo CIDR Blocks of DTS Servers.
-
Configure os objetos da tarefa.
-
Na página Configure Objects, configure os objetos a serem sincronizados.
Parâmetro
Descrição
Synchronization Types
Os tipos de sincronização. Por padrão, Incremental Data Synchronization vem selecionado. Você também deve selecionar Schema Synchronization e Full Data Synchronization. Após a conclusão da pré-verificação, o DTS sincroniza os dados históricos dos objetos selecionados do banco de dados de origem para o cluster de destino. Os dados históricos servem de base para a sincronização incremental subsequente.
Processing Mode of Conflicting Tables
-
Precheck and Report Errors: Verifica se existe uma tabela com o mesmo nome no banco de dados de destino. Se não existir, a pré-verificação é aprovada. Se existir, a pré-verificação falha e a tarefa de sincronização de dados não é iniciada.
NotaSe não for possível excluir ou renomear a tabela com o mesmo nome no banco de dados de destino, você poderá mapeá-la para um nome diferente. Para mais informações, consulte Mapear nomes de tabelas e colunas.
-
Ignore Errors and Proceed: Ignora a verificação de nomes de tabelas duplicados no banco de dados de destino.
AvisoSelecionar Ignore Errors and Proceed pode causar inconsistência de dados e colocar seu negócio em risco. Por exemplo:
-
Se os esquemas das tabelas forem iguais e um registro no banco de dados de destino tiver o mesmo valor de chave primária ou única que um registro no banco de dados de origem:
-
Durante a sincronização completa, o DTS mantém o registro no cluster de destino. O registro correspondente do banco de dados de origem não é sincronizado.
-
Durante a sincronização incremental, o registro do banco de dados de origem sobrescreve o registro no banco de dados de destino.
-
-
Se os esquemas das tabelas forem diferentes, a sincronização inicial de dados pode falhar. Isso pode resultar na sincronização de apenas dados parciais de colunas ou em uma falha completa da sincronização. Prossiga com cautela.
-
Index Name
-
Se você selecionar Table Name, o índice criado na instância Elasticsearch de destino terá o mesmo nome da tabela.
-
Se você selecionar Database Name_Table Name, o nome do índice na instância Elasticsearch de destino será uma concatenação do nome do banco de dados, um sublinhado (_) e o nome da tabela.
NotaA configuração de mapeamento de nome de índice aplica-se a todas as tabelas.
Capitalization of Object Names in Destination Instance
Você pode configurar a política de diferenciação de maiúsculas e minúsculas para nomes de objetos de banco de dados, tabelas e colunas sincronizados com a instância de destino. Por padrão, a DTS default policy é selecionada. Você também pode optar por usar as políticas padrão dos bancos de dados de origem e de destino. Para mais informações, consulte Política de diferenciação de maiúsculas e minúsculas para nomes de objetos de destino.
Source Objects
Na caixa Source Objects, clique em um objeto para sincronizar e, em seguida, clique em
para movê-lo para a caixa Selected Objects.NotaVocê pode selecionar tabelas ou bancos de dados para sincronizar. Se selecionar tabelas, o DTS não sincronizará outros tipos de objetos, como visualizações, gatilhos ou procedimentos armazenados.
Selected Objects
Se precisar alterar o nome de um campo sincronizado, clique com o botão direito no nome da tabela correspondente na caixa Selected Objects, especifique o nome do índice, o nome do Tipo e outras informações para a tabela na instância Elasticsearch de destino e clique em OK. Para mais informações, consulte Mapear nomes individuais de bancos de dados, tabelas e colunas.
Nota-
Apenas sublinhados (_) são suportados como caracteres especiais em nomes de índices e nomes de Tipos.
-
Você pode definir condições SQL para filtrar os dados a serem sincronizados. Apenas os dados que atendem às condições são sincronizados com a instância de destino. Para mais informações, consulte Filtrar dados usando condições SQL.
-
-
Clique em Next: Advanced Settings para configurar parâmetros avançados.
Parâmetro
Descrição
Dedicated Cluster for Task Scheduling
Por padrão, o DTS agenda tarefas em um cluster compartilhado, e não é necessário selecionar um cluster. Para um desempenho mais estável, você pode adquirir um cluster dedicado para executar tarefas de sincronização do DTS. Para mais informações, consulte O que é um cluster dedicado do DTS?.
Retry Time for Failed Connections
Após o início de uma tarefa de sincronização, se a conexão com o banco de dados de origem ou de destino falhar, o DTS relatará um erro e iniciará imediatamente novas tentativas de conexão. A duração padrão de nova tentativa é de 720 minutos. Você também pode especificar uma duração personalizada de 10 a 1.440 minutos. Recomendamos definir a duração para 30 minutos ou mais. Se o DTS conseguir se reconectar ao banco de dados dentro da duração especificada, a tarefa de sincronização será retomada automaticamente. Caso contrário, a tarefa falhará.
Nota-
Se você tiver várias instâncias DTS (por exemplo, Instância A e Instância B) que compartilham a mesma origem ou destino, e definir o tempo de nova tentativa de rede como 30 minutos para a Instância A e 60 minutos para a Instância B, a duração menor de 30 minutos será usada para ambas.
-
Como o DTS cobra pelo tempo de execução da tarefa durante o período de nova tentativa de conexão, recomendamos personalizar a duração da nova tentativa com base nas necessidades do seu negócio ou liberar a instância DTS o mais rápido possível após a liberação das instâncias de banco de dados de origem e de destino.
Retry Time for Other Issues
Após o início da tarefa de sincronização, se ocorrerem outros problemas não relacionados à conectividade com o banco de dados de origem ou de destino (como exceções de execução DDL ou DML), o DTS relatará um erro e iniciará imediatamente operações contínuas de nova tentativa. A duração padrão de nova tentativa é de 10 minutos. Você também pode personalizar a duração da nova tentativa dentro do intervalo de 1 a 1.440 minutos. Recomendamos definir como 10 minutos ou mais. Se as operações relevantes forem bem-sucedidas dentro da duração de nova tentativa definida, a tarefa de sincronização será retomada automaticamente. Caso contrário, a tarefa falhará.
ImportanteO valor para Retry Time for Other Issues deve ser menor que o valor para Retry Time for Failed Connections.
Enable Throttling for Full Data Synchronization
Durante a fase de sincronização completa, o DTS consome recursos de leitura e gravação dos bancos de dados de origem e de destino, o que pode aumentar a carga sobre eles. Para reduzir a carga nos bancos de dados de origem e de destino, você pode definir um limite de taxa para a tarefa de sincronização completa configurando os parâmetros Queries per second (QPS) to the source database, RPS of Full Data Migration e Data migration speed for full migration (MB/s).
Nota-
Este item de configuração está disponível apenas quando Synchronization Types está definido como Full Data Synchronization.
-
Você também pode ajustar a taxa de sincronização completa depois que a instância de sincronização estiver em execução.
Enable Throttling for Incremental Data Synchronization
Você também pode definir um limite de taxa para a tarefa de sincronização incremental. Para aliviar a pressão no banco de dados de destino, defina RPS of Incremental Data Synchronization e Data synchronization speed for incremental synchronization (MB/s).
Shard Configuration
Defina o número de shards primários e réplicas para o índice com base na configuração máxima de shards do índice na instância Elasticsearch de destino.
String Index
Especifica o método usado para indexar strings sincronizadas com a instância Elasticsearch de destino.
-
analyzed: As strings são analisadas antes de serem indexadas. Você também deve selecionar um analisador específico. Para mais informações sobre tipos de analisadores e suas funções, consulte Analyzers.
-
not analyzed: As strings são indexadas com seus valores originais, sem análise.
-
no: As strings não são indexadas.
Time Zone
Quando dados DATETIME ou TIMESTAMP são sincronizados com a instância Elasticsearch de destino, você pode selecionar um fuso horário.
NotaSe os tipos de dados de data e hora na instância de destino não exigirem um fuso horário, você deve primeiro definir o tipo de documento (type) para esses tipos de dados na instância de destino.
DOCID
Não é necessário configurar este parâmetro. O DOCID assume como padrão a chave primária da tabela. Se a tabela não tiver chave primária, o DOCID será uma coluna ID gerada automaticamente pelo Elasticsearch.
Environment Tag
Você pode selecionar uma tag de ambiente para identificar a instância conforme necessário. Neste exemplo, não é necessário selecionar uma tag.
Configure ETL
Escolha se deseja ativar o recurso de extração, transformação e carga (ETL). Para mais informações, consulte O que é ETL? Valores válidos:
-
Yes: Ativa o recurso ETL. Insira instruções de processamento de dados no editor de código. Para mais informações, consulte Configurar ETL em uma tarefa de migração ou sincronização de dados.
-
No: Desativa o recurso ETL.
Whether to delete SQL operations on heartbeat tables of forward and reverse tasks
Escolha se deseja gravar informações SQL de heartbeat no banco de dados de origem enquanto a instância DTS estiver em execução.
-
Yes: As informações SQL de heartbeat não são gravadas no banco de dados de origem. Isso pode fazer com que a instância DTS relate um atraso.
-
No: Grava informações SQL de heartbeat no banco de dados de origem. Isso pode interferir em recursos como backup físico e clonagem do banco de dados de origem.
Monitoring and Alerting
Especifique se deseja configurar alertas. Se a sincronização falhar ou a latência exceder o limiar especificado, uma notificação será enviada a um contato de alerta.
-
No: Nenhum alerta é configurado.
-
Yes: Configure alertas definindo um limiar de alerta e especificando um alert notification. Para mais informações, consulte Configurar monitoramento e alertas durante a configuração da tarefa.
-
-
Após concluir a configuração anterior, clique em Next: Configure Database and Table Fields na parte inferior da página para definir a política _routing e o valor _id para as tabelas a serem sincronizadas na instância Elasticsearch de destino.
Tipo
Descrição
Set _routing
O recurso _routing direciona documentos para serem armazenados em um shard específico da instância Elasticsearch de destino. Para mais informações, consulte _routing.
-
Se você selecionar Yes, poderá especificar colunas personalizadas para roteamento.
-
Se você selecionar No, o valor _id será usado para roteamento.
NotaSe a instância Elasticsearch de destino for da versão 7.x, você deve selecionar No.
_routing Column
Selecione a coluna a ser usada para roteamento.
NotaEste parâmetro é necessário apenas quando Set _routing estiver definido como Yes.
Value of _id
Selecione a coluna a ser usada como ID do documento.
-
-
-
Salve a tarefa e execute uma pré-verificação.
Para visualizar os parâmetros da API para configurar esta instância, passe o mouse sobre o botão Next: Save Task Settings and Precheck e clique em Preview OpenAPI parameters na dica.
Se terminar de visualizar os parâmetros da API, clique em Next: Save Task Settings and Precheck na parte inferior da página.
NotaAntes do início do trabalho de sincronização, o DTS executa uma pré-verificação. O trabalho só pode começar após a aprovação de todos os itens da pré-verificação.
Se a pré-verificação falhar, clique em View Details para o item com falha. Corrija o problema conforme indicado e execute a pré-verificação novamente.
-
Se a pré-verificação retornar um aviso:
Se um item de verificação falhar e não puder ser ignorado, clique em View Details ao lado do item. Siga as instruções para corrigir o problema e execute a pré-verificação novamente.
Para itens de verificação que podem ser ignorados, clique em Confirm Alert Details, Ignore, OK e Precheck Again em sequência para pular o aviso e executar a pré-verificação novamente. Se você optar por ignorar o item de aviso, isso pode causar problemas como inconsistência de dados e representar riscos ao seu negócio.
-
Adquira a instância.
Quando a Success Rate for de 100%, clique em Next: Purchase Instance.
-
Na página Purchase, selecione o método de faturamento e a especificação de link para a instância de sincronização de dados. A tabela a seguir descreve esses parâmetros em detalhes.
Categoria
Parâmetro
Descrição
New Instance Class
Método de faturamento
-
Assinatura: Você paga ao criar a instância. Adequado para necessidades de longo prazo e mais econômico que o pagamento conforme o uso. Quanto maior a duração da assinatura, maior o desconto.
-
Pagamento conforme o uso: A cobrança é feita por hora. Adequado para necessidades de curto prazo. Você pode liberar a instância imediatamente após o uso para economizar custos.
Configuração do grupo de recursos
O grupo de recursos ao qual a instância pertence. O padrão é default resource group. Para mais informações, consulte O que é Resource Management?.
Especificação de link
O DTS fornece especificações de sincronização com diferentes níveis de desempenho. A especificação do link de sincronização afeta a taxa de sincronização. Escolha uma especificação com base no cenário do seu negócio. Para mais informações, consulte Especificações de link de sincronização de dados.
Duração da assinatura
No modo de assinatura, selecione a duração e a quantidade para a instância de assinatura. Você pode escolher uma assinatura mensal de 1 a 9 meses, ou uma assinatura anual de 1, 2, 3 ou 5 anos.
NotaEsta opção está disponível apenas quando o método de faturamento é Subscription.
-
Após concluir a configuração, leia e selecione Data Transmission Service (Pay-as-you-go) Service Terms.
-
Clique em Buy and Start. Na caixa de diálogo OK, clique em OK.
Você pode visualizar o progresso da tarefa na página Data Synchronization.