O recurso de extração, transformação e carga (ETL) do Data Transmission Service (DTS) permite criar pipelines de processamento de fluxo em tempo real sem a necessidade de desenvolver uma infraestrutura personalizada. Ele se integra à replicação de dados do DTS para gerenciar a extração dos bancos de dados de origem, a lógica de transformação e a carga nos sistemas de destino, tudo em uma única tarefa. O ETL aumenta a eficiência, reduz a barreira de desenvolvimento e minimiza o impacto sobre os sistemas de negócios.
As tarefas de ETL oferecem dois modos de criação:
Modo DAG — canvas com funcionalidade arrastar e soltar, contendo três componentes integrados: Input/Dimension Table, Transform e Output.
Modo Flink SQL — escrita direta de instruções Flink SQL, compatível com a sintaxe SQL padrão.
Quando usar cada modo
|
Modo DAG |
Modo Flink SQL |
|
|
Mais indicado para |
Equipes que preferem pipelines visuais ou desejam evitar a escrita de SQL |
Equipes familiarizadas com SQL que precisam de lógica personalizada |
|
Criação |
Componentes arrastar e soltar |
Escrita de instruções Flink SQL |
|
Flexibilidade de transformação |
Mais de 90 cenários integrados de Function Compute |
Expressividade completa do Flink SQL |
Bancos de dados suportados
|
Componente |
Bancos de dados suportados |
|
Input/Dimension Table (source) |
MySQL autogerenciado, ApsaraDB RDS for MySQL, PolarDB for MySQL, PolarDB-X 1.0 (anteriormente DRDS), Oracle autogerenciado, PostgreSQL autogerenciado, ApsaraDB RDS for PostgreSQL, Db2 for LUW, Db2 for i, PolarDB for PostgreSQL |
|
Output (destino) |
MySQL autogerenciado, ApsaraDB RDS for MySQL, PolarDB for MySQL, AnalyticDB for MySQL V3.0, Oracle autogerenciado, PostgreSQL autogerenciado, ApsaraDB RDS for PostgreSQL, Db2 for LUW, Db2 for i, PolarDB for PostgreSQL |
Capacidades de transformação
O componente Transform suporta três categorias de operações:
|
Operação |
Descrição |
|
Join |
Combina linhas de múltiplas tabelas de origem ou tabelas de dimensão |
|
Function compute |
Aplica transformações em mais de 90 cenários integrados de computação |
|
Filter |
Selecione ou remove campos antes da carga no destino |
Principais benefícios
Eficiência de computação líder do setor — O recurso ETL integra-se às capacidades de coleta de dados do DTS, garantindo precisão dos dados e eficiência de computação de ponta no mercado.
Monitoramento e gerenciamento flexíveis de tarefas — Monitore e gerencie tarefas de ETL diretamente no console do DTS. É possível iniciar, parar e visualizar detalhes das tarefas.
Casos de uso
Consolidação de dados de fontes heterogêneas — Extraia dados de bancos de tipos diferentes ou localizados em regiões distintas para um único destino em tempo real, viabilizando relatórios e operações centralizadas.
Integração de dados low-code — Construa pipelines de integração por meio de uma interface visual em vez de código personalizado, reduzindo tanto o tempo de desenvolvimento quanto a complexidade operacional.
Data warehousing em tempo real — Envie dados pré-processados diretamente para data warehouses conforme os eventos ocorrem, eliminando a espera por cargas em lote agendadas.
Aceleração de data warehouses offline — Pré-processe dados de streaming antes que cheguem ao data warehouse. Assim, o warehouse atende consultas sem sofrer impacto da ingestão de dados brutos.
Relatórios em tempo real — Alimente painéis e sistemas de relatórios a partir de um fluxo de dados continuamente atualizado, ideal para cenários como monitoramento de operações e análises de negócios.
Computação em tempo real — Limpe e enriqueça dados de streaming para extrair valores de recursos e tags. Cenários típicos incluem perfilamento de usuários, controle de risco e sistemas de recomendação.
Faturamento
O recurso ETL está atualmente em preview público. Durante o período de preview, cada conta pode crie até duas instâncias de ETL gratuitamente.
Após o término do preview público, as instâncias em execução serão cobradas. A Alibaba Cloud notificará os usuários antecipadamente por meio de comunicados e mensagens SMS.