O DataWorks é uma plataforma completa para desenvolvimento e governança de big data. Ele se integra a mecanismos de computação para executar tarefas de processamento de dados e se conecta a fontes de dados para mover informações para dentro e para fora desses mecanismos. Este tópico lista os mecanismos de computação e as fontes de dados compatíveis com o DataWorks.
Ecossistema de mecanismos de computação
O DataWorks não executa tarefas de computação diretamente. Em vez disso, utiliza um mecanismo de vinculação: vincular recursos de computação para registrar um mecanismo na plataforma e, em seguida, crie, orquestrar e gerencie tarefas de processamento de dados a partir de uma interface unificada.
Os seguintes mecanismos de computação são compatíveis:
|
Mecanismo |
Caso de uso típico |
|
Processamento em lote offline em grande escala |
|
|
Consultas interativas em tempo real em grandes conjuntos de dados |
|
|
Processamento de fluxo em tempo real |
|
|
Cargas de trabalho de big data open source (Hadoop, Spark, Hive) no ECS |
|
|
Cargas de trabalho de big data open source baseadas em contêineres |
|
|
Análises em tempo real serverless com StarRocks |
|
|
Jobs Spark serverless sem gerenciamento de cluster |
|
|
Clusters Hadoop Cloudera on-premises |
|
|
Data warehousing nativo da nuvem compatível com MySQL |
|
|
Análises com processamento massivamente paralelo (MPP) |
|
|
Cargas de trabalho Spark integradas ao AnalyticDB |
|
|
Pesquisa de texto completo e pesquisa inteligente |
|
|
OLAP de alto desempenho e relatórios em tempo real |
|
|
Armazenamento multimodelo para IoT e dados de séries temporais |
Ecossistema de fontes de dados
A fonte de dados funciona como ponto de entrada unificado no DataWorks para conexão com sistemas externos. Configure as informações de conexão e as definições de rede uma única vez no Management Center e reutilize essa conexão no Data Integration, Data Studio, Data Map, DataAnalysis e DataService Studio, sem repetir a configuração. No modo padrão, também é possível configure o isolamento de fontes de dados para manter os ambientes de desenvolvimento e produção fisicamente separados.
As subseções abaixo listam as fontes de dados compatíveis com cada módulo do DataWorks.
Visão geral da compatibilidade dos módulos
Utilize esta matriz para verificar quais módulos oferecem suporte a uma fonte de dados específica. Consulte as subseções relevantes abaixo para acessar os links dos guias de configuração.
|
Fonte de dados |
Data Integration |
Data Studio |
Data Map |
DataAnalysis |
DataService Studio |
|
MaxCompute |
✓ |
✓ |
✓ |
✓ |
|
|
Hologres |
✓ |
✓ |
✓ |
||
|
MySQL |
✓ |
✓ |
✓ |
✓ |
|
|
PostgreSQL |
✓ |
✓ |
✓ |
✓ |
|
|
Oracle |
✓ |
✓ |
✓ |
✓ |
|
|
SQL Server |
✓ |
✓ |
✓ |
✓ |
|
|
AnalyticDB for MySQL |
✓ |
✓ |
✓ |
✓ |
|
|
AnalyticDB for PostgreSQL |
✓ |
✓ |
✓ |
✓ |
|
|
StarRocks |
✓ |
✓ |
✓ |
✓ |
✓ |
|
ClickHouse |
✓ |
✓ |
✓ |
||
|
Doris |
✓ |
✓ |
✓ |
✓ |
|
|
PolarDB |
✓ |
✓ |
✓ |
||
|
SelectDB |
✓ |
✓ |
✓ |
||
|
OceanBase |
✓ |
✓ |
✓ |
||
|
Tablestore |
✓ |
✓ |
✓ |
||
|
Tablestore Stream |
✓ |
✓ |
|||
|
Lindorm |
✓ |
✓ |
|||
|
HBase |
✓ |
✓ |
|||
|
Kafka |
✓ |
||||
|
Object Storage Service (OSS) |
✓ |
||||
|
Simple Log Service (SLS) / LogHub |
✓ |
||||
|
DataHub |
✓ |
||||
|
HDFS |
✓ |
||||
|
Amazon S3 |
✓ |
||||
|
Azure Blob Storage |
✓ |
||||
|
BigQuery |
✓ |
||||
|
Amazon Redshift |
✓ |
✓ |
|||
|
Elasticsearch |
✓ |
||||
|
MongoDB |
✓ |
✓ |
|||
|
Redis |
✓ |
||||
|
Maxgraph |
✓ |
||||
|
EMR (Hive, Spark SQL, Impala, Presto, Trino) |
✓ |
||||
|
CDH (Hive, Spark SQL) |
✓ |
✓ |
|||
|
Data Lake Formation (DLF) |
✓ |
✓ |
|||
|
SAP HANA |
✓ |
✓ |
✓ |
||
|
DB2 |
✓ |
✓ |
✓ |
||
|
DM |
✓ |
✓ |
✓ |
||
|
DRDS (PolarDB-X 1.0) |
✓ |
✓ |
|||
|
PolarDB-X 2.0 |
✓ |
||||
|
MariaDB |
✓ |
✓ |
|||
|
KingbaseES |
✓ |
✓ |
|||
|
Vertica |
✓ |
✓ |
|||
|
GBase8a |
✓ |
✓ |
|||
|
Milvus |
✓ |
||||
|
TiDB |
✓ |
||||
|
FTP |
✓ |
||||
|
HttpFile |
✓ |
||||
|
RestAPI (HTTP) |
✓ |
||||
|
Salesforce |
✓ |
||||
|
Sensors Data |
✓ |
||||
|
Memcache (OCS) |
✓ |
||||
|
MetaQ |
✓ |
||||
|
OSS-HDFS |
✓ |
||||
|
TOS |
✓ |
||||
|
TSDB |
✓ |
||||
|
Graph Database (GDB) |
✓ |
||||
|
AnalyticDB for Spark |
✓ |
||||
|
E-MapReduce HIVE |
✓ |
A tabela acima abrange as fontes de dados listadas neste tópico. Para obter a lista completa de fontes de dados e métodos de sincronização compatíveis, consulte Fontes de dados e soluções de sincronização compatíveis .
Data Integration
O Data Integration é o módulo principal para movimentar dados entre sistemas. Configure uma fonte de dados uma única vez no Management Center e utilize-a para definir tarefas de sincronização, escolhendo o escopo de tabela única ou banco de dados completo, além do modo offline ou em tempo real. Os padrões de sincronização compatíveis incluem migração completa, captura incremental (CDC) e sincronização automática completa e incremental.
Para obter instruções de configuração, consulte Gerenciamento de fontes de dados e Fontes de dados e soluções de sincronização compatíveis.
Armazenamento em nuvem
Bancos de dados
Armazenamentos de dados da Alibaba Cloud
Sistemas de big data e open source
NoSQL, APIs e SaaS
Data Studio
O Data Studio oferece suporte à orquestração e ao agendamento híbridos em mecanismos de computação e bancos de dados. Além de mecanismos como MaxCompute, E-MapReduce (EMR) e AnalyticDB, conecte bancos de dados diretamente como nós no pipeline de desenvolvimento. Configure as conexões de fontes de dados e as políticas de agendamento uma única vez e chame-as nos módulos de desenvolvimento e O&M.
Para mais informações, consulte Nós de banco de dados.
|
Fonte de dados MySQL |
Fonte de dados PolarDB MySQL |
Fonte de dados SAP HANA |
|
Fonte de dados SQL Server |
Fonte de dados PolarDB PostgreSQL |
Fonte de dados Vertica |
|
Fonte de dados Oracle |
Fonte de dados Doris |
Fonte de dados DM |
|
Fonte de dados PostgreSQL |
Fonte de dados MariaDB |
Fonte de dados KingbaseES |
|
Fonte de dados StarRocks |
Fonte de dados SelectDB |
Fonte de dados OceanBase |
|
Fonte de dados DRDS |
Fonte de dados Amazon Redshift |
Fonte de dados DB2 |
|
Fonte de dados GBase8a |
|
PolarDB PostgreSQL |
||
Data Map
O Data Map utiliza conexões de fontes de dados pré-configuradas para coletar metadados automaticamente. O coletor integrado recupera esquemas de tabelas de banco de dados, informações de partição e linhagem de dados entre sistemas. Após a coleta, visualize os detalhes das tabelas e o gráfico de linhagem no Data Map para rastrear a origem e o fluxo dos seus ativos de dados.
Para mais informações, consulte Aquisição de metadados.
|
Fonte de dados AnalyticDB for PostgreSQL |
Fonte de dados MySQL |
Fonte de dados Hologres |
|
Fonte de dados AnalyticDB for MySQL |
Fonte de dados PostgreSQL |
Fonte de dados Lindorm |
|
Fonte de dados AnalyticDB for Spark |
Fonte de dados SQL Server |
Fonte de dados MaxCompute |
|
Fonte de dados CDH Hive |
Fonte de dados Oracle |
Fonte de dados StarRocks |
|
Data Lake Formation (DLF) |
Fonte de dados Tablestore (OTS) |
Fonte de dados ClickHouse |
|
Fonte de dados E-MapReduce HIVE |
DataAnalysis
O DataAnalysis permite consultar, analisar, transformar e visualizar dados de forma interativa usando os mecanismos e fontes de dados registrados no DataWorks.
Para mais informações, consulte Consulta e análise SQL.
|
Fonte de dados MaxCompute |
Fonte de dados Hologres |
Fonte de dados EMR Hive |
|
Fonte de dados EMR Spark SQL |
Fonte de dados EMR Impala |
Fonte de dados EMR Presto |
|
Fonte de dados EMR Trino |
Fonte de dados CDH Hive |
Fonte de dados CDH Spark SQL |
|
Fonte de dados StarRocks |
Fonte de dados ClickHouse |
Fonte de dados SelectDB |
|
Fonte de dados Doris |
Fonte de dados AnalyticDB for MySQL 3.0 |
Fonte de dados AnalyticDB for PostgreSQL |
|
Fonte de dados Tablestore (OTS) |
Fonte de dados MySQL |
Fonte de dados PostgreSQL |
|
Fonte de dados Oracle |
Fonte de dados SQL Server |
DataService Studio
O DataService Studio gera APIs a partir de fontes de dados, expondo informações como endpoints de serviço padrão para compartilhamento entre equipes e aplicações.
Para mais informações, consulte Gerar uma API.