O MaxCompute oferece uma solução de data lakehouse para criar uma plataforma de gestão de dados que une a flexibilidade dos data lakes à implantação corporativa dos data warehouses. Use essa solução para executar análises SQL em dados de formato aberto armazenados no Object Storage Service (OSS) ou em clusters Hadoop.
A solução de data lakehouse está em preview público.
Capacidades
A solução de data lakehouse do MaxCompute permite:
Consultar dados no local de origem — execute SQL diretamente nos dados do OSS sem movê-los para o MaxCompute
Usar formatos abertos — processe nativamente arquivos Delta Lake, Apache Hudi, AVRO, CSV, JSON, Parquet e ORC
Unificar a gestão de metadados — mapeie schemas externos de data lakes em projetos externos do MaxCompute para garantir governança consistente
Aproveitar a infraestrutura existente — conecte-se a clusters Hadoop em data centers, máquinas virtuais (VMs) na nuvem ou E-MapReduce (EMR) sem migrar dados
Métodos de criação
O MaxCompute atua como data warehouse na solução de lakehouse. Escolha o método de criação conforme o local de armazenamento dos seus dados e metadados.
Crie um lakehouse com MaxCompute, DLF e OSS
Quando usar: seus dados estão no OSS e você precisa de uma camada de metadados nativa da nuvem e totalmente gerenciada.
O Data Lake Formation (DLF) armazena todos os schemas do data lake. O MaxCompute usa a capacidade de gestão de metadados do DLF para consultar dados semiestruturados no OSS diretamente, com suporte aos formatos Delta Lake, Apache Hudi, AVRO, CSV, JSON, Parquet e ORC.
Para obter instruções de configuração, consulte Criar um data lakehouse usando MaxCompute, DLF e OSS.
Crie um lakehouse com MaxCompute e Hadoop
Cenário indicado: você já tem um cluster Hadoop (on-premises, em VMs na nuvem ou no Alibaba Cloud E-MapReduce) e precisa consultar esses dados pelo MaxCompute sem migração.
Conecte o MaxCompute à Virtual Private Cloud (VPC) onde o cluster Hadoop está em execução. O MaxCompute acessa os metastores do Hive diretamente e mapeia os metadados para projetos externos do MaxCompute.
Para obter instruções de configuração, consulte Criar um data lakehouse usando MaxCompute e Hadoop.
Limitações
Regiões suportadas: China (Hangzhou), China (Shanghai), China (Beijing), China (Zhangjiakou), China (Shenzhen), China (Hong Kong), Singapura e Alemanha (Frankfurt).
Requisito de colocalização: implante o MaxCompute na mesma região do DLF e do OSS.
Próximos passos
Conceder permissões a outros usuários em um projeto externo — a conta usada para criar o projeto externo é a proprietária; conceda acesso a outros usuários separadamente.
Usar instruções SQL para gerenciar um projeto externo — gerencie projetos externos com SQL após a configuração.