O MaxCompute oferece uma solução de data lakehouse que elimina as barreiras entre data lakes e data warehouses. Essa solução combina a flexibilidade e o rico ecossistema dos data lakes com os recursos de implantação corporativa dos data warehouses, permitindo a construção de uma plataforma integrada de gerenciamento de dados.
Notas de uso
A Data Lakehouse Solution 1.0 está disponível apenas nas seguintes regiões: China (Hangzhou), China (Shanghai), China (Beijing), China (Zhangjiakou), China (Shenzhen), China (Hong Kong), Singapura e Alemanha (Frankfurt).
Métodos de implementação
A solução de data lakehouse do MaxCompute integra data warehouses e data lakes. Há suporte para os seguintes métodos de implementação:
Construir um data lakehouse usando MaxCompute, Data Lake Formation e Object Storage Service: Os metadados (schema) do data lake ficam armazenados no Data Lake Formation (DLF). O MaxCompute utiliza os recursos de gerenciamento de metadados do DLF para aprimorar o processamento de dados em formatos semiestruturados no Object Storage Service (OSS). Os formatos compatíveis incluem Delta Lake, Hudi, AVRO, CSV, JSON, PARQUET e ORC.
Construir um data lakehouse usando MaxCompute e Hadoop: Este método permite implantações em data centers locais, em máquinas virtuais na nuvem ou por meio do Alibaba Cloud E-MapReduce. Após a conexão das VPCs das plataformas MaxCompute e Hadoop, o MaxCompute acessa diretamente o serviço de metadados do Hive. Em seguida, os metadados são mapeados para um projeto externo no MaxCompute.
Referências
Após a criação de um projeto externo, a conta responsável passa a ser proprietária das tabelas nele contidas. Para conceder permissões a outros usuários, consulte Usuários e permissões para projetos externos.
Para gerencie projetos externos com SQL, consulte Gerenciar projetos externos usando SQL.
O Spark on MaxCompute permite acessar fontes de dados externas em um data lakehouse. Para migrar o ambiente dos jobs de processamento de dados do Spark para o MaxCompute, consulte Acessar fontes de dados externas em um data lakehouse a partir do Spark.
Para obter detalhes sobre sistemas de arquivos distribuídos e soluções de armazenamento de dados, consulte Processar dados não estruturados usando volumes externos do MaxCompute.