O Data Lake Formation (DLF) integra-se aos principais mecanismos de computação de big data para cargas de trabalho de lakehouse em tempo real e offline, além de Processamento Analítico Online (OLAP). A solução oferece suporte nativo a Flink (VVP), EMR Serverless Spark, EMR Serverless StarRocks e EMR on ECS.
Mecanismos e métodos de conexão compatíveis
A tabela a seguir lista os mecanismos e ferramentas compatíveis com cada método de integração:
|
Método de integração |
Mecanismos/ferramentas compatíveis |
|
Paimon REST |
|
|
Iceberg REST |
|
|
Acesso a arquivos |
|
|
Lance |
Não há suporte para clusters Spark autogerenciados. Para usar o Spark com o DLF, escolha o EMR Serverless Spark ou o EMR on ECS da Alibaba Cloud.
Métodos de integração
O DLF oferece quatro métodos de integração, cada um projetado para um tipo específico de mecanismo e padrão de acesso:
Paimon REST: Interface de serviço de metadados RESTful que segue os padrões da comunidade Apache Paimon. Escolha este método se o mecanismo de computação for baseado no Apache Paimon. Ele gerencia esquemas de tabelas e consultas de snapshot.
Iceberg REST: Interface de serviço de metadados RESTful alinhada aos padrões da comunidade Apache Iceberg. Escolha esta opção para mecanismos de computação baseados no Apache Iceberg. O recurso cuida do gerenciamento de esquemas de tabelas e consultas de snapshot.
Acesso a arquivos: Expõe dados de tabelas como caminhos de arquivo padrão por meio do Paimon Virtual File System (PVFS). Permite acesso direto aos arquivos de dados subjacentes e aos metadados sem exigir um mecanismo de computação completo. Adequado para exploração via scripts, depuração e processamento leve de dados.
Lance: Conecta-se ao catálogo do DLF pelo SDK Python (lance-dlf) para ler e gravar tabelas Lance. Oferece suporte a filtragem de consultas e processamento em lote com o mecanismo Daft DataFrame.