O Data Lake Formation (DLF) oferece APIs de gerenciamento de tabelas compatíveis com o Apache Paimon REST Catalog. A estrutura de armazenamento de arquivos é totalmente compatível com o Paimon e permite que qualquer mecanismo ou aplicação compatível crie, atualize, consulte e exclua tabelas gerenciadas pelo DLF.
A principal hierarquia de dados em um catálogo é a seguinte:
Catalog: Contêiner de nível superior para metadados. O catálogo organiza recursos em uma hierarquia que impõe isolamento e limites de permissão entre serviços e usuários, além de governar o armazenamento do data lake e as operações de tabela.
Database: Agrupamento lógico dentro de um catálogo que proporciona organização e controle de acesso mais refinados.
Table: O DLF suporta vários tipos de tabela para gerenciamento unificado e total compatibilidade com diferentes mecanismos de computação e formatos. Para ativar a criptografia em repouso, envie um ticket.
View: As visualizações persistem no DLF e aceitam múltiplos dialetos SQL, o que possibilita a configuração em diferentes mecanismos de computação.
Function: As funções persistem no DLF e atualmente aceitam JARs do Flink (Java e Python), além de funções Lambda Java executadas no mecanismo Spark.
Serviço de metadados unificado
O DLF fornece um serviço unificado de gerenciamento de metadados. Um único catálogo gerencia centralmente os metadados de tabelas, visualizações e funções, eliminando silos entre mecanismos de computação. Assim, os mecanismos de big data e IA da Alibaba Cloud acessam dados omnimodais sem configuração específica por mecanismo.
Suporte a dados multimodais
O DLF gerencia dados estruturados e não estruturados por meio de um único catálogo, com suporte nativo aos principais formatos abertos de tabela e tipos de dados de IA:
Formatos de data lake: Suporte completo ao Apache Paimon, Apache Iceberg e componentes do ecossistema.
Dados de IA e vetoriais: Compatibilidade com o formato Lance para recuperação e treinamento de IA de alto desempenho.
Dados não estruturados: Gerencie conjuntos de dados não tabulares, como imagens e vídeos, usando Object Tables para garantir interoperabilidade entre armazenamento e computação.
Formatos de arquivo padrão: Suporte a tabelas em formatos compatíveis com Hive, incluindo Parquet, CSV e ORC.
Controle de acesso unificado
O DLF centraliza o gerenciamento de segurança para aplicar automaticamente uma permissão concedida uma vez em todos os mecanismos de computação conectados, sem necessidade de configuração individual.
Autorização granular: Controle o acesso em quatro níveis: catálogo, banco de dados, tabela e coluna.
Sincronização multimotor: Autorize uma operação apenas uma vez para que a política entre em vigor em todos os mecanismos de computação conectados.
Essa abordagem garante acesso consistente aos dados, maior segurança e simplifica significativamente as operações e processos de manutenção (O&M) entre mecanismos.