Todos os produtos
Search
Central de documentação

Data Lake Formation:Gerenciamento de dados

Última atualização: Jun 28, 2026

O Data Lake Formation (DLF) oferece APIs de gerenciamento de tabelas compatíveis com o Apache Paimon REST Catalog. A estrutura de armazenamento de arquivos é totalmente compatível com o Paimon e permite que qualquer mecanismo ou aplicação compatível crie, atualize, consulte e exclua tabelas gerenciadas pelo DLF.

A principal hierarquia de dados em um catálogo é a seguinte:

image
  1. Catalog: Contêiner de nível superior para metadados. O catálogo organiza recursos em uma hierarquia que impõe isolamento e limites de permissão entre serviços e usuários, além de governar o armazenamento do data lake e as operações de tabela.

  2. Database: Agrupamento lógico dentro de um catálogo que proporciona organização e controle de acesso mais refinados.

  3. Table: O DLF suporta vários tipos de tabela para gerenciamento unificado e total compatibilidade com diferentes mecanismos de computação e formatos. Para ativar a criptografia em repouso, envie um ticket.

  4. View: As visualizações persistem no DLF e aceitam múltiplos dialetos SQL, o que possibilita a configuração em diferentes mecanismos de computação.

  5. Function: As funções persistem no DLF e atualmente aceitam JARs do Flink (Java e Python), além de funções Lambda Java executadas no mecanismo Spark.

Serviço de metadados unificado

O DLF fornece um serviço unificado de gerenciamento de metadados. Um único catálogo gerencia centralmente os metadados de tabelas, visualizações e funções, eliminando silos entre mecanismos de computação. Assim, os mecanismos de big data e IA da Alibaba Cloud acessam dados omnimodais sem configuração específica por mecanismo.

Suporte a dados multimodais

O DLF gerencia dados estruturados e não estruturados por meio de um único catálogo, com suporte nativo aos principais formatos abertos de tabela e tipos de dados de IA:

  • Formatos de data lake: Suporte completo ao Apache Paimon, Apache Iceberg e componentes do ecossistema.

  • Dados de IA e vetoriais: Compatibilidade com o formato Lance para recuperação e treinamento de IA de alto desempenho.

  • Dados não estruturados: Gerencie conjuntos de dados não tabulares, como imagens e vídeos, usando Object Tables para garantir interoperabilidade entre armazenamento e computação.

  • Formatos de arquivo padrão: Suporte a tabelas em formatos compatíveis com Hive, incluindo Parquet, CSV e ORC.

Controle de acesso unificado

O DLF centraliza o gerenciamento de segurança para aplicar automaticamente uma permissão concedida uma vez em todos os mecanismos de computação conectados, sem necessidade de configuração individual.

  • Autorização granular: Controle o acesso em quatro níveis: catálogo, banco de dados, tabela e coluna.

  • Sincronização multimotor: Autorize uma operação apenas uma vez para que a política entre em vigor em todos os mecanismos de computação conectados.

Essa abordagem garante acesso consistente aos dados, maior segurança e simplifica significativamente as operações e processos de manutenção (O&M) entre mecanismos.