Todos os produtos
Search
Central de documentação

Data Lake Formation:Get started with DLF

Última atualização: Jun 28, 2026

Crie seu primeiro catálogo no Data Lake Formation (DLF) e, em seguida, ingira e analise dados no data lakehouse.

Pré-requisitos

Antes de começar, verifique se você:

  • Concluiu a configuração do DLF (ativação e autorização, necessárias apenas uma vez).

  • (Exclusivo para usuários RAM) Possui as seguintes permissões:

Crie um catálogo

O catálogo é o contêiner de nível superior para metadados no data lakehouse. Ao criar um catálogo, escolha o tipo de redundância de armazenamento conforme seus requisitos de disponibilidade: LRS para armazenamento em zona única com menor custo ou ZRS para replicação entre zonas com maior disponibilidade.

  1. Faça login no console do DLF.

  2. Na página Catalogs, clique em Create Catalog.

  3. Configure os seguintes parâmetros.

    Parâmetro

    Descrição

    Catalog Name

    Nome exclusivo do catálogo.

    Description

    Descrição do catálogo.

    Storage Type

    Fixado como Standard Storage.

    Storage Redundancy Type

    Política de redundância dos metadados do catálogo. Veja a tabela a seguir.

    Opções de redundância de armazenamento:

    Opção

    Comportamento

    Padrão

    LRS (Locally Redundant Storage)

    Armazena metadados em uma única zona. Se a zona ficar indisponível, o catálogo ficará inacessível.

    Sim

    ZRS (Zone-Redundant Storage)

    Replica metadados em várias zonas dentro de uma região para garantir maior disponibilidade. O custo é superior ao do LRS.

    Não

    Importante: Após a criação do catálogo, não é possível alterar o tipo de redundância de ZRS para LRS.

  4. Leia e selecione os Terms of Service e clique em Create Catalog.

Para mais informações, consulte Gerencie catálogos.

Ingerir dados no data lakehouse

Após criar um catálogo, sincronize dados brutos no data lakehouse usando ferramentas como Flink CDC e DataWorks Data Integration.

Analisar dados no data lakehouse

Consulte e extraia insights do data lakehouse usando os seguintes mecanismos:

  • EMR Serverless Spark — operações de leitura e escrita em lote

  • Realtime Compute for Apache Flink — operações de leitura e escrita em streaming

  • EMR Serverless StarRocks — extração de insights dos dados

Próximas etapas