Crie seu primeiro catálogo no Data Lake Formation (DLF) e, em seguida, ingira e analise dados no data lakehouse.
Pré-requisitos
Antes de começar, verifique se você:
Concluiu a configuração do DLF (ativação e autorização, necessárias apenas uma vez).
-
(Exclusivo para usuários RAM) Possui as seguintes permissões:
Permissões de API: A política
AliyunDLFFullAccessou outra que inclua ações de autorização relacionadas a catálogos. Consulte a referência de ações de autorização do RAM.Permissões de dados: A função de sistema
super_administratorouadmin, ou uma função personalizada com permissões relacionadas a catálogos. Consulte Configurar permissões de dados.
Crie um catálogo
O catálogo é o contêiner de nível superior para metadados no data lakehouse. Ao criar um catálogo, escolha o tipo de redundância de armazenamento conforme seus requisitos de disponibilidade: LRS para armazenamento em zona única com menor custo ou ZRS para replicação entre zonas com maior disponibilidade.
Faça login no console do DLF.
Na página Catalogs, clique em Create Catalog.
-
Configure os seguintes parâmetros.
Parâmetro
Descrição
Catalog Name
Nome exclusivo do catálogo.
Description
Descrição do catálogo.
Storage Type
Fixado como Standard Storage.
Storage Redundancy Type
Política de redundância dos metadados do catálogo. Veja a tabela a seguir.
Opções de redundância de armazenamento:
Opção
Comportamento
Padrão
LRS (Locally Redundant Storage)
Armazena metadados em uma única zona. Se a zona ficar indisponível, o catálogo ficará inacessível.
Sim
ZRS (Zone-Redundant Storage)
Replica metadados em várias zonas dentro de uma região para garantir maior disponibilidade. O custo é superior ao do LRS.
Não
Importante: Após a criação do catálogo, não é possível alterar o tipo de redundância de ZRS para LRS.
Leia e selecione os Terms of Service e clique em Create Catalog.
Para mais informações, consulte Gerencie catálogos.
Ingerir dados no data lakehouse
Após criar um catálogo, sincronize dados brutos no data lakehouse usando ferramentas como Flink CDC e DataWorks Data Integration.
Analisar dados no data lakehouse
Consulte e extraia insights do data lakehouse usando os seguintes mecanismos:
EMR Serverless Spark — operações de leitura e escrita em lote
Realtime Compute for Apache Flink — operações de leitura e escrita em streaming
EMR Serverless StarRocks — extração de insights dos dados
Próximas etapas
Gerencie catálogos — crie, modifique e exclua catálogos
Configurar permissões de dados — defina funções e controle de acesso
Referência de ações de autorização do RAM — revise as ações de permissão disponíveis