Todos os produtos
Search
Central de documentação

AnalyticDB:Lake storage

Última atualização: Jul 31, 2026

O recurso de lake storage do AnalyticDB for MySQL simplifica a construção de data lakes e o gerenciamento de armazenamento. Ele permite armazenar dados estruturados em tabelas nos formatos Iceberg e Paimon, além de objetos de arquivo não estruturados, sendo ideal para cenários que exigem processamento em lote offline e análises em tempo real. Este tópico descreve os modos de armazenamento, os tipos de armazenamento e as operações de gerenciamento de recursos do lake storage.

Pré-requisitos

É necessário ter um cluster AnalyticDB for MySQL Enterprise Edition, Basic Edition ou Data Lakehouse Edition criado.

Ativar o lake storage

O recurso de lake storage está em preview por convite. Para ativá-lo, envie um ticket e entre em contato com o suporte técnico.

Modos de armazenamento

Antes de criar uma tabela de data lake, defina onde os dados serão armazenados. O AnalyticDB for MySQL oferece dois modos de armazenamento. A escolha ocorre no momento da criação da tabela e não pode ser alterada posteriormente.

Dimensão

Lake storage gerenciado (lake interno)

OSS de propriedade do usuário (lake externo)

Gerenciamento de armazenamento

O AnalyticDB for MySQL gerencia totalmente os buckets de armazenamento subjacentes de forma automática

Os usuários gerenciam seus próprios buckets do OSS

Principais parâmetros de criação de tabela

catalog_type='ADB' + adb_lake_bucket (XIHE SQL); ou TBLPROPERTIES ('adb_lake_bucket' = '...') + SET spark.adb.lakehouse.enabled=true (Spark SQL)

LOCATION 'oss://...'

Ativação

Requer a ativação prévia do lake storage

Nenhuma configuração adicional necessária para acesso na mesma conta

Casos de uso

Novos projetos que exigem operações simplificadas

Dados existentes no OSS ou requisitos de armazenamento autogerenciado

  • Lake storage gerenciado: Os dados ficam em buckets subjacentes gerenciados automaticamente pelo AnalyticDB for MySQL. Leia e grave nas tabelas do lake usando SQL padrão, sem precisar gerenciar sistemas de arquivos, configurações de permissão ou políticas de ciclo de vida. Para mais informações, consulte Create a lake storage.

  • OSS de propriedade do usuário: Todos os dados são armazenados em um bucket do OSS especificado por você na mesma região. Defina o caminho do OSS por meio do parâmetro LOCATION durante a criação da tabela.

Nota

A sintaxe de criação de tabela varia conforme o mecanismo. Para mais detalhes, consulte a documentação de leitura e gravação do mecanismo correspondente em Next steps.

Tipos de armazenamento

O lake storage gerenciado do AnalyticDB for MySQL disponibiliza dois tipos de armazenamento. Escolha a solução mais adequada às necessidades do seu negócio.

Dimensão

Basic

Standard

Armazenamento subjacente

Armazenamento de objetos OSS

AFS (AnalyticDB Filesystem), armazenamento de objetos de alta performance

Protocolo de acesso

API do OSS

Protocolo compatível com S3, com suporte adicional à interface POSIX (em preview por convite)

Casos de uso

Análise de dados de uso geral e processamento em lote offline

Treinamento e inferência de IA/ML, computação de alta performance e processamento de dados multimodais

Características de performance

Throughput e latência padrão

Alto throughput, baixa latência e cache multinível integrado

Camadas de dados quentes e frios

Não suportado

Suportado — dados quentes ficam no AFS e dados frios são movidos automaticamente para o OSS

Ativação

Envie um ticket

Envie um ticket

Basic (lake storage padrão OSS)

O lake storage Basic utiliza o armazenamento de objetos Alibaba Cloud OSS, sendo adequado para a maioria dos cenários de análise de dados de uso geral e processamento em lote offline. Após a criação, o sistema gera automaticamente um bucket no OSS sob a conta de service. Esse bucket reside na mesma região do seu cluster e possui o mesmo nome do lake storage.

Standard (lake storage de alta performance AFS)

O AFS (AnalyticDB Filesystem) é um armazenamento de objetos de alta performance compatível com S3, oferecendo capacidades avançadas de ingestão e persistência de dados para o lake storage do AnalyticDB for MySQL. O AFS foi projetado para cenários que demandam maior performance de armazenamento, como treinamento e inferência de IA/ML e processamento de dados multimodais em grande escala.

Capacidades principais:

  • Compatibilidade com protocolo S3: Utilize diretamente cadeias de ferramentas padrão, como AWS SDK e Spark/Flink S3A, para acessar o AFS sem modificar as ferramentas existentes.

  • Interface POSIX (em preview por convite): Acesse os mesmos dados tanto pelas APIs S3 quanto por montagens POSIX, atendendo a cenários de treinamento e inferência que dependem de caminhos de arquivo.

  • Camadas de dados quentes e frios: Dados quentes permanecem no AFS para garantir acesso de alta performance, enquanto dados frios migram automaticamente para o OSS. O namespace unificado é transparente para as aplicações da camada superior, equilibrando custo e performance.

  • Segurança e permissões: O AFS suporta um modelo de permissões granular baseado em políticas S3, permitindo autorização de privilégio mínimo por bucket, caminho e tipo de operação. Também há suporte ao sistema de usuários e AccessKey para isolamento entre múltiplas equipes.

Interface POSIX

Pipelines de treinamento e inferência de IA/ML geralmente dependem de caminhos de arquivo POSIX em vez de chaves S3. O AFS fornece uma interface POSIX sobre a API S3, trazendo os seguintes benefícios principais:

  • Treinamento e inferência sem modificações: Operadores Ray e checkpoints de modelo podem ler e gravar diretamente nos pontos de montagem, sem necessidade de migrar para o SDK S3.

  • Acesso dual aos mesmos dados: Pipelines de produção upstream gravam via S3, enquanto o treinamento ou recuperação downstream lê pela interface POSIX — sem cópia e sem movimentação de dados.

Importante

A interface POSIX está atualmente em preview por convite. Para utilizar este recurso, envie um ticket.

Faturamento

Observações de uso

  • Uma conta Alibaba Cloud pode criar até cinco lake storages na mesma região.

  • Existe um atraso na atualização do uso de armazenamento exibido para o lake storage. Portanto, o volume de dados atualizado pode não aparecer imediatamente após a gravação.

  • Antes de excluir um lake storage, remova todos os dados contidos nele. Caso contrário, a exclusão falhará.

  • Ao criar um lake storage, o AnalyticDB for MySQL cria automaticamente um bucket no OSS sob sua conta de service. Esse bucket fica na mesma região do seu cluster AnalyticDB for MySQL e tem o mesmo nome do lake storage. Para visualizar esse bucket no console do OSS sob sua conta Alibaba Cloud, adicione um caminho favorito.

    Clique para ver como encontrar o bucket do OSS

    1. Faça login no console do OSS.

    2. No painel de navegação à esquerda, clique em Favorite Paths.

    3. Na caixa de diálogo Add Favorite Paths, selecione um Adding Method e especifique a Region e o Bucket Name.

      Adding Method: Selecione Add from other authorized buckets.

      Region: A região do seu cluster AnalyticDB for MySQL.

      Bucket: Insira o Lake Storage Name.

  • O recurso de backup e recuperação do AnalyticDB for MySQL não suporta dados armazenados no lake storage.

Criar um lake storage

Standard

O lake storage Standard baseia-se no armazenamento de objetos de alta performance AFS. Para criá-lo, primeiro crie um cluster de armazenamento e depois um bucket.

  1. Faça login no console do AnalyticDB for MySQL. No canto superior esquerdo do console, selecione uma região. No painel de navegação à esquerda, clique em Clusters. Localize o cluster desejado e clique em Storage Cluster Management.

  2. No painel de navegação à esquerda, escolha Data Management > Lake Storages.

  3. Clique em Storage Cluster Management.

  4. Clique em Create Cluster.

  5. Na caixa de diálogo Create Cluster, a Storage Class está fixa como Standard. Defina o Reserved Resource Size, insira opcionalmente uma Cluster Description e clique em OK.

    Nota

    A criação do cluster de armazenamento leva algum tempo. Aguarde a conclusão antes de prosseguir.

  6. Clique em Bucket Management.

  7. Clique em Create Bucket.

  8. Na caixa de diálogo Create Bucket, configure os parâmetros abaixo e clique em OK.

    • Type: Selecione Standard.

    • Cluster: Selecione o cluster de armazenamento criado na etapa anterior.

    • Bucket Name: Insira um nome para o bucket. O nome deve ser globalmente único e não pode ser alterado após a criação.

    • Data Redundancy Type: Selecione Zone-Redundant Storage ou Locally Redundant Storage.

    • Bucket Description: (Opcional) Insira uma descrição para diferenciar cenários de negócios distintos.

Basic

  1. Faça login no console do AnalyticDB for MySQL. No canto superior esquerdo do console, selecione uma região. No painel de navegação à esquerda, clique em Clusters. Localize o cluster desejado e clique em Bucket Management.

  2. No painel de navegação à esquerda, escolha Data Management > Lake Storages.

  3. Na aba Bucket Management, clique em Create Bucket.

  4. Na caixa de diálogo Create Bucket, configure os parâmetros abaixo e clique em OK.

    • Type: Selecione Basic.

    • Bucket Name: Gerado automaticamente pelo sistema. Não é necessário inserir um nome.

    • Bucket Description: (Opcional) Insira uma descrição para diferenciar cenários de negócios distintos.

    • Data Redundancy Type: Selecione Zone-Redundant Storage ou Locally Redundant Storage.

    Importante

    O nome do bucket é gerado automaticamente no formato adb-lake-<Region ID>-<Random String>. O nome é globalmente único e não pode ser alterado após a criação.

  5. (Opcional) Modifique a descrição do bucket.

    O nome do bucket é gerado automaticamente e não pode ser modificado. Recomendamos alterar a descrição do bucket para diferenciá-lo de outros usados em cenários de negócios diferentes.

    1. Na coluna Bucket Description do bucket alvo, clique em image.

    2. Na caixa de diálogo Edit Bucket Description, insira uma descrição e clique em OK.

  6. (Opcional) Adicione autorização.

    Na coluna Actions, clique em Add Authorization e escolha autorizar um usuário RAM ou uma função RAM.

    Nota
    • Somente leitura: Permite que os usuários visualizem os dados do lake storage, mas não os modifiquem ou excluam.

    • Leitura/gravação: Permite que os usuários leiam, gravem e modifiquem dados.

    • Apenas uma conta Alibaba Cloud ou um usuário RAM com as permissões necessárias pode conceder permissões.

    • As alterações de permissão entram em vigor imediatamente. Confirme o escopo da autorização antes de prosseguir.

Visualizar endpoint de conexão

Após criar um lake storage standard, visualize seu endpoint de conexão S3 no console. Use esse endpoint para configurar ferramentas compatíveis com S3, como AWS SDK e Spark/Flink S3A, para acessar o lake storage AFS.

  1. No painel de navegação à esquerda, escolha Data Management > Lake Storages.

  2. Na aba Bucket Management, localize o bucket standard alvo e visualize seu endpoint de conexão S3 na coluna Endpoint.

Nota

Este endpoint é acessível apenas dentro da mesma VPC. Certifique-se de que suas ferramentas ou aplicações estejam implantadas na mesma VPC.

O lake storage Basic não suporta o protocolo S3. A coluna Endpoint exibe um hífen (-) para buckets Basic.

Visualizar volume de dados do lake storage

  1. No painel de navegação à esquerda, escolha Data Management > Lake Storages.

  2. Verifique o volume de dados na coluna Storage Usage do lake storage alvo.

    Importante

    Existe um atraso na atualização do uso de armazenamento exibido para o lake storage. Portanto, o volume de dados atualizado pode não aparecer imediatamente após a gravação.

Excluir um lake storage

  1. No painel de navegação à esquerda, escolha Data Management > Lake Storages.

  2. Na coluna Actions do lake storage alvo, clique em Delete.

  3. Na caixa de diálogo Delete exibida, clique em OK.

    Importante

    Antes de excluir um lake storage, remova todos os dados contidos nele. Caso contrário, a exclusão falhará.

Próximas etapas

Definir formato padrão de tabela (apenas Spark SQL)

Importante

Este recurso aplica-se apenas ao mecanismo Spark SQL.

Defina um formato de tabela padrão no nível do banco de dados para que novas tabelas criadas nele usem automaticamente o formato especificado, sem necessidade de declaração individual por tabela.

  1. No grupo de recursos de job Spark, grupo de recursos interativo ou job enviado, defina o seguinte parâmetro:

    spark.sql.adb.sources.extractProviderFromDBProperties.enabled true
  2. Ao criar um banco de dados, especifique DBPROPERTIES com 'storage.format' definido como um dos seguintes formatos: delta, iceberg, parquet ou orc. Exemplo:

    CREATE DATABASE IF NOT EXISTS db_storage_format 
    LOCATION 'oss://path/to/db/' 
    WITH DBPROPERTIES ('storage.format'='delta');

    Após executar esta instrução, as tabelas criadas no banco de dados db_storage_format usarão o formato delta por padrão. Se você especificar explicitamente um formato de tabela usando using ${tableFormat} ao criar uma tabela, o formato especificado explicitamente terá precedência.

Operações de tabela de data lake

Com base no mecanismo e formato de lake escolhidos, consulte a documentação correspondente para criar tabelas e realizar operações de leitura/gravação: