Todos os produtos
Search
Central de documentação

Data Lake Formation:Otimização automática de armazenamento de tabelas Paimon

Última atualização: Jul 17, 2026

A otimização de armazenamento do DLF simplifica a manutenção de tabelas Paimon por meio de compactação adaptativa, limpeza de snapshots expirados, gerenciamento do ciclo de vida de partições e remoção de arquivos órfãos. Este guia aborda as estratégias de otimização disponíveis e como o DLF as executa.

Estratégias de otimização de armazenamento

Tipo de estratégia

Descrição

Mecanismo de execução do DLF

Compactação

Mescla arquivos pequenos em arquivos maiores, reduzindo a quantidade de arquivos, a sobrecarga de metadados e os custos de busca durante consultas. Melhora o desempenho de consultas em tabelas Paimon.

O DLF aciona a compactação automaticamente ao confirmar gravações de dados.

Limpeza de snapshots expirados

Snapshots protegem arquivos de dados referenciados contra exclusão, preservando estados históricos. Conforme os snapshots se acumulam, o consumo de armazenamento aumenta. Expirar snapshots desnecessários libera espaço de armazenamento.

O DLF aciona a limpeza de snapshots expirados automaticamente durante jobs de otimização de armazenamento. O tempo de expiração padrão é de uma hora, ajustável por meio de parâmetros da tabela Paimon. Para mais informações, consulte Limpar dados expirados.

Gerenciamento do ciclo de vida de partições

Muitos cenários exigem apenas dados recentes. Particione dados por tempo e defina regras de expiração para excluir automaticamente partições antigas, liberando armazenamento. Configure camadas inteligentes de armazenamento para mover dados pouco acessados da classe Standard para classes de custo mais baixo (Infrequent Access, Archive ou Cold Archive).

Configure o tempo de expiração por meio de parâmetros da tabela Paimon em Definir tempo de expiração de partição. Após a configuração, a limpeza é acionada automaticamente durante jobs de otimização de armazenamento do DLF. Use camadas inteligentes de armazenamento para mover dados de partições elegíveis para classes de armazenamento de menor custo, ou altere manualmente a classe de armazenamento na página Table Details. A página Storage Overview mostra a distribuição de camadas entre catálogos, bancos de dados e tabelas.

Limpeza de arquivos órfãos

Arquivos órfãos existem no caminho de armazenamento da tabela, mas nenhum snapshot os referencia. Geralmente resultam de jobs de gravação interrompidos, falhas em commits ou resíduos deixados por processos de limpeza anormais. Como nenhum snapshot os referencia, a expiração de snapshots não pode removê-los, exigindo limpeza periódica.

Acione a limpeza de arquivos órfãos manualmente pelo console ou ative a limpeza automática. Os arquivos órfãos limpos são movidos temporariamente para a lixeira (system.trash) e excluídos após o período de retenção.

Ativar ou desativar a otimização inteligente de armazenamento

Nota

A aba Storage Optimization aparece apenas para tabelas Paimon.

  1. Faça login no console do DLF

  2. Na página Catalogs, clique em nome do catálogo.

  3. Na aba Database, clique em nome do banco de dados desejado para visualizar suas tabelas.

  4. Na lista Tables, clique em nome da tabela desejada para visualizar as informações de schema.

  5. Clique em aba Storage Optimization. O interruptor de otimização inteligente de armazenamento vem ativado por padrão. Para desativá-lo, clique em interruptor image.

Visualizar e configurar estratégias de otimização de armazenamento

Compactação

Na aba Storage Optimization, clique em Compaction para visualizar o status de execução, registros de redimensionamento e histórico de execução.

Edite o modo de política conforme suas necessidades:

Modo de recursos dinâmicos (recomendado)

O sistema dimensiona automaticamente os recursos de computação com base na carga de trabalho em tempo real, eliminando o planejamento manual de capacidade. Indicado para tráfego flutuante. Três preferências de configuração estão disponíveis:

  • Balanced: Equilibra velocidade de compactação e consumo de recursos (padrão).

  • Low latency: Aloca mais recursos para compactação mais rápida, reduzindo o atraso na visibilidade dos dados.

  • Low resource usage: Limita o uso de recursos para reduzir custos de computação, resultando em maior tempo de compactação.

    Alocação dinâmica de recursos e dimensionamento

    No modo de recursos dinâmicos, o sistema aloca recursos de computação com base na carga de trabalho em tempo real e nas características dos dados. Os fatores a seguir orientam a alocação de recursos e o dimensionamento automático.

    Throughput de gravaçãoO tráfego de gravação é o principal fator determinante. Maior tráfego de gravação aciona mais recursos de computação para manter a ingestão de dados estável.

    Concorrência ativaO número de partições e buckets ativos determina os requisitos de recursos. Mais partições e buckets ativos resultam em mais recursos de processamento paralelo.

    Escala de dados para recursos avançadosTabelas com recursos avançados, como vetores de exclusão ou produtor de changelog lookup, aumentam a complexidade computacional. Tamanhos totais maiores de arquivos dentro de partições ativas exigem mais recursos.

    Características das linhas de dadosTamanhos extremos de linhas aumentam a sobrecarga de processamento. Se as linhas forem muito pequenas (muitos valores nulos) ou muito grandes (campos de string longos), o sistema aumenta a alocação de recursos para manter o desempenho.

    Otimização de recursos para tabelas pequenas

    Para tabelas pequenas, o sistema utiliza um mecanismo de compartilhamento para reduzir a sobrecarga de recursos:

    Quando uma tabela usa bucketing adiado (bucket = -2) e o modo "Prioritize Latency" não está ativado, o sistema combina tarefas de otimização de várias tabelas pequenas em um único job, reduzindo o consumo geral de recursos.

    Monitoramento de recursos e solução de problemas

    Para analisar o consumo de recursos, acesse Catalogs > Resource Overview > Resource Requests e visualize a lista Top Tables by CU-Hours.

    Nota

    Uso anormalmente alto de recursos para uma única tabela geralmente é causado por uma estratégia de particionamento excessivamente granular, que aumenta as partições simultaneamente ativas e força alocação excessiva de recursos. Revise e otimize sua estratégia de particionamento.

Modo de recursos fixos

Especifique manualmente os recursos de computação para compactação. Adequado para tráfego estável ou controle rigoroso de custos.

  • Requisitos de configuração: Mínimo de 2 CU.

  • Configurações de parâmetros: Personalize o intervalo de acionamento da compactação e a contagem de buckets.

Visualizar status de execução

Visualize o status de execução da otimização para a tabela atual e configure assinaturas de alertas do CloudMonitor por meio de Monitorar otimização do lakehouse.

Visualizar registros de redimensionamento

Registra eventos de redimensionamento de buckets para uma tabela ou partições específicas, refletindo alterações na estrutura física de armazenamento. O redimensionamento resolve problemas de desempenho decorrentes de mudanças no volume de dados. Use esses registros para verificar se uma tabela está passando por redimensionamento, o que impede a compactação.

Visualizar histórico de execução

Visualize o histórico de execução de compactação da tabela atual. Utilize esses registros para:

  1. Confirmar execução de tarefas: Verifique se as tarefas de compactação em segundo plano estão sendo executadas corretamente e evite o acúmulo de arquivos pequenos.

  2. Avaliar eficiência da compactação: Compare a quantidade e o tamanho dos arquivos antes e depois da compactação para avaliar a eficácia da estratégia.

Limpeza de snapshots expirados

Na aba Storage Optimization, clique em Expired Snapshot Cleanup para configurar regras de limpeza e visualizar resultados.

  • Configure regras de limpeza de snapshots

    Clique em Modify, defina o Snapshot Retention Period (o padrão é 1 hora) e clique em Save.

  • Visualize resultados da limpeza de snapshots

    • Contagem atual de snapshots: Quantidade de snapshots restantes.

    • Informações do snapshot mais antigo: Detalhes do snapshot mais antigo, incluindo ID do snapshot, horário do commit, tipo de commit, contagem total de linhas e linhas adicionadas no commit.

Gerenciamento do ciclo de vida de partições

Na aba Storage Optimization, clique em Partition Lifecycle para configurar regras de limpeza, visualizar resultados e definir camadas de armazenamento.

Regras de limpeza de partições

  1. Clique em interruptor image ao lado de Expired Partition Cleanup para ativá-lo.

  2. Configure as seguintes regras de limpeza e clique em Save.

    Também é possível definir essas configurações por meio de pares chave-valor nas opções da tabela.

    Parâmetro

    Descrição

    Expiration Policy

    (partition.expiration-strategy)

    Selecione uma das seguintes estratégias de expiração:

    • Baseada no último acesso (access-time): Expira partições com base no horário do último acesso.

    • Baseada no valor da partição (values-time): Permite configurar o formato e o padrão do timestamp da partição.

      • Formato do timestamp (partition.timestamp-formatter): Configure formatos como yyyy-MM-dd, yyyyMdd, dd/MM/yyyy e dd.MM.yyyy.

      • Padrão do timestamp (partition.timestamp-pattern): Por padrão, o primeiro campo de partição é utilizado. Configure padrões como $dt ou $year-$month-$day.

    • Baseada na última atualização (update-time): Expira partições com base no horário da última atualização.

    Partition Retention Period

    (partition.expiration-time)

    Unidade: dias. Exemplo: 30d. O valor máximo é 999.999 dias. O período de retenção começa com base na estratégia de expiração selecionada.

  3. (Opcional) Após salvar, clique em Cleanup Rule Settings ao lado de Modify para modificar as configurações.

Nota

Para reter partições permanentemente, não configure regras de expiração. O sistema não limpa dados de partições por padrão.

Resultados da limpeza de partições

Clique em View Partitions para visualizar a lista de partições, incluindo nome da partição, contagem de linhas, arquivos referenciados, tamanho do arquivo, criador, classe de armazenamento, último modificador, timestamps e ações.

Camadas de armazenamento

Parâmetro

Descrição

Intelligent Tiering

imageQuando ativado, o sistema aplica camadas de armazenamento automaticamente para todas as tabelas no catálogo com base nas regras de ciclo de vida configuradas. Especifique a estratégia e as regras conforme necessário.

Nota
  • Se ativado no nível do catálogo, as tabelas herdam a configuração por padrão. Modificações no nível da tabela substituem a configuração do catálogo e removem o indicador de herança.

  • Se não estiver ativado no nível do catálogo, ainda é possível ativá-lo no nível da tabela.

Tiering Strategy

  • Last access time: Avalia regras com base no horário do último acesso aos dados da tabela ou partição.

  • Last update time: Avalia regras com base no horário da última atualização dos dados da tabela ou partição.

Tiering Rule

Os requisitos mínimos de duração de armazenamento variam conforme a classe de armazenamento.

Configure as regras de camadas:

  • Transição para Infrequent Access

    • Limiar de inatividade: Personalizado. O padrão é 30 dias.

      Os dados passam para o armazenamento Infrequent Access após esse período de inatividade. Os mecanismos de computação ainda podem acessar os dados, mas com desempenho reduzido.

    • Converter automaticamente para armazenamento Standard ao acessar: Converte uma tabela ou partição de volta para o armazenamento Standard quando acessada.

      Nota

      Este recurso é suportado apenas quando a estratégia de camadas está definida como "Last access time".

  • Transição para Archive

    • Limiar de inatividade: Personalizado. O padrão é 60 dias.

      Os dados passam para o armazenamento Archive após esse período de inatividade. Mecanismos de computação não podem acessar dados arquivados.

    • Converter automaticamente para armazenamento Standard ao acessar: Converte uma tabela ou partição de volta para o armazenamento Standard quando acessada.

      Nota

      Este recurso é suportado apenas quando a estratégia de camadas está definida como "Last access time".

  • Transição para Cold Archive

    • Limiar de inatividade: Personalizado. O padrão é 180 dias.

      Os dados passam para o armazenamento Cold Archive após esse período de inatividade. Mecanismos de computação não podem acessar dados em cold archive.

Nota

Além das camadas inteligentes de armazenamento, você pode alterar manualmente a classe de armazenamento na página de detalhes da tabela. A página Storage Overview mostra a distribuição de camadas entre catálogos, bancos de dados e tabelas.

Limpeza de arquivos órfãos

Na aba Storage Optimization, clique em Orphan file cleanup para acionar manualmente a limpeza de arquivos órfãos.

Para ativar a limpeza automática, adicione auto-orphan-files-clean.enabled = true à configuração do catálogo. Os arquivos órfãos limpos são movidos temporariamente para a lixeira (system.trash). Ajuste o tempo de permanência dos arquivos na lixeira com a configuração de catálogo dlf.trashed-file-retained-days.

Alterar manualmente a classe de armazenamento

  1. Na lista Database, clique em nome de um banco de dados para visualizar a lista de tabelas.

  2. Na lista Tables, clique em nome de uma tabela para visualizar seu schema.

  3. Clique em aba Table Details para alterar manualmente a classe de armazenamento de tabelas particionadas e não particionadas.

    Tabelas particionadas

    Na aba Partitions, altere a classe de armazenamento das partições.

    • Para partições nas classes de armazenamento Standard, Infrequent Access ou Archive:

      Na coluna Actions, clique em Modify Storage Class para alterar para qualquer outra classe de armazenamento.

    • Para partições na classe de armazenamento Cold Archive:

      Restaure os dados primeiro e depois altere a classe de armazenamento:

      1. Clique em Restore e configure a Restored Copy Availability Duration. Selecione várias partições para uma restauração em lote.

        • Intervalo de valores: Um número inteiro de 1 a 365 (unidade: dias).

        • Valor padrão: 1 dia.

      2. Quando os dados entrarem no estado restaurado, clique em Modify Storage Class na coluna Actions para alterar a classe de armazenamento.

    Tabelas não particionadas

    Na seção Basic Information da tabela, modifique a Storage Class.

    • Para classes de armazenamento Standard, Infrequent Access ou Archive:

      Clique em Edit ao lado de Storage Class para alterar para qualquer outra classe de armazenamento.

    • Para a classe de armazenamento Cold Archive:

      Restaure os dados primeiro e depois altere a classe de armazenamento:

      1. Clique em Restore ao lado de Storage Class e configure a Restored Copy Availability Duration.

        • Intervalo de valores: Um número inteiro de 1 a 365 (unidade: dias).

        • Valor padrão: 1 dia.

      2. Quando a Storage Class mudar para Cold Archive (Restored), clique em Edit ao lado de Storage Class. Em seguida, altere para qualquer outra classe de armazenamento.

    Nota
    • Tempo de restauração: O Cold Archive suporta apenas prioridade de restauração padrão, que leva de 2 a 5 horas.

    • Horário de início do estado restaurado: Quando o primeiro objeto Cold Archive em uma partição entra no estado restaurado após a conclusão da restauração.

    • Duração de disponibilidade da cópia restaurada: Tempo durante o qual os dados permanecem acessíveis após a restauração do Cold Archive. Após a expiração, a partição retorna ao estado congelado. Envie uma nova solicitação de restauração para acessá-la novamente.

    Procedimento de restauração

    1. O objeto inicia no estado congelado.

    2. Após enviar uma solicitação de restauração, o objeto entra no estado de restauração. O tempo de restauração varia.

    3. Após a conclusão da restauração, o objeto entra no estado restaurado. Para camadas de armazenamento no nível da tabela, a partição torna-se acessível depois que todos os objetos forem restaurados.

      Estenda o estado restaurado ajustando a duração de disponibilidade da cópia restaurada, até o máximo permitido para a classe de armazenamento.

    4. Após a expiração da duração de disponibilidade da cópia restaurada, o objeto retorna ao estado congelado. Envie uma nova solicitação de restauração para acessá-lo novamente.