A aba Data Overview na página de detalhes de uma tabela oferece um panorama do espaço de armazenamento e da atividade de acesso. Utilize essas métricas para identificar tabelas com crescimento acelerado, inativas ou que precisam de limpeza, sem a necessidade de consultar os dados diretamente.
Caso o recurso de gerenciamento de data lake esteja ativado, a aba também exibe a distribuição por classe de armazenamento e por tamanho de arquivo.
Métricas
|
Métrica |
O que mede |
Source de dados |
|
Size |
Tamanho total de todos os dados armazenados na tabela |
Local gerenciado pelo DLF: estatísticas do Object Storage Service (OSS). Outros locais: estatísticas do mecanismo E-MapReduce (EMR). |
|
Total Number of Tables |
Quantidade total de arquivos armazenados na tabela |
Local gerenciado pelo DLF: estatísticas do OSS. Outros locais: estatísticas do mecanismo EMR. |
|
Number of Partitions |
Número total de partições na tabela |
Metadados |
|
DDL Last Updated |
Última alteração no esquema da tabela por meio de uma instrução de linguagem de definição de dados (DDL) |
Local gerenciado pelo DLF: estatísticas do OSS |
|
Data Last Updated |
Última modificação nos dados da tabela |
Local gerenciado pelo DLF: estatísticas do OSS |
|
File Visits within Last Day |
Quantidade de acessos à tabela no último dia |
Mecanismos de computação (atualmente apenas EMR — consulte os requisitos). Atualizado diariamente às 00:00, com atraso de aproximadamente 10 minutos. |
|
File Visits within Last Seven Days |
Quantidade de acessos à tabela nos últimos sete dias |
Mecanismos de computação (atualmente apenas EMR) |
|
File Visits within Last 30 Days |
Quantidade de acessos à tabela nos últimos 30 dias |
Mecanismos de computação (atualmente apenas EMR) |
Requisitos para as métricas de File Visits
As métricas de File Visits exigem o seguinte:
Versão do EMR V3.45.1 ou posterior, ou V5.11.1 ou posterior. Para outras versões, atualize primeiro o componente EMRHOOK em um gateway do EMR. Consulte Atualizar o componente EMRHOOK em um gateway do EMR.
Somente os mecanismos de computação Spark e Hive são suportados.
Casos de uso
Otimização de armazenamento: Ordene as tabelas por Size para localizar as maiores e priorizá-las para otimização de camadas de armazenamento ou compactação.
Arquivamento frio: Utilize as métricas de File Visits para detectar tabelas sem acessos recentes. Aquelas com poucos ou nenhum acesso em 30 dias são candidatas ao armazenamento de arquivamento frio.
Limpeza de dados obsoletos: Classifique por Data Last Updated para encontrar tabelas não atualizadas há muito tempo. Analise esses itens para decidir se devem ser limpos ou removidos.
Visualizar a visão geral de dados de uma tabela
Faça login no console do DLF.
No painel de navegação à esquerda, escolha Metadata > Metadata.
Clique em Table. Defina os parâmetros Catalog List e Database Name e insira o nome da tabela desejada na busca.
Clique em nome da tabela para abrir sua página de detalhes.
Clique em Data Overview.