Todos os produtos
Search
Central de documentação

Elastic High Performance Computing:Visualize E-HPC monitoring information

Última atualização: Jun 27, 2026

O painel de monitoramento do E-HPC oferece visibilidade em tempo real sobre nós de computação, armazenamento compartilhado e recursos de jobs por meio de quatro visualizações: Overview, Node Monitoring, Storage Monitoring e Job Monitoring. Utilize esses dados para identificar gargalos de recursos, acompanhar a integridade da fila de jobs e tomar decisões de agendamento fundamentadas.

Pré-requisitos

Antes de começar, verifique se você possui:

  • Um cluster no estado Running

  • Um cluster com o modo de implantação definido como Public cloud cluster

  • Um cluster executando o agendador Slurm ou PBS

  • Um componente de monitoramento instalado no cluster

  • (Apenas usuários RAM) Permissão para visualizar informações de monitoramento no console E-HPC. Para mais detalhes, consulte Conceder permissões a um usuário RAM

Visualizar monitoramento do cluster

  1. Faça login no console E-HPC.

  2. Na parte esquerda da barra de navegação superior, selecione uma região.

  3. No painel de navegação à esquerda, clique em Cluster.

  4. Na página Cluster List, clique no ID do cluster que deseja monitorar.

  5. No painel de navegação à esquerda, escolha Operation and maintenance management > Job Monitoring.

  6. Clique em uma aba para visualizar os dados de monitoramento correspondentes.

Nota

Nas abas Node Monitoring, Storage Monitoring e Job Monitoring, utilize os controles de intervalo de tempo para delimitar os dados. Clique em um botão predefinido para visualizar a última 1 hour, 4 hours, 12 hours ou 1 day. Para consultar uma janela específica, selecione um horário inicial e final personalizado. O intervalo personalizado máximo é de um mês.

Para obter a lista completa de métricas em cada aba, consulte Métricas.

image

Métricas

Overview

A aba Overview exibe um resumo do estado dos recursos em todo o cluster:

  • Total Compute Nodes — número total de nós de computação no cluster

  • Shared Storage Space — capacidade total de armazenamento compartilhado

  • Total Jobs — quantidade total de jobs em todos os estados

  • Average Load — carga média do sistema em todos os nós de computação

Abaixo do resumo, cada nó de computação é listado com seu status de agendamento e uso de recursos. Valores de status de agendamento:

Status

Descrição

Idle

Todos os núcleos estão ociosos. O nó está disponível com capacidade total e pronto para aceitar novos jobs.

Running

Alguns núcleos estão em uso; os núcleos restantes ainda podem aceitar novos jobs.

Allocated

Todos os núcleos estão ocupados. Novos jobs ficam na fila até que um núcleo fique disponível.

Offline

O nó não está participando da computação e não aceita novos jobs.

Monitoramento de nós

A aba Node Monitoring apresenta métricas de desempenho dos nós de computação. Filtre por cluster ou fila para restringir a visualização.

Métrica

Descrição

CPU Utilization

Percentual de poder de processamento em uso nos nós de computação. Uma utilização sustentada acima de 80–90% indica uso eficiente de recursos, mas pode degradar o desempenho ao longo do tempo. Valores na faixa de 0–30% podem sinalizar subutilização ou problemas de agendamento.

Memory Usage

Consumo de memória nos nós de computação. Monitore regularmente para evitar falhas de jobs causadas por estouro de buffer. Caso o uso esteja consistentemente alto, aumente a capacidade de memória ou otimize a alocação.

System Load

Carga de trabalho nos nós de computação. Uma proporção elevada entre carga e número de nós indica pressão sobre os recursos. Para reduzir a carga, adicione nós (scale-out) ou otimize o agendamento de jobs.

Disk Usage

Consumo de armazenamento em disco. Com 100% de uso do disco, as operações de gravação falham. Remova dados redundantes ou expanda a capacidade de armazenamento antes de atingir esse limiar.

Disk Read and Write

Taxas de leitura e gravação de dados. Unidade: KB/s. Utilize essas taxas para avaliar o desempenho de I/O e detectar gargalos que afetam o throughput de jobs.

Network Traffic

Dados transferidos entre nós de computação pela virtual private network (VPC). Acompanhe os períodos de pico de tráfego para identificar problemas de largura de banda antecipadamente.

Monitoramento de armazenamento

A aba Storage Monitoring exibe métricas dos sistemas de arquivos Apsara File Storage NAS (NAS) conectados ao cluster.

Métrica

Descrição

Storage Space

Uso de armazenamento do sistema de arquivos NAS. Para evitar esgotamento do armazenamento, configure alertas de monitoramento, execute limpezas regulares de dados e expanda a capacidade proativamente.

Files

Número total de arquivos no sistema de arquivos NAS. Uma grande quantidade de arquivos aumenta a complexidade de gerenciamento e pode afetar o desempenho de recuperação. Se a contagem ultrapassar seu limiar, limpe arquivos desnecessários.

IOPS

Média de operações de leitura e gravação por segundo no intervalo de tempo selecionado. Unidade: requisições/s.

Latency

Latência média de leitura e gravação por operação no intervalo de tempo selecionado. Unidade: milissegundos.

Throughput

Throughput médio de leitura e gravação no intervalo de tempo selecionado. Unidade: KiB.

Metadata QPS

Número médio de requisições de metadados por segundo no intervalo de tempo selecionado. Unidade: requisições/s.

Para mais informações sobre métricas de armazenamento NAS, consulte Monitoramento de desempenho e FAQ sobre o desempenho de sistemas de arquivos NAS.

Monitoramento de jobs

A aba Job Monitoring mostra o consumo de recursos dos jobs e a integridade da fila. Filtre por cluster, fila, projeto ou usuário.

Métrica

Descrição

Jobs

Quantidade de jobs em execução no momento. Um aumento repentino de jobs em execução em relação aos recursos disponíveis pode causar contenção de recursos. Otimize o agendamento ou remova jobs desnecessários para melhorar o throughput.

Total Cores Required by Enqueued Jobs

Total de núcleos de CPU solicitados por jobs aguardando na fila. Se esse valor exceder o número de núcleos disponíveis, os jobs enfileirados esperarão mais tempo. Adicione núcleos ou ajuste a prioridade dos jobs para reduzir o tempo de espera.

Job Wait Duration

Tempo médio que os jobs passam aguardando na fila. Um aumento na duração da espera sinaliza contenção de recursos. Priorize jobs de alta prioridade para melhorar a utilização geral.

Total Cores Used by Running Jobs

Total de núcleos de CPU ocupados por jobs atualmente em execução. Utilize esta métrica juntamente com CPU Utilization para confirmar se os núcleos alocados estão sendo usados ativamente.

Job CPU Utilization

Proporção entre núcleos de CPU efetivamente utilizados pelos jobs e núcleos solicitados. Baixa utilização pode indicar configurações ineficientes de jobs ou anomalias na carga de trabalho. Revise as especificações dos jobs e os padrões de carga para melhorar a eficiência.

Job Memory Usage

Proporção entre a memória efetivamente utilizada pelos jobs e a memória solicitada. Para evitar estouro de buffer ou memória insuficiente causada por uso excessivamente alto, ajuste as solicitações de memória ou atualize as especificações dos nós para corresponder ao uso real.