O painel de monitoramento do E-HPC oferece visibilidade em tempo real sobre nós de computação, armazenamento compartilhado e recursos de jobs por meio de quatro visualizações: Overview, Node Monitoring, Storage Monitoring e Job Monitoring. Utilize esses dados para identificar gargalos de recursos, acompanhar a integridade da fila de jobs e tomar decisões de agendamento fundamentadas.
Pré-requisitos
Antes de começar, verifique se você possui:
Um cluster no estado Running
Um cluster com o modo de implantação definido como Public cloud cluster
Um cluster executando o agendador Slurm ou PBS
Um componente de monitoramento instalado no cluster
(Apenas usuários RAM) Permissão para visualizar informações de monitoramento no console E-HPC. Para mais detalhes, consulte Conceder permissões a um usuário RAM
Visualizar monitoramento do cluster
Faça login no console E-HPC.
Na parte esquerda da barra de navegação superior, selecione uma região.
No painel de navegação à esquerda, clique em Cluster.
Na página Cluster List, clique no ID do cluster que deseja monitorar.
No painel de navegação à esquerda, escolha Operation and maintenance management > Job Monitoring.
Clique em uma aba para visualizar os dados de monitoramento correspondentes.
Nas abas Node Monitoring, Storage Monitoring e Job Monitoring, utilize os controles de intervalo de tempo para delimitar os dados. Clique em um botão predefinido para visualizar a última 1 hour, 4 hours, 12 hours ou 1 day. Para consultar uma janela específica, selecione um horário inicial e final personalizado. O intervalo personalizado máximo é de um mês.
Para obter a lista completa de métricas em cada aba, consulte Métricas.

Métricas
Overview
A aba Overview exibe um resumo do estado dos recursos em todo o cluster:
Total Compute Nodes — número total de nós de computação no cluster
Shared Storage Space — capacidade total de armazenamento compartilhado
Total Jobs — quantidade total de jobs em todos os estados
Average Load — carga média do sistema em todos os nós de computação
Abaixo do resumo, cada nó de computação é listado com seu status de agendamento e uso de recursos. Valores de status de agendamento:
|
Status |
Descrição |
|
Idle |
Todos os núcleos estão ociosos. O nó está disponível com capacidade total e pronto para aceitar novos jobs. |
|
Running |
Alguns núcleos estão em uso; os núcleos restantes ainda podem aceitar novos jobs. |
|
Allocated |
Todos os núcleos estão ocupados. Novos jobs ficam na fila até que um núcleo fique disponível. |
|
Offline |
O nó não está participando da computação e não aceita novos jobs. |
Monitoramento de nós
A aba Node Monitoring apresenta métricas de desempenho dos nós de computação. Filtre por cluster ou fila para restringir a visualização.
|
Métrica |
Descrição |
|
CPU Utilization |
Percentual de poder de processamento em uso nos nós de computação. Uma utilização sustentada acima de 80–90% indica uso eficiente de recursos, mas pode degradar o desempenho ao longo do tempo. Valores na faixa de 0–30% podem sinalizar subutilização ou problemas de agendamento. |
|
Memory Usage |
Consumo de memória nos nós de computação. Monitore regularmente para evitar falhas de jobs causadas por estouro de buffer. Caso o uso esteja consistentemente alto, aumente a capacidade de memória ou otimize a alocação. |
|
System Load |
Carga de trabalho nos nós de computação. Uma proporção elevada entre carga e número de nós indica pressão sobre os recursos. Para reduzir a carga, adicione nós (scale-out) ou otimize o agendamento de jobs. |
|
Disk Usage |
Consumo de armazenamento em disco. Com 100% de uso do disco, as operações de gravação falham. Remova dados redundantes ou expanda a capacidade de armazenamento antes de atingir esse limiar. |
|
Disk Read and Write |
Taxas de leitura e gravação de dados. Unidade: KB/s. Utilize essas taxas para avaliar o desempenho de I/O e detectar gargalos que afetam o throughput de jobs. |
|
Network Traffic |
Dados transferidos entre nós de computação pela virtual private network (VPC). Acompanhe os períodos de pico de tráfego para identificar problemas de largura de banda antecipadamente. |
Monitoramento de armazenamento
A aba Storage Monitoring exibe métricas dos sistemas de arquivos Apsara File Storage NAS (NAS) conectados ao cluster.
|
Métrica |
Descrição |
|
Storage Space |
Uso de armazenamento do sistema de arquivos NAS. Para evitar esgotamento do armazenamento, configure alertas de monitoramento, execute limpezas regulares de dados e expanda a capacidade proativamente. |
|
Files |
Número total de arquivos no sistema de arquivos NAS. Uma grande quantidade de arquivos aumenta a complexidade de gerenciamento e pode afetar o desempenho de recuperação. Se a contagem ultrapassar seu limiar, limpe arquivos desnecessários. |
|
IOPS |
Média de operações de leitura e gravação por segundo no intervalo de tempo selecionado. Unidade: requisições/s. |
|
Latency |
Latência média de leitura e gravação por operação no intervalo de tempo selecionado. Unidade: milissegundos. |
|
Throughput |
Throughput médio de leitura e gravação no intervalo de tempo selecionado. Unidade: KiB. |
|
Metadata QPS |
Número médio de requisições de metadados por segundo no intervalo de tempo selecionado. Unidade: requisições/s. |
Para mais informações sobre métricas de armazenamento NAS, consulte Monitoramento de desempenho e FAQ sobre o desempenho de sistemas de arquivos NAS.
Monitoramento de jobs
A aba Job Monitoring mostra o consumo de recursos dos jobs e a integridade da fila. Filtre por cluster, fila, projeto ou usuário.
|
Métrica |
Descrição |
|
Jobs |
Quantidade de jobs em execução no momento. Um aumento repentino de jobs em execução em relação aos recursos disponíveis pode causar contenção de recursos. Otimize o agendamento ou remova jobs desnecessários para melhorar o throughput. |
|
Total Cores Required by Enqueued Jobs |
Total de núcleos de CPU solicitados por jobs aguardando na fila. Se esse valor exceder o número de núcleos disponíveis, os jobs enfileirados esperarão mais tempo. Adicione núcleos ou ajuste a prioridade dos jobs para reduzir o tempo de espera. |
|
Job Wait Duration |
Tempo médio que os jobs passam aguardando na fila. Um aumento na duração da espera sinaliza contenção de recursos. Priorize jobs de alta prioridade para melhorar a utilização geral. |
|
Total Cores Used by Running Jobs |
Total de núcleos de CPU ocupados por jobs atualmente em execução. Utilize esta métrica juntamente com CPU Utilization para confirmar se os núcleos alocados estão sendo usados ativamente. |
|
Job CPU Utilization |
Proporção entre núcleos de CPU efetivamente utilizados pelos jobs e núcleos solicitados. Baixa utilização pode indicar configurações ineficientes de jobs ou anomalias na carga de trabalho. Revise as especificações dos jobs e os padrões de carga para melhorar a eficiência. |
|
Job Memory Usage |
Proporção entre a memória efetivamente utilizada pelos jobs e a memória solicitada. Para evitar estouro de buffer ou memória insuficiente causada por uso excessivamente alto, ajuste as solicitações de memória ou atualize as especificações dos nós para corresponder ao uso real. |