O GPU Monitoring utiliza a pilha Exporter, Prometheus e Grafana para oferecer suporte a cenários avançados de monitoramento de GPU. Este tópico descreve os painéis do dashboard de monitoramento.
Visão geral dos painéis
O GPU Monitoring inclui três dashboards: GPUs - Cluster Dimension, GPUs - Nodes e GPUs - Pods. As seções a seguir detalham cada um deles.
GPUs - Cluster Dimension
|
Nome do painel |
Descrição |
|
Total GPU Nodes |
Quantidade total de nós com GPU no cluster ou node pool. |
|
Allocated GPUs |
Número total de GPUs no cluster ou node pool e quantidade alocada. |
|
Allocated GPU Memory |
Percentual da memória total de GPU alocada. |
|
Used GPU Memory |
Percentual da memória total de GPU em uso. |
|
Average GPU Utilization |
Utilização média de GPU no cluster ou node pool. |
|
GPU Memory Copy Utilization |
Utilização média de cópia de memória no cluster ou node pool. |
|
The Last One XID Error |
Erro XID mais recente em uma placa de GPU no cluster. |
|
GPU Node Details |
Detalhes dos nós com GPU no cluster, incluindo: Node Name, GPU Index, GPU Utilization, GPU Memory Copy Utilization, Used GPU Memory, Allocated GPU Memory, Total GPU Memory, Power, GPU Temperature e GPU Memory Temperature. |
GPUs - Nodes
Overview
Métricas resumidas de um único nó. Use estes painéis para avaliar a integridade geral da GPU e o status de alocação antes de analisar os gráficos detalhados.
|
Nome do painel |
Descrição |
|
GPU Mode |
Modo de alocação de GPU no nó: Exclusive (recursos alocados por placa de GPU), Share (recursos alocados por memória de GPU e poder computacional) ou None (nenhum aplicativo de GPU em execução no nó; um nó pode alternar entre os modos Exclusive e Share, mas, sem programas de GPU em execução, o sistema não detecta o modo ativo). |
|
NVIDIA Driver Version |
Versão do driver NVIDIA instalado no nó. |
|
Allocated GPUs |
Quantidade de GPUs alocadas no nó em relação ao total disponível. |
|
GPU Utilization |
Utilização média de GPU em todas as placas do nó. |
|
Allocated GPU Memory |
Percentual da memória total de GPU alocada no nó. |
|
Used GPU Memory |
Percentual da memória total de GPU em uso no nó. |
|
Allocated Computing Power (Valid in GPU Sharing) |
Poder computacional alocado. Aplica-se apenas quando o compartilhamento de GPU está ativado e há solicitação de agendamento de poder computacional. |
|
The Last One XID Error |
Erro XID mais recente em uma placa de GPU no nó. |
Utilization
Gráficos de séries temporais da atividade de computação e do mecanismo de codificação/decodificação da GPU. Use estes painéis para identificar se as cargas de trabalho têm limitação de computação ou de codificador/decodificador.
|
Nome do painel |
Descrição |
|
GPU Utilization |
Utilização da placa de GPU no nó. |
|
GPU Memory Copy Utilization |
Utilização de cópia de memória na placa de GPU. |
|
Encoder Engine Utilization |
Utilização do mecanismo de codificação na placa de GPU. |
|
Decoder Engine Utilization |
Utilização do mecanismo de decodificação na placa de GPU. |
Memory & BAR1
Detalhes de uso de memória e BAR1 das placas de GPU no nó. Use estes painéis para acompanhar a pressão sobre a memória e identificar placas próximas ao limite.
|
Nome do painel |
Descrição |
|
GPU Memory Details |
Detalhamento da memória de GPU por placa, incluindo: UUID, GPU Index, Mode Name (modelo da placa), Used Percentage, Used (quantidade de memória de GPU em uso), Allocated (percentual da memória total de GPU alocada) e Total (memória total de GPU na placa). |
|
BAR1 Used |
Quantidade de memória BAR1 em uso nas placas de GPU. |
|
GPU Memory Used |
Quantidade de memória de GPU em uso nas placas do nó. |
|
BAR1 Total |
Memória BAR1 total disponível nas placas de GPU. |
GPU process
Atividade de GPU no nível de processo no nó. Use estes painéis para identificar quais pods e containers consomem recursos de GPU e detectar usos não autorizados.
|
Nome do painel |
Descrição |
|
GPU Process Details |
Detalhes dos processos de GPU no nó, incluindo: Pod Namespace, Pod Name, Container Name, Allocate Mode (Exclusive ou Share), Process ID, Process Name, Process Type (computação (C) ou gráficos (G)), GPU Index, Used Memory, Streaming Multiprocessor (SM) Utilization, Memory Copy Utilization, Decode Utilization e Encode Utilization. |
|
Illegal GPU Process (GPU request not by k8s resources.limits) Details |
Detalhes de processos que acessam recursos de GPU sem usar limites de recursos do Kubernetes. Inclui: executar aplicativo de GPU diretamente em um nó; executar aplicativo de GPU em container iniciado com o comando |
Profiling
Métricas de atividade de pipeline de GPU de baixo nível coletadas pelo DCGM. Use estes painéis para diagnosticar cargas de trabalho limitadas por memória versus computação e identificar gargalos no pipeline.
|
Nome do painel |
Descrição |
|
Graphics Engine Active |
Percentual de tempo em que o mecanismo Graphics ou Compute permanece ativo durante um ciclo de monitoramento. |
|
DRAM Active |
Utilização da largura de banda de memória. |
|
SM Active |
Percentual de tempo em que as unidades SM permanecem ativas. |
|
SM Occupancy |
Taxa de ocupação do SM. |
|
Tensor Core Engine Active |
Percentual de tempo em que o pipeline Tensor Core permanece ativo durante um ciclo de monitoramento. |
|
FP32 Engine Active |
Percentual de tempo em que o pipeline FP32 permanece ativo durante um ciclo de monitoramento. |
|
FP16 Engine Active |
Percentual de tempo em que o pipeline FP16 permanece ativo durante um ciclo de monitoramento. |
|
FP64 Engine Active |
Percentual de tempo em que o pipeline FP64 permanece ativo durante um ciclo de monitoramento. |
|
PCIE TX Bytes (Device to Host) |
Taxa de transferência de dados pelo barramento PCIe do dispositivo GPU para o host. |
|
PCIE RX Bytes (Host to Device) |
Taxa de transferência de dados pelo barramento PCIe do host para o dispositivo GPU. |
|
NVLINK TX Bytes |
Dados enviados via NVLink. |
|
NVLINK RX Bytes |
Dados recebidos via NVLink. |
Temperature & Energy
Métricas térmicas e de energia. Monitore estes painéis para detectar throttling térmico ou consumo elevado contínuo de energia.
|
Nome do painel |
Descrição |
|
Power Usage |
Consumo de energia da placa de GPU. |
|
Total Energy Consumption (in J) |
Energia total consumida pela placa de GPU desde o carregamento do driver. Unidade: joules. |
|
Memory Temperature |
Temperatura da memória da GPU. |
|
GPU Temperature |
Temperatura da GPU (unidade de computação). |
Clock
Frequências de clock e motivos de throttling. Quedas na frequência de clock sob alta utilização geralmente indicam throttling térmico ou de energia.
|
Nome do painel |
Descrição |
|
SM CLOCK |
Frequência de clock do SM. |
|
Memory Clock |
Frequência de clock da memória. |
|
APP SM Clock |
Frequência de clock de aplicação do SM. |
|
APP Memory Clock |
Frequência de clock de memória da aplicação. |
|
Video Clock |
Frequência de clock do mecanismo de vídeo. |
|
Clock Throttle Reasons |
Motivos para throttling de clock. |
Retired pages
Páginas de memória desativadas devido a erros de hardware. Qualquer valor diferente de zero exige investigação.
|
Nome do painel |
Descrição |
|
Retired Pages (Single-bit Errors) |
Número de páginas de memória desativadas devido a erros de bit único. |
|
Retired Pages (Double-bit Errors) |
Número de páginas de memória desativadas devido a erros de bit duplo. |
Violation
Tempo em violação de limites de hardware, medido em microssegundos. Violações sustentadas indicam operação do nó além da faixa segura.
|
Nome do painel |
Descrição |
|
Power Violation |
Tempo em violação do limite de energia. Unidade: microssegundos. |
|
Thermal Violation |
Tempo em violação do limite térmico. Unidade: microssegundos. |
|
Sync Boost Violation |
Tempo em violação do limite de sync boost. Unidade: microssegundos. |
|
Board Limit Violation |
Tempo em violação do limite da placa. Unidade: microssegundos. |
|
Board Reliability Violation |
Tempo em violação do limite de confiabilidade da placa. Unidade: microssegundos. |
|
Low Util Violation |
Tempo em violação do limite de baixa utilização. Unidade: microssegundos. |
GPUs - Pods
Overview
|
Nome do painel |
Descrição |
|
GPU Pod Details |
Detalhes dos pods que solicitam recursos de GPU, incluindo: Pod Namespace, Pod Name, Node Name, Pod Source, Allocated Mode, Used GPU Memory, Allocated GPU Memory, Allocated Computing Power (em branco se o pod solicitar apenas memória de GPU ou usar modo exclusivo de GPU), SM Utilization, GPU Memory Copy Utilization, Encode Utilization e Decode Utilization. |
Pod Metrics (GPU Device)
Métricas de GPU com escopo para pods individuais. Use estes painéis para acompanhar o consumo de memória de GPU e a atividade do SM por pod, além de detectar pods próximos ao limite de memória de GPU.
|
Nome do painel |
Descrição |
|
Pods Used GPU Memory |
Quantidade de memória de GPU usada atualmente pelo pod. |
|
Pods GPU Memory Used Percentage |
Percentual da memória total de GPU disponível usada pelo pod. |
|
Pods GPU Memory Copy Utilization |
Utilização de cópia de memória do pod. |
|
Pods Average SM Utilization |
Utilização média do SM do pod. |
|
Pods GPU Decode Utilization |
Utilização do decodificador do pod. |
|
Pods GPU Encode Utilization |
Utilização do codificador do pod. |
Pods Metrics (Host Resource)
Métricas de recursos no nível de host para pods que executam cargas de trabalho de GPU. Use estes painéis para identificar gargalos de CPU ou memória que possam limitar o throughput da GPU.
|
Nome do painel |
Descrição |
|
Memory Percent |
Percentual de memória do host em uso. |
|
Memory Usage |
Quantidade de memória do host em uso. |
|
CPU Usage By Cores |
Uso de CPU por núcleo. |
|
CPU Usage Percent |
Percentual de CPU em uso. |
|
Network Bandwidth Usage |
Uso de largura de banda de rede. |
|
Network Socket |
Número de sockets de rede ativos. |
|
File System |
Uso do sistema de arquivos. |
|
Process Number |
Número de processos. |
GPU Utilization (Associated with Pod)
Atividade de computação e do mecanismo de codificação/decodificação da GPU nas placas associadas ao pod.
|
Nome do painel |
Descrição |
|
GPU Utilization |
Utilização da placa de GPU da aplicação. |
|
GPU Memory Copy Utilization |
Utilização de cópia de memória da placa de GPU da aplicação. |
|
Encoder Engine Utilization |
Utilização do mecanismo de codificação da placa de GPU da aplicação. |
|
Decoder Engine Utilization |
Utilização do mecanismo de decodificação da placa de GPU da aplicação. |
GPU Memory & BAR1 (Associated with Pod)
Detalhes de memória das placas de GPU associadas ao pod.
|
Nome do painel |
Descrição |
|
GPU Memory Details |
Detalhamento da memória de GPU por placa da aplicação, incluindo: UUID, Pod Source, Model Name (modelo da GPU), Driver version, Allocated Mode, Allocated Percentage, Used (quantidade de memória de GPU em uso), Used Percentage e Total (memória total de GPU na placa). |
|
GPU Memory Used |
Quantidade de memória de GPU usada pela placa da aplicação. |
|
GPU Memory Used Percentage |
Percentual de memória de GPU em uso pela aplicação. |
|
BAR1 Used |
Quantidade de memória BAR1 em uso. |
|
BAR1 Total |
Memória BAR1 total disponível. |
GPU Profiling (Associated with Pod)
Métricas de pipeline de GPU de baixo nível das placas associadas ao pod. Use estes painéis para diagnosticar comportamentos limitados por memória versus computação no nível do pod.
|
Nome do painel |
Descrição |
|
Graphics Engine Active |
Percentual de tempo em que o mecanismo Graphics ou Compute permanece ativo durante um ciclo de monitoramento. |
|
DRAM Active |
Utilização da largura de banda de memória. |
|
SM Active |
Percentual de tempo em que as unidades SM permanecem ativas. |
|
SM Occupancy |
Taxa de ocupação do SM. |
|
Tensor Core Engine Active |
Percentual de tempo em que o pipeline Tensor Core permanece ativo durante um ciclo de monitoramento. |
|
FP32 Engine Active |
Percentual de tempo em que o pipeline FP32 permanece ativo durante um ciclo de monitoramento. |
|
FP16 Engine Active |
Percentual de tempo em que o pipeline FP16 permanece ativo durante um ciclo de monitoramento. |
|
FP64 Engine Active |
Percentual de tempo em que o pipeline FP64 permanece ativo durante um ciclo de monitoramento. |
|
PCIE TX Bytes (Device to Host) |
Taxa de transferência de dados pelo barramento PCIe do dispositivo GPU da aplicação para o host. |
|
PCIE RX Bytes (Host to Device) |
Taxa de transferência de dados pelo barramento PCIe do host para o dispositivo GPU da aplicação. |
|
NVLINK TX Bytes |
Dados enviados via NVLink. |
|
NVLINK RX Bytes |
Dados recebidos via NVLink. |
GPU Temperature & Energy (Associated with Pod)
Métricas térmicas e de energia das placas de GPU associadas ao pod.
|
Nome do painel |
Descrição |
|
Power Usage |
Consumo de energia da placa de GPU da aplicação. |
|
Total Energy Consumption (in J) |
Energia total consumida pela placa de GPU desde o carregamento do driver. Unidade: joules. |
|
Memory Temperature |
Temperatura da memória da GPU da aplicação. |
|
GPU Temperature |
Temperatura da GPU (unidade de computação) da aplicação. |
GPU Clock (Associated with Pod)
Frequências de clock das placas de GPU associadas ao pod.
|
Nome do painel |
Descrição |
|
SM CLOCK |
Frequência de clock do SM. |
|
Memory Clock |
Frequência de clock da memória. |
|
APP SM Clock |
Frequência de clock de aplicação do SM. |
|
APP Memory Clock |
Frequência de clock de memória da aplicação. |
|
Video Clock |
Frequência de clock do mecanismo de vídeo. |
|
Clock Throttle Reasons |
Motivos para throttling de clock. |