Todos os produtos
Search
Central de documentação

Container Service for Kubernetes:Visão geral do painel de monitoramento

Última atualização: Jun 27, 2026

O GPU Monitoring utiliza a pilha Exporter, Prometheus e Grafana para oferecer suporte a cenários avançados de monitoramento de GPU. Este tópico descreve os painéis do dashboard de monitoramento.

Visão geral dos painéis

O GPU Monitoring inclui três dashboards: GPUs - Cluster Dimension, GPUs - Nodes e GPUs - Pods. As seções a seguir detalham cada um deles.

GPUs - Cluster Dimension

Nome do painel

Descrição

Total GPU Nodes

Quantidade total de nós com GPU no cluster ou node pool.

Allocated GPUs

Número total de GPUs no cluster ou node pool e quantidade alocada.

Allocated GPU Memory

Percentual da memória total de GPU alocada.

Used GPU Memory

Percentual da memória total de GPU em uso.

Average GPU Utilization

Utilização média de GPU no cluster ou node pool.

GPU Memory Copy Utilization

Utilização média de cópia de memória no cluster ou node pool.

The Last One XID Error

Erro XID mais recente em uma placa de GPU no cluster.

GPU Node Details

Detalhes dos nós com GPU no cluster, incluindo: Node Name, GPU Index, GPU Utilization, GPU Memory Copy Utilization, Used GPU Memory, Allocated GPU Memory, Total GPU Memory, Power, GPU Temperature e GPU Memory Temperature.

GPUs - Nodes

Overview

Métricas resumidas de um único nó. Use estes painéis para avaliar a integridade geral da GPU e o status de alocação antes de analisar os gráficos detalhados.

Nome do painel

Descrição

GPU Mode

Modo de alocação de GPU no nó: Exclusive (recursos alocados por placa de GPU), Share (recursos alocados por memória de GPU e poder computacional) ou None (nenhum aplicativo de GPU em execução no nó; um nó pode alternar entre os modos Exclusive e Share, mas, sem programas de GPU em execução, o sistema não detecta o modo ativo).

NVIDIA Driver Version

Versão do driver NVIDIA instalado no nó.

Allocated GPUs

Quantidade de GPUs alocadas no nó em relação ao total disponível.

GPU Utilization

Utilização média de GPU em todas as placas do nó.

Allocated GPU Memory

Percentual da memória total de GPU alocada no nó.

Used GPU Memory

Percentual da memória total de GPU em uso no nó.

Allocated Computing Power (Valid in GPU Sharing)

Poder computacional alocado. Aplica-se apenas quando o compartilhamento de GPU está ativado e há solicitação de agendamento de poder computacional.

The Last One XID Error

Erro XID mais recente em uma placa de GPU no nó.

Utilization

Gráficos de séries temporais da atividade de computação e do mecanismo de codificação/decodificação da GPU. Use estes painéis para identificar se as cargas de trabalho têm limitação de computação ou de codificador/decodificador.

Nome do painel

Descrição

GPU Utilization

Utilização da placa de GPU no nó.

GPU Memory Copy Utilization

Utilização de cópia de memória na placa de GPU.

Encoder Engine Utilization

Utilização do mecanismo de codificação na placa de GPU.

Decoder Engine Utilization

Utilização do mecanismo de decodificação na placa de GPU.

Memory & BAR1

Detalhes de uso de memória e BAR1 das placas de GPU no nó. Use estes painéis para acompanhar a pressão sobre a memória e identificar placas próximas ao limite.

Nome do painel

Descrição

GPU Memory Details

Detalhamento da memória de GPU por placa, incluindo: UUID, GPU Index, Mode Name (modelo da placa), Used Percentage, Used (quantidade de memória de GPU em uso), Allocated (percentual da memória total de GPU alocada) e Total (memória total de GPU na placa).

BAR1 Used

Quantidade de memória BAR1 em uso nas placas de GPU.

GPU Memory Used

Quantidade de memória de GPU em uso nas placas do nó.

BAR1 Total

Memória BAR1 total disponível nas placas de GPU.

GPU process

Atividade de GPU no nível de processo no nó. Use estes painéis para identificar quais pods e containers consomem recursos de GPU e detectar usos não autorizados.

Nome do painel

Descrição

GPU Process Details

Detalhes dos processos de GPU no nó, incluindo: Pod Namespace, Pod Name, Container Name, Allocate Mode (Exclusive ou Share), Process ID, Process Name, Process Type (computação (C) ou gráficos (G)), GPU Index, Used Memory, Streaming Multiprocessor (SM) Utilization, Memory Copy Utilization, Decode Utilization e Encode Utilization.

Illegal GPU Process (GPU request not by k8s resources.limits) Details

Detalhes de processos que acessam recursos de GPU sem usar limites de recursos do Kubernetes. Inclui: executar aplicativo de GPU diretamente em um nó; executar aplicativo de GPU em container iniciado com o comando docker run; solicitar recursos de GPU definindo NVIDIA_VISIBLE_DEVICES=all ou NVIDIA_VISIBLE_DEVICES=<GPU ID> diretamente na seção env de um Pod; defina privileged: true no securityContext de um Pod; ou execute programa de GPU em Pod cuja imagem de container tenha NVIDIA_VISIBLE_DEVICES=all definido por padrão.

Profiling

Métricas de atividade de pipeline de GPU de baixo nível coletadas pelo DCGM. Use estes painéis para diagnosticar cargas de trabalho limitadas por memória versus computação e identificar gargalos no pipeline.

Nome do painel

Descrição

Graphics Engine Active

Percentual de tempo em que o mecanismo Graphics ou Compute permanece ativo durante um ciclo de monitoramento.

DRAM Active

Utilização da largura de banda de memória.

SM Active

Percentual de tempo em que as unidades SM permanecem ativas.

SM Occupancy

Taxa de ocupação do SM.

Tensor Core Engine Active

Percentual de tempo em que o pipeline Tensor Core permanece ativo durante um ciclo de monitoramento.

FP32 Engine Active

Percentual de tempo em que o pipeline FP32 permanece ativo durante um ciclo de monitoramento.

FP16 Engine Active

Percentual de tempo em que o pipeline FP16 permanece ativo durante um ciclo de monitoramento.

FP64 Engine Active

Percentual de tempo em que o pipeline FP64 permanece ativo durante um ciclo de monitoramento.

PCIE TX Bytes (Device to Host)

Taxa de transferência de dados pelo barramento PCIe do dispositivo GPU para o host.

PCIE RX Bytes (Host to Device)

Taxa de transferência de dados pelo barramento PCIe do host para o dispositivo GPU.

NVLINK TX Bytes

Dados enviados via NVLink.

NVLINK RX Bytes

Dados recebidos via NVLink.

Temperature & Energy

Métricas térmicas e de energia. Monitore estes painéis para detectar throttling térmico ou consumo elevado contínuo de energia.

Nome do painel

Descrição

Power Usage

Consumo de energia da placa de GPU.

Total Energy Consumption (in J)

Energia total consumida pela placa de GPU desde o carregamento do driver. Unidade: joules.

Memory Temperature

Temperatura da memória da GPU.

GPU Temperature

Temperatura da GPU (unidade de computação).

Clock

Frequências de clock e motivos de throttling. Quedas na frequência de clock sob alta utilização geralmente indicam throttling térmico ou de energia.

Nome do painel

Descrição

SM CLOCK

Frequência de clock do SM.

Memory Clock

Frequência de clock da memória.

APP SM Clock

Frequência de clock de aplicação do SM.

APP Memory Clock

Frequência de clock de memória da aplicação.

Video Clock

Frequência de clock do mecanismo de vídeo.

Clock Throttle Reasons

Motivos para throttling de clock.

Retired pages

Páginas de memória desativadas devido a erros de hardware. Qualquer valor diferente de zero exige investigação.

Nome do painel

Descrição

Retired Pages (Single-bit Errors)

Número de páginas de memória desativadas devido a erros de bit único.

Retired Pages (Double-bit Errors)

Número de páginas de memória desativadas devido a erros de bit duplo.

Violation

Tempo em violação de limites de hardware, medido em microssegundos. Violações sustentadas indicam operação do nó além da faixa segura.

Nome do painel

Descrição

Power Violation

Tempo em violação do limite de energia. Unidade: microssegundos.

Thermal Violation

Tempo em violação do limite térmico. Unidade: microssegundos.

Sync Boost Violation

Tempo em violação do limite de sync boost. Unidade: microssegundos.

Board Limit Violation

Tempo em violação do limite da placa. Unidade: microssegundos.

Board Reliability Violation

Tempo em violação do limite de confiabilidade da placa. Unidade: microssegundos.

Low Util Violation

Tempo em violação do limite de baixa utilização. Unidade: microssegundos.

GPUs - Pods

Overview

Nome do painel

Descrição

GPU Pod Details

Detalhes dos pods que solicitam recursos de GPU, incluindo: Pod Namespace, Pod Name, Node Name, Pod Source, Allocated Mode, Used GPU Memory, Allocated GPU Memory, Allocated Computing Power (em branco se o pod solicitar apenas memória de GPU ou usar modo exclusivo de GPU), SM Utilization, GPU Memory Copy Utilization, Encode Utilization e Decode Utilization.

Pod Metrics (GPU Device)

Métricas de GPU com escopo para pods individuais. Use estes painéis para acompanhar o consumo de memória de GPU e a atividade do SM por pod, além de detectar pods próximos ao limite de memória de GPU.

Nome do painel

Descrição

Pods Used GPU Memory

Quantidade de memória de GPU usada atualmente pelo pod.

Pods GPU Memory Used Percentage

Percentual da memória total de GPU disponível usada pelo pod.

Pods GPU Memory Copy Utilization

Utilização de cópia de memória do pod.

Pods Average SM Utilization

Utilização média do SM do pod.

Pods GPU Decode Utilization

Utilização do decodificador do pod.

Pods GPU Encode Utilization

Utilização do codificador do pod.

Pods Metrics (Host Resource)

Métricas de recursos no nível de host para pods que executam cargas de trabalho de GPU. Use estes painéis para identificar gargalos de CPU ou memória que possam limitar o throughput da GPU.

Nome do painel

Descrição

Memory Percent

Percentual de memória do host em uso.

Memory Usage

Quantidade de memória do host em uso.

CPU Usage By Cores

Uso de CPU por núcleo.

CPU Usage Percent

Percentual de CPU em uso.

Network Bandwidth Usage

Uso de largura de banda de rede.

Network Socket

Número de sockets de rede ativos.

File System

Uso do sistema de arquivos.

Process Number

Número de processos.

GPU Utilization (Associated with Pod)

Atividade de computação e do mecanismo de codificação/decodificação da GPU nas placas associadas ao pod.

Nome do painel

Descrição

GPU Utilization

Utilização da placa de GPU da aplicação.

GPU Memory Copy Utilization

Utilização de cópia de memória da placa de GPU da aplicação.

Encoder Engine Utilization

Utilização do mecanismo de codificação da placa de GPU da aplicação.

Decoder Engine Utilization

Utilização do mecanismo de decodificação da placa de GPU da aplicação.

GPU Memory & BAR1 (Associated with Pod)

Detalhes de memória das placas de GPU associadas ao pod.

Nome do painel

Descrição

GPU Memory Details

Detalhamento da memória de GPU por placa da aplicação, incluindo: UUID, Pod Source, Model Name (modelo da GPU), Driver version, Allocated Mode, Allocated Percentage, Used (quantidade de memória de GPU em uso), Used Percentage e Total (memória total de GPU na placa).

GPU Memory Used

Quantidade de memória de GPU usada pela placa da aplicação.

GPU Memory Used Percentage

Percentual de memória de GPU em uso pela aplicação.

BAR1 Used

Quantidade de memória BAR1 em uso.

BAR1 Total

Memória BAR1 total disponível.

GPU Profiling (Associated with Pod)

Métricas de pipeline de GPU de baixo nível das placas associadas ao pod. Use estes painéis para diagnosticar comportamentos limitados por memória versus computação no nível do pod.

Nome do painel

Descrição

Graphics Engine Active

Percentual de tempo em que o mecanismo Graphics ou Compute permanece ativo durante um ciclo de monitoramento.

DRAM Active

Utilização da largura de banda de memória.

SM Active

Percentual de tempo em que as unidades SM permanecem ativas.

SM Occupancy

Taxa de ocupação do SM.

Tensor Core Engine Active

Percentual de tempo em que o pipeline Tensor Core permanece ativo durante um ciclo de monitoramento.

FP32 Engine Active

Percentual de tempo em que o pipeline FP32 permanece ativo durante um ciclo de monitoramento.

FP16 Engine Active

Percentual de tempo em que o pipeline FP16 permanece ativo durante um ciclo de monitoramento.

FP64 Engine Active

Percentual de tempo em que o pipeline FP64 permanece ativo durante um ciclo de monitoramento.

PCIE TX Bytes (Device to Host)

Taxa de transferência de dados pelo barramento PCIe do dispositivo GPU da aplicação para o host.

PCIE RX Bytes (Host to Device)

Taxa de transferência de dados pelo barramento PCIe do host para o dispositivo GPU da aplicação.

NVLINK TX Bytes

Dados enviados via NVLink.

NVLINK RX Bytes

Dados recebidos via NVLink.

GPU Temperature & Energy (Associated with Pod)

Métricas térmicas e de energia das placas de GPU associadas ao pod.

Nome do painel

Descrição

Power Usage

Consumo de energia da placa de GPU da aplicação.

Total Energy Consumption (in J)

Energia total consumida pela placa de GPU desde o carregamento do driver. Unidade: joules.

Memory Temperature

Temperatura da memória da GPU da aplicação.

GPU Temperature

Temperatura da GPU (unidade de computação) da aplicação.

GPU Clock (Associated with Pod)

Frequências de clock das placas de GPU associadas ao pod.

Nome do painel

Descrição

SM CLOCK

Frequência de clock do SM.

Memory Clock

Frequência de clock da memória.

APP SM Clock

Frequência de clock de aplicação do SM.

APP Memory Clock

Frequência de clock de memória da aplicação.

Video Clock

Frequência de clock do mecanismo de vídeo.

Clock Throttle Reasons

Motivos para throttling de clock.