Todos os produtos
Search
Central de documentação

Container Service for Kubernetes:Introdução às métricas

Última atualização: Sep 17, 2026

O GPU Monitoring 2.0 combina GPU exporter, Prometheus e Grafana para oferecer observabilidade de GPU aos seus clusters do Container Service for Kubernetes (ACK). O GPU exporter é compatível com as métricas do DCGM exporter e também fornece métricas personalizadas para cenários de compartilhamento de GPU.

As métricas disponíveis estão organizadas em três categorias: DCGM exporter metrics, custom metrics e deprecated metrics.

Faturamento

As métricas personalizadas são cobradas à parte. Os valores variam conforme o tamanho do cluster e a quantidade de aplicações. Antes de ativar as métricas personalizadas, leia Billing overview para entender o modelo de preços. Para acompanhar seu uso, consulte Usage query.

Métricas suportadas pelo DCGM exporter

O GPU exporter é compatível com as métricas do DCGM exporter. Para obter detalhes sobre o DCGM exporter upstream, consulte DCGM exporter.

Métricas de utilização

Métrica

Tipo

Unidade

Descrição

DCGM_FI_DEV_GPU_UTIL

Gauge

%

Utilização da GPU amostrada em um ciclo de 1 segundo ou 1/6 de segundo, dependendo do modelo da GPU. Um ciclo é um período durante o qual uma ou mais funções de kernel permanecem ativas. Esta métrica indica se a GPU está ocupada, e não a intensidade de seu uso.

DCGM_FI_DEV_MEM_COPY_UTIL

Gauge

%

Utilização da largura de banda de memória. Por exemplo, a GPU V100 tem uma largura de banda máxima de 900 GB/s. Se o uso atual for de 450 GB/s, esta métrica relata 50%.

DCGM_FI_DEV_ENC_UTIL

Gauge

%

Utilização do codificador.

DCGM_FI_DEV_DEC_UTIL

Gauge

%

Utilização do decodificador.

Métricas de memória

Métrica

Tipo

Unidade

Descrição

DCGM_FI_DEV_FB_FREE

Gauge

MiB

Memória framebuffer livre (memória da GPU).

DCGM_FI_DEV_FB_USED

Gauge

MiB

Memória framebuffer utilizada. Corresponde ao valor de Memory-Usage retornado por nvidia-smi.

Métricas de profiling

Todos os valores representam médias de ciclos, e não leituras instantâneas.

Métrica

Tipo

Unidade

Descrição

DCGM_FI_PROF_GR_ENGINE_ACTIVE

Gauge

%

Proporção de ciclos em que um mecanismo gráfico ou de computação está ativo, calculada como média entre todos os mecanismos. Um mecanismo é considerado ativo quando um contexto gráfico ou de computação está vinculado ao thread e esse contexto está ocupado.

DCGM_FI_PROF_SM_ACTIVE

Gauge

%

Proporção de ciclos em que pelo menos um warp em um streaming multiprocessor (SM) está ativo, calculada como média entre todos os SMs. Um warp é considerado ativo quando é agendado e recebe recursos alocados, independentemente de estar computando ou aguardando (por exemplo, esperando pela memória). Se este valor cair abaixo de 0,5, a utilização da GPU é baixa. Busque um valor superior a 0,8 para garantir um uso eficiente da GPU.

DCGM_FI_PROF_SM_OCCUPANCY

Gauge

%

Proporção de warps residentes em um SM em relação ao máximo de warps que o SM suporta por ciclo, calculada como média entre todos os SMs. Um valor mais alto não significa necessariamente maior utilização da GPU — ele indica maior utilização apenas quando DCGM_FI_PROF_DRAM_ACTIVE mostra que a largura de banda da memória da GPU é o gargalo.

DCGM_FI_PROF_PIPE_TENSOR_ACTIVE

Gauge

%

Proporção de ciclos em que o pipeline de tensor (HMMA/IMMA) está ativo. Valores mais altos indicam maior utilização dos núcleos de tensor. Em 100%, as instruções de tensor são executadas em intervalos dentro do ciclo, cada uma levando dois intervalos para ser concluída. Use DCGM_FI_PROF_SM_ACTIVE para distinguir se a baixa utilização é causada por menos SMs ativos ou por períodos ativos mais curtos.

DCGM_FI_PROF_PIPE_FP64_ACTIVE

Gauge

%

Proporção de ciclos em que o pipeline FP64 (dupla precisão) está ativo. Valores mais altos indicam maior utilização dos núcleos FP64. Em GPUs Volta a 100%, uma instrução FP64 é executada a cada quatro semanas dentro do ciclo. Use DCGM_FI_PROF_SM_ACTIVE para esclarecer cenários de utilização parcial.

DCGM_FI_PROF_PIPE_FP32_ACTIVE

Gauge

%

Proporção de ciclos em que o pipeline FMA (Fused Multiply-Add) está ativo. As operações FMA incluem operações FP32 (precisão simples) e inteiras. Em GPUs Volta a 100%, uma instrução FP32 é executada a cada duas semanas dentro do ciclo.

DCGM_FI_PROF_PIPE_FP16_ACTIVE

Gauge

%

Proporção de ciclos em que o pipeline FP16 (meia precisão) está ativo. Em GPUs Volta a 100%, uma instrução FP16 é executada a cada duas semanas dentro do ciclo.

DCGM_FI_PROF_DRAM_ACTIVE

Gauge

%

Proporção de ciclos em que a interface de memória do dispositivo está ativa enviando ou recebendo dados. O valor máximo atingível é aproximadamente 0,8 (80%), e não 1,0 (100%). Utilize esta métrica em conjunto com DCGM_FI_PROF_SM_OCCUPANCY para determinar se uma carga de trabalho está limitada pela largura de banda da memória.

DCGM_FI_PROF_PCIE_TX_BYTES / DCGM_FI_PROF_PCIE_RX_BYTES

Counter

B/s

Taxas de transmissão e recepção PCIe (Peripheral Component Interconnect Express), incluindo cabeçalhos de protocolo e cargas úteis de dados, calculadas como média ao longo de um ciclo. O máximo teórico para PCIe Gen 3 é 985 MB/s por lane.

DCGM_FI_PROF_NVLINK_TX_BYTES / DCGM_FI_PROF_NVLINK_RX_BYTES

Counter

B/s

Taxas de transmissão e recepção NVLink, incluindo cabeçalhos de protocolo e cargas úteis de dados, calculadas como média ao longo de um ciclo. O máximo teórico para NVLink Gen 2 é 25 GB/s por lane por direção.

Métricas de clock

Métrica

Tipo

Unidade

Descrição

DCGM_FI_DEV_SM_CLOCK

Gauge

MHz

Velocidade de clock do SM.

DCGM_FI_DEV_MEM_CLOCK

Gauge

MHz

Velocidade de clock da memória.

DCGM_FI_DEV_APP_SM_CLOCK

Gauge

MHz

Velocidade de clock de aplicação do SM.

DCGM_FI_DEV_APP_MEM_CLOCK

Gauge

MHz

Velocidade de clock de aplicação da memória.

DCGM_FI_DEV_CLOCK_THROTTLE_REASONS

Gauge

MHz

Motivo da limitação da velocidade de clock.

Métricas de erro XID e violação

Erros XID são códigos de erro do driver NVIDIA relatados quando ocorrem falhas de hardware ou software. As métricas de violação contabilizam o tempo acumulado (em microssegundos) em que o clock da GPU foi limitado devido a cada causa.

Métrica

Tipo

Unidade

Descrição

DCGM_FI_DEV_XID_ERRORS

Gauge

-

Código de erro XID mais recente ocorrido dentro de um período de tempo.

DCGM_FI_DEV_POWER_VIOLATION

Counter

μs

Tempo acumulado de limitação de clock devido a limites de energia.

DCGM_FI_DEV_THERMAL_VIOLATION

Counter

μs

Tempo acumulado de limitação de clock devido a limites térmicos.

DCGM_FI_DEV_SYNC_BOOST_VIOLATION

Counter

μs

Tempo acumulado de limitação de clock devido a restrições de sync boost.

DCGM_FI_DEV_BOARD_LIMIT_VIOLATION

Counter

μs

Tempo acumulado de limitação de clock devido a limites no nível da placa.

DCGM_FI_DEV_LOW_UTIL_VIOLATION

Counter

μs

Tempo acumulado de limitação de clock devido a baixa utilização.

DCGM_FI_DEV_RELIABILITY_VIOLATION

Counter

μs

Tempo acumulado de limitação de clock devido a restrições de confiabilidade.

Métricas BAR1

Métrica

Tipo

Unidade

Descrição

DCGM_FI_DEV_BAR1_USED

Gauge

MB

Memória BAR1 utilizada.

DCGM_FI_DEV_BAR1_FREE

Gauge

MB

Memória BAR1 livre.

Métricas de temperatura e energia

Métrica

Tipo

Unidade

Descrição

DCGM_FI_DEV_MEMORY_TEMP

Gauge

C

Temperatura da memória.

DCGM_FI_DEV_GPU_TEMP

Gauge

C

Temperatura da GPU.

DCGM_FI_DEV_POWER_USAGE

Gauge

W

Consumo atual de energia.

DCGM_FI_DEV_TOTAL_ENERGY_CONSUMPTION

Counter

J

Energia total consumida desde a última recarga do driver.

Métricas de páginas desativadas

Páginas de memória da GPU são desativadas quando erros incorrigíveis são detectados. Um aumento na contagem indica degradação na integridade da memória da GPU.

Métrica

Tipo

Unidade

Descrição

DCGM_FI_DEV_RETIRED_SBE

Gauge

-

Páginas desativadas devido a erros de bit único.

DCGM_FI_DEV_RETIRED_DBE

Gauge

-

Páginas desativadas devido a erros de bit duplo.

Métricas personalizadas

O ACK GPU exporter fornece métricas personalizadas para cenários de compartilhamento de GPU, as quais não fazem parte do DCGM exporter upstream. Essas métricas são cobradas à parte.

Métricas no nível de processo

Métrica

Tipo

Unidade

Descrição

DCGM_CUSTOM_PROCESS_SM_UTIL

Gauge

%

Utilização do SM pelos threads da GPU.

DCGM_CUSTOM_PROCESS_MEM_COPY_UTIL

Gauge

%

Utilização de cópia de memória pelos threads da GPU.

DCGM_CUSTOM_PROCESS_ENCODE_UTIL

Gauge

%

Utilização do codificador pelos threads da GPU.

DCGM_CUSTOM_PROCESS_DECODE_UTIL

Gauge

%

Utilização do decodificador pelos threads da GPU.

DCGM_CUSTOM_PROCESS_MEM_USED

Gauge

MiB

Memória da GPU utilizada pelos threads da GPU.

Métricas no nível de container e nó

Métrica

Tipo

Unidade

Descrição

DCGM_CUSTOM_CONTAINER_MEM_ALLOCATED

Gauge

MiB

Memória da GPU alocada para um container.

DCGM_CUSTOM_CONTAINER_CP_ALLOCATED

Gauge

-

Proporção de computação da GPU alocada para um container em relação ao total de computação da GPU. Faixa de valores: [0, 1]. Por exemplo, se a GPU oferece 100 unidades de computação e 30 são alocadas para um container, esta métrica relata 0,3. No modo de GPU exclusiva ou no modo de GPU compartilhada, este valor é 0 porque os containers nesses modos solicitam apenas memória da GPU, sem restrição na alocação de computação.

DCGM_CUSTOM_DEV_FB_TOTAL

Gauge

MiB

Memória total da GPU.

DCGM_CUSTOM_DEV_FB_ALLOCATED

Gauge

-

Proporção de memória da GPU alocada em relação à memória total da GPU. Faixa de valores: [0, 1].

DCGM_CUSTOM_ALLOCATE_MODE

Gauge

-

Modo de agendamento do nó. Valores: 0 = nenhum pod acelerado por GPU em execução; 1 = modo de GPU exclusiva; 2 = modo de GPU compartilhada.

Métricas descontinuadas

As métricas a seguir foram removidas do GPU Monitoring 2.0. Substitua-as pelas métricas listadas abaixo.

Métrica descontinuada

Substituição

Observações

nvidia_gpu_temperature_celsius

DCGM_FI_DEV_GPU_TEMP

nvidia_gpu_power_usage_milliwatts

DCGM_FI_DEV_POWER_USAGE

nvidia_gpu_sharing_memory

DCGM_CUSTOM_DEV_FB_ALLOCATED x DCGM_CUSTOM_DEV_FB_TOTAL

Proporção de memória da GPU x memória total da GPU = memória da GPU solicitada.

nvidia_gpu_memory_used_bytes

DCGM_FI_DEV_FB_USED

nvidia_gpu_memory_total_bytes

DCGM_CUSTOM_DEV_FB_TOTAL

nvidia_gpu_memory_allocated_bytes

DCGM_CUSTOM_DEV_FB_ALLOCATED x DCGM_CUSTOM_DEV_FB_TOTAL

Proporção de memória da GPU x memória total da GPU = memória da GPU solicitada.

nvidia_gpu_duty_cycle

DCGM_FI_DEV_GPU_UTIL

nvidia_gpu_allocated_num_devices

sum(DCGM_CUSTOM_DEV_FB_ALLOCATED)

Soma das proporções de memória da GPU em todas as GPUs de um nó = número total de GPUs solicitadas no nó.

nvidia_gpu_num_devices

DCGM_FI_DEV_COUNT