O GPU Monitoring 2.0 combina GPU exporter, Prometheus e Grafana para oferecer observabilidade de GPU aos seus clusters do Container Service for Kubernetes (ACK). O GPU exporter é compatível com as métricas do DCGM exporter e também fornece métricas personalizadas para cenários de compartilhamento de GPU.
As métricas disponíveis estão organizadas em três categorias: DCGM exporter metrics, custom metrics e deprecated metrics.
Faturamento
As métricas personalizadas são cobradas à parte. Os valores variam conforme o tamanho do cluster e a quantidade de aplicações. Antes de ativar as métricas personalizadas, leia Billing overview para entender o modelo de preços. Para acompanhar seu uso, consulte Usage query.
Métricas suportadas pelo DCGM exporter
O GPU exporter é compatível com as métricas do DCGM exporter. Para obter detalhes sobre o DCGM exporter upstream, consulte DCGM exporter.
Métricas de utilização
|
Métrica |
Tipo |
Unidade |
Descrição |
|
|
Gauge |
% |
Utilização da GPU amostrada em um ciclo de 1 segundo ou 1/6 de segundo, dependendo do modelo da GPU. Um ciclo é um período durante o qual uma ou mais funções de kernel permanecem ativas. Esta métrica indica se a GPU está ocupada, e não a intensidade de seu uso. |
|
|
Gauge |
% |
Utilização da largura de banda de memória. Por exemplo, a GPU V100 tem uma largura de banda máxima de 900 GB/s. Se o uso atual for de 450 GB/s, esta métrica relata 50%. |
|
|
Gauge |
% |
Utilização do codificador. |
|
|
Gauge |
% |
Utilização do decodificador. |
Métricas de memória
|
Métrica |
Tipo |
Unidade |
Descrição |
|
|
Gauge |
MiB |
Memória framebuffer livre (memória da GPU). |
|
|
Gauge |
MiB |
Memória framebuffer utilizada. Corresponde ao valor de |
Métricas de profiling
Todos os valores representam médias de ciclos, e não leituras instantâneas.
|
Métrica |
Tipo |
Unidade |
Descrição |
|
|
Gauge |
% |
Proporção de ciclos em que um mecanismo gráfico ou de computação está ativo, calculada como média entre todos os mecanismos. Um mecanismo é considerado ativo quando um contexto gráfico ou de computação está vinculado ao thread e esse contexto está ocupado. |
|
|
Gauge |
% |
Proporção de ciclos em que pelo menos um warp em um streaming multiprocessor (SM) está ativo, calculada como média entre todos os SMs. Um warp é considerado ativo quando é agendado e recebe recursos alocados, independentemente de estar computando ou aguardando (por exemplo, esperando pela memória). Se este valor cair abaixo de 0,5, a utilização da GPU é baixa. Busque um valor superior a 0,8 para garantir um uso eficiente da GPU. |
|
|
Gauge |
% |
Proporção de warps residentes em um SM em relação ao máximo de warps que o SM suporta por ciclo, calculada como média entre todos os SMs. Um valor mais alto não significa necessariamente maior utilização da GPU — ele indica maior utilização apenas quando |
|
|
Gauge |
% |
Proporção de ciclos em que o pipeline de tensor (HMMA/IMMA) está ativo. Valores mais altos indicam maior utilização dos núcleos de tensor. Em 100%, as instruções de tensor são executadas em intervalos dentro do ciclo, cada uma levando dois intervalos para ser concluída. Use |
|
|
Gauge |
% |
Proporção de ciclos em que o pipeline FP64 (dupla precisão) está ativo. Valores mais altos indicam maior utilização dos núcleos FP64. Em GPUs Volta a 100%, uma instrução FP64 é executada a cada quatro semanas dentro do ciclo. Use |
|
|
Gauge |
% |
Proporção de ciclos em que o pipeline FMA (Fused Multiply-Add) está ativo. As operações FMA incluem operações FP32 (precisão simples) e inteiras. Em GPUs Volta a 100%, uma instrução FP32 é executada a cada duas semanas dentro do ciclo. |
|
|
Gauge |
% |
Proporção de ciclos em que o pipeline FP16 (meia precisão) está ativo. Em GPUs Volta a 100%, uma instrução FP16 é executada a cada duas semanas dentro do ciclo. |
|
|
Gauge |
% |
Proporção de ciclos em que a interface de memória do dispositivo está ativa enviando ou recebendo dados. O valor máximo atingível é aproximadamente 0,8 (80%), e não 1,0 (100%). Utilize esta métrica em conjunto com |
|
|
Counter |
B/s |
Taxas de transmissão e recepção PCIe (Peripheral Component Interconnect Express), incluindo cabeçalhos de protocolo e cargas úteis de dados, calculadas como média ao longo de um ciclo. O máximo teórico para PCIe Gen 3 é 985 MB/s por lane. |
|
|
Counter |
B/s |
Taxas de transmissão e recepção NVLink, incluindo cabeçalhos de protocolo e cargas úteis de dados, calculadas como média ao longo de um ciclo. O máximo teórico para NVLink Gen 2 é 25 GB/s por lane por direção. |
Métricas de clock
|
Métrica |
Tipo |
Unidade |
Descrição |
|
|
Gauge |
MHz |
Velocidade de clock do SM. |
|
|
Gauge |
MHz |
Velocidade de clock da memória. |
|
|
Gauge |
MHz |
Velocidade de clock de aplicação do SM. |
|
|
Gauge |
MHz |
Velocidade de clock de aplicação da memória. |
|
|
Gauge |
MHz |
Motivo da limitação da velocidade de clock. |
Métricas de erro XID e violação
Erros XID são códigos de erro do driver NVIDIA relatados quando ocorrem falhas de hardware ou software. As métricas de violação contabilizam o tempo acumulado (em microssegundos) em que o clock da GPU foi limitado devido a cada causa.
|
Métrica |
Tipo |
Unidade |
Descrição |
|
|
Gauge |
- |
Código de erro XID mais recente ocorrido dentro de um período de tempo. |
|
|
Counter |
μs |
Tempo acumulado de limitação de clock devido a limites de energia. |
|
|
Counter |
μs |
Tempo acumulado de limitação de clock devido a limites térmicos. |
|
|
Counter |
μs |
Tempo acumulado de limitação de clock devido a restrições de sync boost. |
|
|
Counter |
μs |
Tempo acumulado de limitação de clock devido a limites no nível da placa. |
|
|
Counter |
μs |
Tempo acumulado de limitação de clock devido a baixa utilização. |
|
|
Counter |
μs |
Tempo acumulado de limitação de clock devido a restrições de confiabilidade. |
Métricas BAR1
|
Métrica |
Tipo |
Unidade |
Descrição |
|
|
Gauge |
MB |
Memória BAR1 utilizada. |
|
|
Gauge |
MB |
Memória BAR1 livre. |
Métricas de temperatura e energia
|
Métrica |
Tipo |
Unidade |
Descrição |
|
|
Gauge |
C |
Temperatura da memória. |
|
|
Gauge |
C |
Temperatura da GPU. |
|
|
Gauge |
W |
Consumo atual de energia. |
|
|
Counter |
J |
Energia total consumida desde a última recarga do driver. |
Métricas de páginas desativadas
Páginas de memória da GPU são desativadas quando erros incorrigíveis são detectados. Um aumento na contagem indica degradação na integridade da memória da GPU.
|
Métrica |
Tipo |
Unidade |
Descrição |
|
|
Gauge |
- |
Páginas desativadas devido a erros de bit único. |
|
|
Gauge |
- |
Páginas desativadas devido a erros de bit duplo. |
Métricas personalizadas
O ACK GPU exporter fornece métricas personalizadas para cenários de compartilhamento de GPU, as quais não fazem parte do DCGM exporter upstream. Essas métricas são cobradas à parte.
Métricas no nível de processo
|
Métrica |
Tipo |
Unidade |
Descrição |
|
|
Gauge |
% |
Utilização do SM pelos threads da GPU. |
|
|
Gauge |
% |
Utilização de cópia de memória pelos threads da GPU. |
|
|
Gauge |
% |
Utilização do codificador pelos threads da GPU. |
|
|
Gauge |
% |
Utilização do decodificador pelos threads da GPU. |
|
|
Gauge |
MiB |
Memória da GPU utilizada pelos threads da GPU. |
Métricas no nível de container e nó
|
Métrica |
Tipo |
Unidade |
Descrição |
|
|
Gauge |
MiB |
Memória da GPU alocada para um container. |
|
|
Gauge |
- |
Proporção de computação da GPU alocada para um container em relação ao total de computação da GPU. Faixa de valores: [0, 1]. Por exemplo, se a GPU oferece 100 unidades de computação e 30 são alocadas para um container, esta métrica relata 0,3. No modo de GPU exclusiva ou no modo de GPU compartilhada, este valor é 0 porque os containers nesses modos solicitam apenas memória da GPU, sem restrição na alocação de computação. |
|
|
Gauge |
MiB |
Memória total da GPU. |
|
|
Gauge |
- |
Proporção de memória da GPU alocada em relação à memória total da GPU. Faixa de valores: [0, 1]. |
|
|
Gauge |
- |
Modo de agendamento do nó. Valores: |
Métricas descontinuadas
As métricas a seguir foram removidas do GPU Monitoring 2.0. Substitua-as pelas métricas listadas abaixo.
|
Métrica descontinuada |
Substituição |
Observações |
|
|
|
|
|
|
|
|
|
|
|
Proporção de memória da GPU x memória total da GPU = memória da GPU solicitada. |
|
|
|
|
|
|
|
|
|
|
|
Proporção de memória da GPU x memória total da GPU = memória da GPU solicitada. |
|
|
|
|
|
|
|
Soma das proporções de memória da GPU em todas as GPUs de um nó = número total de GPUs solicitadas no nó. |
|
|
|