O CloudMonitor coleta métricas de GPU de instâncias ECS por meio do agente do CloudMonitor. Crie regras de alerta para receber notificações quando as métricas ultrapassarem os limiares configurados.
Pré-requisitos
-
Crie uma instância ECS acelerada por GPU e instale o driver de GPU. Crie uma instância de GPU.
NotaCaso instale o agente do CloudMonitor antes do driver de GPU, reinicie o agente em seguida. How do I restart the C++ version of the CloudMonitor agent?.
Instale o agente do CloudMonitor na instância ECS. Instale o agente do CloudMonitor.
Métricas
As métricas de GPU estão disponíveis nos níveis de GPU, instância e grupo de aplicativos. A tabela a seguir lista as métricas disponíveis.
|
Métrica |
Unidade |
Nome da métrica |
Dimensões |
|
(Agente) Utilização do decodificador de GPU |
% |
gpu_decoder_utilization |
userId, instanceId, gpuId |
|
(Agente) Utilização do codificador de GPU |
% |
gpu_encoder_utilization |
userId, instanceId, gpuId |
|
(Agente) Temperatura da GPU |
°C |
gpu_temperature |
userId, instanceId, gpuId |
|
(Agente) Utilização da GPU |
% |
gpu_utilization |
userId, instanceId, gpuId |
|
(Agente) Espaço livre na memória da GPU |
Byte |
gpu_memory_freespace |
userId, instanceId, gpuId |
|
(Agente) Utilização de memória livre da GPU |
% |
gpu_memory_free_utilization |
userId, instanceId, gpuId |
|
(Agente) Espaço utilizado na memória da GPU |
Byte |
gpu_memory_usedspace |
userId, instanceId, gpuId |
|
(Agente) Utilização da memória da GPU |
% |
gpu_memory_utilization |
userId, instanceId, gpuId |
|
(Agente) Consumo de energia da GPU |
W |
gpu_power_readings_power_draw |
userId, instanceId, gpuId |
|
(Agente) Utilização do decodificador no nível da instância |
% |
instance_gpu_decoder_utilization |
userId, instanceId |
|
(Agente) Utilização do codificador no nível da instância |
% |
instance_gpu_encoder_utilization |
userId, instanceId |
|
(Agente) Temperatura da GPU no nível da instância |
°C |
instance_gpu_temperature |
userId, instanceId |
|
(Agente) Utilização da GPU no nível da instância |
% |
instance_gpu_utilization |
userId, instanceId |
|
(Agente) Espaço livre na memória da GPU no nível da instância |
Byte |
instance_gpu_memory_freespace |
userId, instanceId |
|
(Agente) Utilização de memória livre da GPU no nível da instância |
% |
instance_gpu_memory_free_utilization |
userId, instanceId |
|
(Agente) Espaço utilizado na memória da GPU no nível da instância |
Byte |
instance_gpu_memory_usedspace |
userId, instanceId |
|
(Agente) Utilização da memória da GPU no nível da instância |
% |
instance_gpu_memory_utilization |
userId, instanceId |
|
(Agente) Consumo de energia da GPU no nível da instância |
W |
instance_gpu_power_readings_power_draw |
userId, instanceId |
Para métricas no nível da instância, como instance_gpu_decoder_utilization e instance_gpu_temperature:
Média: o valor médio entre todas as GPUs da instância. Por exemplo, duas GPUs com valores 'a' e 'b' resultam em (a + b) / 2.
Máximo: o maior valor entre todas as GPUs da instância. Por exemplo, duas GPUs com valores 'a' e 'b' resultam em max(a, b).
Mínimo: o menor valor entre todas as GPUs da instância. Por exemplo, duas GPUs com valores 'a' e 'b' resultam em min(a, b).
Visualize dados de monitoramento de GPU
Faça login no console do Cloud Monitor.
No painel de navegação à esquerda, escolha .
Na página Host Monitoring, clique em nome da instância de destino ou clique em View Charts na coluna Actions.
-
Clique em aba GPU monitoring.
A aba GPU monitoring exibe os gráficos de monitoramento de GPU do host.
As métricas de GPU também oferecem suporte a alertas. Crie uma regra de alerta para um host. Visualize alertas.