O CloudMonitor coleta métricas de GPU de instâncias do Elastic Compute Service (ECS) otimizadas para computação acelerada por GPU quando o agente do CloudMonitor está instalado. Defina regras de alerta em qualquer métrica para receber notificações quando um limiar for ultrapassado.
Pré-requisitos
Antes de começar, verifique se você possui:
Uma instância ECS otimizada para computação acelerada por GPU com o driver da GPU instalado. Para mais detalhes, consulte Crie uma instância de contêiner elástico acelerado por GPU.
O agente do CloudMonitor instalado na instância ECS. Para mais detalhes, consulte Instale e desinstale o agente do CloudMonitor para C++.
Caso tenha instalado o agente do CloudMonitor antes de instalar o driver da GPU, reinicie o agente do CloudMonitor antes de prosseguir. Para mais detalhes, consulte Como reiniciar o agente do CloudMonitor para C++?
Métricas de GPU
O CloudMonitor coleta as seguintes métricas de GPU. Visualize as métricas por GPU, instância ou grupo de aplicativos.
|
**Métrica** |
**Unidade** |
**MetricName** |
**Dimensões** |
|
(Agent)gpu_decoder_utilization |
% |
gpu_decoder_utilization |
userId, instanceId e gpuId |
|
(Agent)gpu_encoder_utilization |
% |
gpu_encoder_utilization |
userId, instanceId e gpuId |
|
(Agent)gpu_gpu_temperature |
°C |
gpu_gpu_temperature |
userId, instanceId e gpuId |
|
(Agent)gpu_gpu_usedutilization |
% |
gpu_gpu_usedutilization |
userId, instanceId e gpuId |
|
(Agent)gpu_memory_freespace |
Byte |
gpu_memory_freespace |
userId, instanceId e gpuId |
|
(Agent)gpu_memory_freeutilization |
% |
gpu_memory_freeutilization |
userId, instanceId e gpuId |
|
(Agent)gpu_memory_userdspace |
Byte |
gpu_memory_usedspace |
userId, instanceId e gpuId |
|
(Agent)gpu_memory_usedutilization |
% |
gpu_memory_usedutilization |
userId, instanceId e gpuId |
|
(Agent)gpu_power_readings_power_draw |
W |
gpu_power_readings_power_draw |
userId, instanceId e gpuId |
Visualize métricas de GPU no console do CloudMonitor
Faça login no console do CloudMonitor.
No painel de navegação à esquerda, escolha Cloud Resource Monitoring > Host Monitoring.
Na página Host Monitoring, clique em no nome do host ou clique em Monitoring Charts na coluna Actions.
Clique em na aba GPU Monitoring para visualizar os gráficos de monitoramento na aba GPUMonitor.
Para definir regras de alerta nas métricas de GPU ou revisar alertas acionados, consulte Etapa 2: Crie uma regra de alerta para o host e Etapa 3: Visualize alertas do host.