O painel de monitoramento do EAS é uma interface unificada para acompanhar o desempenho em tempo real de todos os services do EAS implantados em uma região, sem a necessidade de verificar cada service individualmente.
Os dados do painel têm escopo regional e agregam métricas de todos os services em todos os workspaces da região atual na sua conta Alibaba Cloud. A troca de workspace altera apenas o contexto do console e não afeta o escopo dos dados do painel.
Casos de uso
Visão geral dos services: Avalie rapidamente a integridade de todos os services do EAS na região atual.
Monitoramento de desempenho: Acompanhe as principais métricas agregadas em tempo real, como QPS, tempo de resposta e contagem de réplicas.
Gerenciamento de recursos: Monitore o uso de CPU, memória e GPU para embasar decisões de scale-out e scale-in.
Solução de problemas: Identifique anomalias de desempenho e falhas nos services por meio dos dados de monitoramento agregados.
Planejamento de capacidade: Utilize dados históricos de monitoramento para planejar a capacidade futura.
Visualizar o painel
Faça login no PAI console. Selecione uma região no topo da página, escolha o workspace desejado e clique em Elastic Algorithm Service (EAS).
-
Acesse a aba Monitoring. O painel oferece as seguintes interações:
Seleção de intervalo de tempo: Escolha um período predefinido, como os últimos 5 ou 15 minutos. O padrão é as últimas 6 horas.
Atualização manual: Clique no botão de atualização para obter os dados mais recentes ou defina uma frequência de atualização automática.
Filtragem por dimensão: Filtre os dados por dimensão — por exemplo, filtre pela dimensão User para visualizar dados de todos os usuários ou de um usuário específico.
Interação com gráficos: Passe o mouse sobre um gráfico para inspecionar pontos de dados ou clique em uma entrada da legenda para alternar sua exibição.
Clique na aba Monitoring para abrir a página de monitoramento. Por padrão, a página exibe quatro gráficos de monitoramento na dimensão Service: QPS (solicitações por segundo), Avg RT (tempo médio de resposta), Replicas (contagem e status das réplicas, incluindo Total, Pending e Available) e Replicas By Resource (réplicas em execução por grupo de recursos). Acesse a subaba GPU para visualizar métricas relacionadas à GPU.
Métricas de monitoramento
Painel de services
A tabela a seguir descreve todas as métricas do painel Service. Os cálculos se aplicam a todas as instâncias de services do EAS na região atual da sua conta Alibaba Cloud. Sum representa o valor total em todas as instâncias; Average representa a média.
QPS e Avg RT são os indicadores de desempenho mais importantes. Replicas reflete a atividade de dimensionamento do cluster. As métricas de CPU, memória e GPU indicam o consumo de recursos. Traffic e Daily Invoke refletem o tráfego geral e o volume de chamadas.
| Categoria | Métrica | Descrição | Cálculo | Finalidade |
|---|---|---|---|---|
| Desempenho de solicitações | QPS | Solicitações por segundo. | Sum | Avaliar o throughput geral do cluster; identificar picos de tráfego e tempestades de falhas quando combinado com dados de taxa de erro. |
| Avg RT | Tempo médio de resposta — tempo médio entre o envio de uma solicitação e o recebimento da resposta. | Average | Avaliar a velocidade de resposta geral do cluster; identificar gargalos globais de desempenho. | |
| Escala de instâncias | Replicas | Contagem de instâncias. Inclui três submétricas: TotalReplicas (total), PendingReplicas (em espera) e Available Replicas (ativas). | Sum | Compreender a escala do cluster em tempo real; monitorar se o comportamento de Auto Scaling atende às expectativas. |
| Replicas By Resource | Contagem de instâncias dividida por tipo de recurso. | Sum | Entender a distribuição de recursos entre os tipos de instância. | |
| CPU | CPU Total | Total de CPUs disponíveis para o service. | Sum | Avaliar a capacidade total de CPU reservada. |
| CPU Utilization | Porcentagem de utilização da CPU. | Average | Avaliar a eficiência geral da CPU do cluster para planejamento de capacidade e otimização de custos. | |
| CPU Usage | Uso da CPU. | Average | Estimar o custo dos recursos de CPU consumidos. | |
| Memória | Memory | Uso de memória. Inclui RSS (soma da memória residente) e Cache (soma do cache de páginas). | Average | Monitorar o uso de memória do sistema para determinar pressão sobre recursos e localizar gargalos de desempenho. |
| Memory Utilization | Porcentagem de utilização da memória. | Average | Avaliar a eficiência geral dos recursos de memória. | |
| GPU | GPU Total | Total de GPUs em uso. | Sum | Avaliar a escala de recursos de GPU. |
| GPU Utilization | Porcentagem de utilização da GPU. | Average | Avaliar a eficiência dos recursos de GPU. | |
| GPU Memory | Uso real da memória da GPU. | Average | Avaliar o consumo de memória da GPU. | |
| Tráfego e chamadas | Traffic | Soma do tráfego de rede de entrada (In) e saída (Out) de todos os services. | Sum | Refletir o status da comunicação de rede entre os services. |
| Daily Invoke | Contagem diária de chamadas, categorizada por código de status HTTP. | Sum | Observar a integridade do negócio a longo prazo e as tendências da taxa de erros. |
Painel de GPU
O painel de GPU fornece monitoramento detalhado para services baseados em GPU, ajudando a otimizar a utilização desses recursos.
Este painel é especialmente útil para identificar ineficiências de custo. Concentre-se nas métricas de baixa utilização para encontrar services com configurações de recursos desperdiçadas.
| Categoria | Métrica | Descrição | Finalidade |
|---|---|---|---|
| Visão geral | Total GPU usage | Total de GPUs usadas por todos os services na região atual. | Indica a escala geral de GPU para planejamento de capacidade. |
| Average GPU utilization | Porcentagem média de utilização da GPU em todos os services que usam GPUs. | Mede a eficiência geral da GPU; identifica riscos de desperdício de recursos. | |
| Number of services using GPUs | Número total de services que utilizam recursos de GPU atualmente. | Compreender a distribuição de services com GPU e a abrangência do uso de recursos. | |
| Utilização por service | Number of services with average GPU utilization below 10% | Services cuja utilização média da GPU está abaixo de 10%. | Identifica desperdício grave de recursos; priorize esses services para otimização ou desativação. |
| Number of services with average GPU utilization below 30% | Services cuja utilização média da GPU está abaixo de 30%. | Identifica services com baixa utilização; considere ajustar suas configurações de recursos. | |
| Number of services with average GPU utilization above 50% | Services cuja utilização média da GPU está acima de 50%. | Confirma utilização eficaz da GPU; use para verificar resultados de otimização. | |
| Distribuição de utilização da GPU | Number of GPUs with average utilization below 10% | Placas de GPU cuja utilização média está abaixo de 10%. | Identifica GPUs ociosas que podem ser liberadas para reduzir custos. |
| Number of GPUs with average utilization below 30% | Placas de GPU cuja utilização média está abaixo de 30%. | Identifica GPUs com baixa utilização; ajuste as configurações de recursos. | |
| Number of GPUs with average utilization above 50% | Placas de GPU cuja utilização média está acima de 50%. | Confirma GPUs totalmente utilizadas; avalie a necessidade de scale-out. | |
| Distribuição de recursos | Number of GPUs in dedicated resource groups (including Lingjun) | GPUs em grupos de recursos dedicados, incluindo Lingjun. | Monitora alterações em recursos dedicados para planejamento de capacidade. |
| Number of GPUs in public resource groups | GPUs em grupos de recursos públicos. | Monitora o uso de recursos públicos para otimizar políticas de alocação. | |
| Number of GPUs in spot instances (including Lingjun) | GPUs em instâncias spot, incluindo Lingjun. | Monitora recursos de GPU de baixo custo para ajudar a equilibrar custo e estabilidade. | |
| Utilização detalhada | Detailed GPU utilization per service | Utilização da GPU por service. Exibe "No data" quando não há dados disponíveis. | Permite análise detalhada do uso de GPU de cada service para localizar problemas de desempenho. |
Observações de uso
Os dados do painel são agregados de todos os services da região e podem apresentar atraso.
Para monitoramento detalhado de um service específico, abra a página de monitoramento desse service.
Perguntas frequentes
Por que a utilização da CPU no painel está baixa, mas meu service não faz scale-out ou reporta recursos insuficientes?
O painel mostra a utilização média da CPU em todos os services. Services ociosos reduzem essa média, mesmo quando os recursos físicos do cluster estão totalmente esgotados.
Verifique a métrica Pending_Replicas. Se ela permanecer consistentemente acima de 0, o pool de recursos do cluster está cheio e não consegue agendar novas instâncias. Faça o scale-out do cluster ou otimize as configurações de recursos dos services existentes.
Como visualizo o monitoramento detalhado de um service específico?
Acesse a aba Inference Service, selecione o service desejado e abra sua página de detalhes. Navegue até a aba Monitoring para visualizar gráficos detalhados. Para descrições das métricas, consulte Visão geral do monitoramento de services.