Todos os produtos
Search
Central de documentação

Platform For AI:Visão geral do painel de monitoramento

Última atualização: Jul 15, 2026

O painel de monitoramento do EAS é uma interface unificada para acompanhar o desempenho em tempo real de todos os services do EAS implantados em uma região, sem a necessidade de verificar cada service individualmente.

Importante

Os dados do painel têm escopo regional e agregam métricas de todos os services em todos os workspaces da região atual na sua conta Alibaba Cloud. A troca de workspace altera apenas o contexto do console e não afeta o escopo dos dados do painel.

Casos de uso

  • Visão geral dos services: Avalie rapidamente a integridade de todos os services do EAS na região atual.

  • Monitoramento de desempenho: Acompanhe as principais métricas agregadas em tempo real, como QPS, tempo de resposta e contagem de réplicas.

  • Gerenciamento de recursos: Monitore o uso de CPU, memória e GPU para embasar decisões de scale-out e scale-in.

  • Solução de problemas: Identifique anomalias de desempenho e falhas nos services por meio dos dados de monitoramento agregados.

  • Planejamento de capacidade: Utilize dados históricos de monitoramento para planejar a capacidade futura.

Visualizar o painel

  1. Faça login no PAI console. Selecione uma região no topo da página, escolha o workspace desejado e clique em Elastic Algorithm Service (EAS).

  2. Acesse a aba Monitoring. O painel oferece as seguintes interações:

    • Seleção de intervalo de tempo: Escolha um período predefinido, como os últimos 5 ou 15 minutos. O padrão é as últimas 6 horas.

    • Atualização manual: Clique no botão de atualização para obter os dados mais recentes ou defina uma frequência de atualização automática.

    • Filtragem por dimensão: Filtre os dados por dimensão — por exemplo, filtre pela dimensão User para visualizar dados de todos os usuários ou de um usuário específico.

    • Interação com gráficos: Passe o mouse sobre um gráfico para inspecionar pontos de dados ou clique em uma entrada da legenda para alternar sua exibição.

    Clique na aba Monitoring para abrir a página de monitoramento. Por padrão, a página exibe quatro gráficos de monitoramento na dimensão Service: QPS (solicitações por segundo), Avg RT (tempo médio de resposta), Replicas (contagem e status das réplicas, incluindo Total, Pending e Available) e Replicas By Resource (réplicas em execução por grupo de recursos). Acesse a subaba GPU para visualizar métricas relacionadas à GPU.

Métricas de monitoramento

Painel de services

A tabela a seguir descreve todas as métricas do painel Service. Os cálculos se aplicam a todas as instâncias de services do EAS na região atual da sua conta Alibaba Cloud. Sum representa o valor total em todas as instâncias; Average representa a média.

Nota

QPS e Avg RT são os indicadores de desempenho mais importantes. Replicas reflete a atividade de dimensionamento do cluster. As métricas de CPU, memória e GPU indicam o consumo de recursos. Traffic e Daily Invoke refletem o tráfego geral e o volume de chamadas.

Categoria Métrica Descrição Cálculo Finalidade
Desempenho de solicitações QPS Solicitações por segundo. Sum Avaliar o throughput geral do cluster; identificar picos de tráfego e tempestades de falhas quando combinado com dados de taxa de erro.
Avg RT Tempo médio de resposta — tempo médio entre o envio de uma solicitação e o recebimento da resposta. Average Avaliar a velocidade de resposta geral do cluster; identificar gargalos globais de desempenho.
Escala de instâncias Replicas Contagem de instâncias. Inclui três submétricas: TotalReplicas (total), PendingReplicas (em espera) e Available Replicas (ativas). Sum Compreender a escala do cluster em tempo real; monitorar se o comportamento de Auto Scaling atende às expectativas.
Replicas By Resource Contagem de instâncias dividida por tipo de recurso. Sum Entender a distribuição de recursos entre os tipos de instância.
CPU CPU Total Total de CPUs disponíveis para o service. Sum Avaliar a capacidade total de CPU reservada.
CPU Utilization Porcentagem de utilização da CPU. Average Avaliar a eficiência geral da CPU do cluster para planejamento de capacidade e otimização de custos.
CPU Usage Uso da CPU. Average Estimar o custo dos recursos de CPU consumidos.
Memória Memory Uso de memória. Inclui RSS (soma da memória residente) e Cache (soma do cache de páginas). Average Monitorar o uso de memória do sistema para determinar pressão sobre recursos e localizar gargalos de desempenho.
Memory Utilization Porcentagem de utilização da memória. Average Avaliar a eficiência geral dos recursos de memória.
GPU GPU Total Total de GPUs em uso. Sum Avaliar a escala de recursos de GPU.
GPU Utilization Porcentagem de utilização da GPU. Average Avaliar a eficiência dos recursos de GPU.
GPU Memory Uso real da memória da GPU. Average Avaliar o consumo de memória da GPU.
Tráfego e chamadas Traffic Soma do tráfego de rede de entrada (In) e saída (Out) de todos os services. Sum Refletir o status da comunicação de rede entre os services.
Daily Invoke Contagem diária de chamadas, categorizada por código de status HTTP. Sum Observar a integridade do negócio a longo prazo e as tendências da taxa de erros.

Painel de GPU

O painel de GPU fornece monitoramento detalhado para services baseados em GPU, ajudando a otimizar a utilização desses recursos.

Nota

Este painel é especialmente útil para identificar ineficiências de custo. Concentre-se nas métricas de baixa utilização para encontrar services com configurações de recursos desperdiçadas.

Categoria Métrica Descrição Finalidade
Visão geral Total GPU usage Total de GPUs usadas por todos os services na região atual. Indica a escala geral de GPU para planejamento de capacidade.
Average GPU utilization Porcentagem média de utilização da GPU em todos os services que usam GPUs. Mede a eficiência geral da GPU; identifica riscos de desperdício de recursos.
Number of services using GPUs Número total de services que utilizam recursos de GPU atualmente. Compreender a distribuição de services com GPU e a abrangência do uso de recursos.
Utilização por service Number of services with average GPU utilization below 10% Services cuja utilização média da GPU está abaixo de 10%. Identifica desperdício grave de recursos; priorize esses services para otimização ou desativação.
Number of services with average GPU utilization below 30% Services cuja utilização média da GPU está abaixo de 30%. Identifica services com baixa utilização; considere ajustar suas configurações de recursos.
Number of services with average GPU utilization above 50% Services cuja utilização média da GPU está acima de 50%. Confirma utilização eficaz da GPU; use para verificar resultados de otimização.
Distribuição de utilização da GPU Number of GPUs with average utilization below 10% Placas de GPU cuja utilização média está abaixo de 10%. Identifica GPUs ociosas que podem ser liberadas para reduzir custos.
Number of GPUs with average utilization below 30% Placas de GPU cuja utilização média está abaixo de 30%. Identifica GPUs com baixa utilização; ajuste as configurações de recursos.
Number of GPUs with average utilization above 50% Placas de GPU cuja utilização média está acima de 50%. Confirma GPUs totalmente utilizadas; avalie a necessidade de scale-out.
Distribuição de recursos Number of GPUs in dedicated resource groups (including Lingjun) GPUs em grupos de recursos dedicados, incluindo Lingjun. Monitora alterações em recursos dedicados para planejamento de capacidade.
Number of GPUs in public resource groups GPUs em grupos de recursos públicos. Monitora o uso de recursos públicos para otimizar políticas de alocação.
Number of GPUs in spot instances (including Lingjun) GPUs em instâncias spot, incluindo Lingjun. Monitora recursos de GPU de baixo custo para ajudar a equilibrar custo e estabilidade.
Utilização detalhada Detailed GPU utilization per service Utilização da GPU por service. Exibe "No data" quando não há dados disponíveis. Permite análise detalhada do uso de GPU de cada service para localizar problemas de desempenho.

Observações de uso

  • Os dados do painel são agregados de todos os services da região e podem apresentar atraso.

  • Para monitoramento detalhado de um service específico, abra a página de monitoramento desse service.

Perguntas frequentes

Por que a utilização da CPU no painel está baixa, mas meu service não faz scale-out ou reporta recursos insuficientes?

O painel mostra a utilização média da CPU em todos os services. Services ociosos reduzem essa média, mesmo quando os recursos físicos do cluster estão totalmente esgotados.

Verifique a métrica Pending_Replicas. Se ela permanecer consistentemente acima de 0, o pool de recursos do cluster está cheio e não consegue agendar novas instâncias. Faça o scale-out do cluster ou otimize as configurações de recursos dos services existentes.

Como visualizo o monitoramento detalhado de um service específico?

Acesse a aba Inference Service, selecione o service desejado e abra sua página de detalhes. Navegue até a aba Monitoring para visualizar gráficos detalhados. Para descrições das métricas, consulte Visão geral do monitoramento de services.

Próximos passos