Todos os produtos
Search
Central de documentação

Platform For AI:Service monitoring overview

Última atualização: Jun 27, 2026

Após implantar um serviço EAS, use a página de monitoramento para acompanhar o volume de requisições, a latência e o uso de recursos.

Visualizar dados de monitoramento

  1. Faça login no PAI console. Selecione uma região na parte superior da página. Em seguida, selecione o workspace desejado e clique em Elastic Algorithm Service (EAS).

  2. Clique em nome do serviço para abrir os detalhes e alterne para a aba Monitoring.

  3. Visualize os painéis e as métricas de monitoramento.

    Switch Dashboards

    No canto superior esquerdo da página Monitoring, clique em lista suspensa Service para alternar entre dimensões.

    • Service: Dimensão de serviço. O formato padrão do nome do painel de monitoramento é Service-<service_name>, onde <service_name> é o nome do serviço EAS.

    • Instance: Painel no nível da instância com visualizações de instância única e múltipla.

      • Single Instance: Métricas para uma instância por vez. Alterne entre instâncias para comparar.

        Selecione uma instância na lista suspensa Instance à direita para visualizar suas métricas de monitoramento, como QPS e RT.

      • Multiple Instance: Métricas para várias instâncias lado a lado.

    Switch Time Range

    Clique em image na área Monitoring para alterar o intervalo de tempo do painel.

    No painel seletor de horário que se abre, especifique um horário inicial e final personalizado em Absolute time range à esquerda ou selecione um intervalo predefinido, como Last 5 minutes até Last 7 days, na lista Relative time ranges à direita. O intervalo selecionado é marcado com um sinal de verificação (✓).

    Importante

    As métricas no nível de minuto são retidas por até 1 mês. As métricas no nível de segundo são retidas por até 1 hora.

    Importante

    As métricas de monitoramento de LLM aparecem apenas quando a tag do serviço contém "ServiceEngineType": "vllm" ou "ServiceEngineType" : "sglang".

Métricas de monitoramento

Painel de Monitoramento de Serviço (Nível de Minuto)

Este painel rastreia as seguintes métricas:

Metric

Description

QPS

Requisições por segundo, agrupadas por código de retorno. Somadas entre instâncias para serviços com múltiplas instâncias. O deslocamento de 1d mostra o QPS do dia anterior para comparação de tendências.

Response

Total de respostas no intervalo de tempo selecionado, agrupadas por código de retorno. Somadas entre instâncias para serviços com múltiplas instâncias.

RT

Tempo de resposta da requisição.

  • Avg: Tempo médio de resposta de todas as requisições.

  • TPXX: Tempo de resposta do percentil XX.

    Por exemplo, TP5 é o tempo máximo de resposta do 5º percentil. TP100 é o máximo entre todas as requisições.

    Para serviços com múltiplas instâncias, TP100 é o máximo entre todas as instâncias. Outros valores de TPXX representam a média entre as instâncias.

Daily Invoke

Contagem diária de chamadas, agrupada por código de retorno. Somada entre instâncias para serviços com múltiplas instâncias.

More Metrics (CPU | Memory | GPU | Network | Resources)

Metric

Description

CPU

CPU

Uso médio de CPU do serviço. Unidade: núcleos de CPU. Média entre instâncias para serviços com múltiplas instâncias.

CPU Utilization

Utilização média de CPU do serviço. Cálculo: Uso médio de CPU ÷ Máximo de núcleos de CPU disponíveis. Média entre instâncias para serviços com múltiplas instâncias.

CPU Total

Total de núcleos de CPU disponíveis para o serviço. Cálculo: Núcleos de CPU disponíveis por instância única × Número de instâncias do serviço.

Memory

Memory

Uso médio de memória do serviço. Média entre instâncias para serviços com múltiplas instâncias.

  • RSS: Tamanho da memória física residente.

  • Cache: Tamanho do cache.

  • Total: Tamanho máximo de memória física disponível para uma única instância.

Memory Utilization

Utilização média de memória do serviço. Cálculo: Memória RSS ÷ Memória Total. Média entre instâncias para serviços com múltiplas instâncias.

GPU

GPU Utilization

Para serviços habilitados para GPU, utilização média da GPU. Média entre instâncias para serviços com múltiplas instâncias.

GPU Memory

Para serviços habilitados para GPU, uso de memória da GPU. Média entre instâncias para serviços com múltiplas instâncias.

GPU Total

Para serviços habilitados para GPU, quantidade total de GPUs. Para serviços com múltiplas instâncias, esta métrica é a soma das GPUs em todas as instâncias.

GPU Memory Utilization

Para serviços habilitados para GPU, utilização da memória da GPU. Média entre instâncias para serviços com múltiplas instâncias.

Network

Traffic

Tráfego recebido e enviado pelo serviço, em bits por segundo. Média entre instâncias para serviços com múltiplas instâncias.

Onde:

  • In: Tráfego recebido.

  • Out: Tráfego enviado.

TCP Connections

Número de conexões TCP.

Resources

Replicas

Número de instâncias de serviço em diferentes estados: Total, Pending, Available.

Replicas By Resource

Número de instâncias de serviço por tipo de recurso: Total, Dedicated (recursos dedicados), Public (recursos públicos).

Painel de Monitoramento de Instância Única (Nível de Minuto)

Este painel rastreia as seguintes métricas:

Metric

Description

QPS

Requisições por segundo recebidas por esta instância. Agrupadas por código de retorno.

RT

Tempo de resposta das requisições para esta instância.

Response

Total de respostas recebidas por esta instância dentro do intervalo de tempo selecionado. Agrupadas por código de retorno.

More Metrics (CPU | Memory | GPU | Network | Resources)

Metric

Description

CPU

CPU

Uso de CPU desta instância, em núcleos de CPU.

CPU Utilization

Utilização média de CPU desta instância. Cálculo: Uso médio de CPU ÷ Máximo de núcleos de CPU disponíveis.

Memory

Memory

Uso de memória desta instância.

  • RSS: Tamanho da memória física residente.

  • Cache: Tamanho do cache.

  • Total: Tamanho máximo de memória física disponível para uma única instância.

Memory Utilization

Utilização média de memória desta instância. Cálculo: Memória RSS ÷ Memória Total.

GPU

GPU Utilization

Utilização da GPU desta instância.

GPU Memory

Uso de memória da GPU desta instância.

GPU Memory Utilization

Utilização da memória da GPU desta instância.

Network

Traffic

Tráfego recebido e enviado por esta instância, em bits por segundo.

Onde:

  • In: Tráfego recebido.

  • Out: Tráfego enviado.

TCP Connections

Número de conexões TCP.

Painel de Monitoramento de Múltiplas Instâncias

Métricas no nível de minuto e no nível de segundo:

  • Minute-Level

    Metric

    Description

    Instance QPS

    Requisições por segundo para cada instância. Agrupadas por código de retorno.

    Instance RT

    Tempo médio de resposta para cada instância.

    Instance CPU

    Uso de CPU para cada instância, em núcleos de CPU.

    Instance Memory -- RSS

    Tamanho da memória física residente para cada instância.

    Instance Memory -- Cache

    Tamanho do cache para cada instância.

    Instance GPU

    Utilização da GPU para cada instância.

    Instance GPU Memory

    Uso de memória da GPU para cada instância.

    Instance TCP Connections

    Número de conexões TCP para cada instância.

  • Second-Level

    Importante

    A granularidade dos dados é de 5 segundos. Apenas a última 1 hora de dados é retida.

    Metric

    Description

    Instance QPS Fine

    Requisições por segundo recebidas por cada instância. Agrupadas por código de retorno.

    Instance RT Fine

    Tempo médio de resposta para requisições recebidas por cada instância.

Painel de Monitoramento de GPU

Métricas de GPU nos níveis de serviço e instância. Os valores no nível de serviço representam a média de todas as instâncias.

Metric

Description

GPU Utilization

Utilização da GPU do serviço.

GPU Memory

Uso de memória da GPU e memória total da GPU do serviço.

  • Used: Uso de memória da GPU.

  • Total: Memória total da GPU.

Memory Copy Utilization

Utilização de cópia de memória da GPU do serviço.

GPU Memory Utilization

Utilização da memória da GPU do serviço. Cálculo: Uso de memória ÷ Memória total.

PCIe

Taxa PCIe (Peripheral Component Interconnect Express) do serviço, medida pelo DCGM. PCIe é um padrão de barramento de expansão serial de alta velocidade para computadores.

  • PCIe Transmit: Taxa de transmissão PCIe.

  • PCIe Receive: Taxa de recepção PCIe.

Memory Bandwidth

Métrica de largura de banda da memória da GPU do serviço.

SM Utilization and Occupancy

Métricas relacionadas ao SM (Streaming Multiprocessor) do serviço. Os SMs são componentes principais de uma GPU, responsáveis por executar e agendar tarefas de computação paralela.

  • SM Utilization: Utilização do SM.

  • SM Occupancy: Proporção de threads Warp residentes no SM.

Graphics Engine Utilization

Utilização do mecanismo gráfico da GPU do serviço.

Pipe Active Ratio

Taxa de atividade dos pipelines de computação da GPU do serviço.

  • Pipe Fp32 Active Ratio: Taxa de atividade do pipeline FP32.

  • Pipe Fp16 Active Ratio: Taxa de atividade do pipeline FP16.

  • Pipe Tensor Active Ratio: Taxa de atividade do pipeline Tensor.

Tflops Usage

Volume de computação Tflops (Tera operações de ponto flutuante por segundo) dos pipelines de computação da GPU do serviço.

  • FP32 Tflops Used: Volume de computação Tflops do pipeline FP32.

  • FP16 Tflops Used: Volume de computação Tflops do pipeline FP16.

  • Tensor Tflops Used: Volume de computação Tflops do pipeline Tensor.

DRAM Active Ratio

Taxa de atividade da interface de memória do dispositivo GPU durante envio ou recebimento de dados.

SM Clock

Frequência de clock do SM do serviço.

GPU Temperature

Métricas relacionadas à temperatura da GPU do serviço.

  • GPU Temperature: Temperatura da GPU.

  • GPU Slowdown Temperature: Limiar de temperatura para redução de desempenho da GPU. Quando a temperatura da GPU atinge este valor, ela reduz automaticamente sua frequência operacional para evitar superaquecimento.

  • GPU Shutdown Temperature: Limiar de temperatura para desligamento da GPU. Quando a temperatura da GPU atinge este valor, o sistema força o desligamento do dispositivo GPU. Isso evita danos ao hardware ou falhas mais graves no sistema devido ao superaquecimento.

Power Usage

Consumo de energia da GPU do serviço.

The following are GPU health status and anomaly information metrics:

Metric

Description

GPU Health Count

Número de placas GPU saudáveis para o serviço.

GPU Lost Card Num

Número de placas GPU perdidas para o serviço.

ECC Error Count

Número de erros ECC para o serviço. ECC (Error Correction Code) detecta e corrige erros durante a transmissão ou armazenamento de dados na memória da GPU.

  • Volatile SBE ECC Error: Número de erros ECC voláteis de bit único para o serviço.

  • Volatile DBE ECC Error: Número de erros ECC voláteis de bit duplo para o serviço.

  • Aggregate SBE ECC Error: Número de erros ECC persistentes de bit único para o serviço.

  • Aggregate DBE ECC Error: Número de erros ECC persistentes de bit duplo para o serviço.

  • Uncorrectable ECC Error: Número de erros ECC incorrigíveis para o serviço.

NVSwitch Error Count

Número de erros NVSwitch para o serviço. O NVSwitch fornece canais de comunicação de alta largura de banda e baixa latência para comunicação de alta velocidade entre múltiplas GPUs.

  • NVSwitch Fatal Error: Número de erros fatais do NVSwitch para o serviço.

  • NVSwitch Non-Fatal Error: Número de erros não fatais do NVSwitch para o serviço.

Xid Error Count

Número de erros Xid para o serviço. Erros Xid são códigos de erro relatados pelo driver da GPU e indicam problemas encontrados durante a operação. Esses erros são normalmente registrados em logs do sistema (como dmesg do Linux ou Visualizador de Eventos do Windows) e representados como códigos Xid.

  • Xid Error: Número de erros Xid não fatais para o serviço.

  • Fatal Xid Error: Número de erros Xid fatais para o serviço.

Kernel Error Count

Número de erros não-Xid para o serviço. Erros não-Xid referem-se a outros tipos de erros relatados em logs do kernel, excluindo erros Xid.

Driver Hang

Número de travamentos do driver da GPU para o serviço.

Remap Status

Estado do serviço quando a GPU tenta remapear linhas de memória da GPU.

Painel de Monitoramento VLLM

Para serviços com múltiplas instâncias, as métricas de throughput são somadas e as métricas de latência representam a média entre as instâncias.

Metric

Description

Requests Status

Total de requisições para o serviço.

  • Running: Número de requisições em execução na GPU.

  • Waiting: Número de requisições aguardando processamento.

  • Swapped: Número de requisições transferidas (swapped) para a CPU.

Token Throughput

Número de tokens de entrada e gerados para todas as requisições do serviço.

  • TPS_IN: Número de tokens de entrada.

  • TPS_OUT: Número de tokens de saída.

Request Completion Status

Estatísticas de status de conclusão para todas as requisições do serviço.

  • preemptions: Requisições preemptadas.

  • stop: Requisições concluídas com sucesso devido ao término natural (o modelo gerou um token de parada, como <EOS>).

  • length: Requisições que atingiram o comprimento máximo de tokens de saída.

  • abort: Requisições terminadas forçadamente.

Time To First Token

Latência até o primeiro token para todas as requisições do serviço (tempo desde o recebimento de uma requisição até a geração do primeiro token).

  • Avg: Latência média até o primeiro token para todas as requisições.

  • TPXX: Valores percentis para a latência até o primeiro token para todas as requisições.

Time Per Output Token

Latência por token de saída para todas as requisições do serviço (tempo médio necessário para cada token de saída após a geração do primeiro token).

  • Avg: Latência média por token para todas as requisições.

  • TPXX: Valores percentis para a latência por token para todas as requisições.

E2E Request Latency

Latência de ponta a ponta para todas as requisições do serviço (tempo desde o recebimento de uma requisição até o retorno de todos os tokens).

  • Avg: Latência média de ponta a ponta para todas as requisições.

  • TPXX: Valores percentis para a latência de ponta a ponta para todas as requisições.

Queue Time

Latência de espera na fila para todas as requisições do serviço (tempo que as requisições aguardam na fila para processamento pelo motor).

  • Avg: Latência média de espera na fila para todas as requisições.

  • TPXX: Valores percentis para a latência de espera na fila para todas as requisições.

Inference Time

Latência de inferência para todas as requisições do serviço (tempo em que as requisições são processadas pelo motor).

  • Avg: Latência média de inferência para todas as requisições.

  • TPXX: Valores percentis para a latência de inferência para todas as requisições.

Prefill Time

Latência da fase de preenchimento (prefill) para todas as requisições do serviço (tempo em que o motor processa os tokens de entrada da requisição).

  • Avg: Latência média de preenchimento para todas as requisições.

  • TPXX: Valores percentis para a latência de preenchimento para todas as requisições.

Decode Time

Latência da fase de decodificação para todas as requisições do serviço (tempo em que o motor gera tokens de saída).

  • Avg: Latência média de decodificação para todas as requisições.

  • TPXX: Valores percentis para a latência de decodificação para todas as requisições.

Input Token Length

Número de tokens de entrada processados pelo serviço.

  • Avg: Comprimento médio de tokens de entrada para todas as requisições.

  • TPXX: Valores percentis para o comprimento de tokens de entrada para todas as requisições.

Output Token Length

Número de tokens de saída gerados pelo serviço.

  • Avg: Comprimento médio de tokens de saída para todas as requisições.

  • TPXX: Valores percentis para o comprimento de tokens de saída para todas as requisições.

Request Parameters(params_n & max_tokens)

Parâmetro N e parâmetro max_tokens para todas as requisições do serviço.

  • Params_n: Valor médio do parâmetro N para todas as requisições.

  • Params_max_tokens: Valor médio do parâmetro max_tokens para todas as requisições.

GPU KV Cache Usage

Utilização média do cache KV da GPU do serviço.

CPU KV Cache Usage

Utilização média do cache KV da CPU do serviço.

Prefix Cache Hit Rate

Taxa média de acerto do cache de prefixo para todas as requisições do serviço.

  • GPU: Taxa média de acerto do cache de prefixo da GPU para todas as requisições.

  • CPU: Taxa média de acerto do cache de prefixo da CPU para todas as requisições.

HTTP Requests by Endpoint

Número de requisições para o serviço, agrupadas por método de requisição, caminho e código de status de resposta.

HTTP Request Latency

Latência média para diferentes caminhos de requisição do serviço.

Speculative Decoding Throughput

Contagem de decodificação especulativa para o serviço. Média entre instâncias para serviços com múltiplas instâncias.

  • Drafts: Número de Tokens Rascunho gerados.

  • Draft Tokens: Número de Tokens Rascunho processados.

  • Accepted Tokens: Número de Tokens Rascunho aceitos.

  • Emitted Tokens: Número de Tokens Rascunho emitidos.

Speculative Decoding Efficiency

Desempenho da decodificação especulativa do serviço.

  • Draft Acceptance Rate: Proporção média de Tokens Rascunho aceitos.

  • Efficiency: Eficiência média da decodificação especulativa.

Token Acceptance by Position

Número de Tokens Rascunho aceitos em diferentes posições de geração para o serviço. Média entre instâncias para serviços com múltiplas instâncias.

Painel de Monitoramento SGLang

Para serviços com múltiplas instâncias, as métricas de throughput são somadas e as métricas de latência representam a média entre as instâncias.

Metric

Description

Requests Num

Total de requisições para o serviço.

  • Running: Número de requisições em execução na GPU.

  • Waiting: Número de requisições aguardando processamento.

Token Throughput

Número de tokens de entrada e gerados para todas as requisições do serviço.

  • TPS_IN: Número de tokens de entrada.

  • TPS_OUT: Número de tokens de saída.

Time To First Token

Latência até o primeiro token para todas as requisições do serviço. A latência até o primeiro token é o tempo desde o recebimento de uma requisição até a geração do primeiro token.

  • Avg: Latência média até o primeiro token para todas as requisições.

  • TPXX: Valores percentis para a latência até o primeiro token para todas as requisições.

Time Per Output Token

Latência por token de saída para todas as requisições do serviço. A latência por token é o tempo médio necessário para cada token de saída subsequente após a geração do primeiro token.

  • Avg: Latência média por token para todas as requisições.

  • TPXX: Valores percentis para a latência por token para todas as requisições.

E2E Request Latency

Latência de ponta a ponta para todas as requisições do serviço. A latência de ponta a ponta é o tempo desde o recebimento de uma requisição até o retorno de todos os tokens.

  • Avg: Latência média de ponta a ponta para todas as requisições.

  • TPXX: Valores percentis para a latência de ponta a ponta para todas as requisições.

Cache Hit Rate

Taxa média de acerto do cache de prefixo para todas as requisições do serviço.

Used Tokens Num

Número de tokens de cache KV usados pelo serviço. Média entre instâncias para serviços com múltiplas instâncias.

Token Usage

Utilização média de tokens do cache KV do serviço. Média entre instâncias para serviços com múltiplas instâncias.

FAQ

Painel de monitoramento de LLM não exibido

Problema: Após a implantação personalizada do EAS, a página de monitoramento mostra apenas os painéis Service e GPU. O monitoramento de LLM está ausente.

Causa: A configuração do serviço não possui a tag ServiceEngineType, que declara o tipo de motor de inferência.

Nota

Apenas a tag ServiceEngineType afeta o monitoramento de LLM. Outros parâmetros de implantação do Model Gallery não têm impacto.

Solução: Atualize a configuração do serviço para adicionar a tag ServiceEngineType e defina seu valor com base no motor de inferência usado (apenas vllm ou sglang são suportados). Por exemplo:

{
  "labels": {
    "ServiceEngineType": "vllm"
  }
}

P: Por que /metrics 200 aparece frequentemente nos logs?

Assim que a tag ServiceEngineType entra em vigor, o backend do EAS consulta o endpoint /metrics do framework de inferência a cada 10-15 segundos em todos os pods. Este endpoint retorna métricas em tempo real no formato Prometheus para o painel de monitoramento de LLM.

Referência