Após a implantação de um service EAS, visualize métricas como QPS, latência, taxa de erros e uso de recursos na aba Monitor da página de detalhes do service para compreender as invocações e o status de execução.
Visualizar dados de monitoramento
Acessar a página de monitoramento
Faça login no PAI console. Selecione uma região na parte superior da página. Em seguida, selecione o workspace desejado e clique em Enter Elastic Algorithm Service (EAS).
Clique no nome do service alvo para acessar a página de detalhes do service e alterne para a aba Monitor.
Selecionar dimensões e painéis
A página de monitoramento oferece uma seleção em dois níveis no canto superior esquerdo: primeiro, selecione uma dimensão de monitoramento (Service ou Instance) na lista suspensa; depois, escolha um painel.
Os painéis LLM estão disponíveis para services de inferência LLM que utilizam o mecanismo vLLM ou SGLang. Use uma imagem oficial do PAI-EAS ou defina
ServiceEngineTypecomosglangouvllmnos rótulos do service. Para mais informações, consulte LLM monitoring metrics > Prerequisites.Os painéis GPU estão disponíveis apenas para services que utilizam GPUs.
-
Dimensão Service: Visualize métricas de monitoramento de todo o service. Ao selecionar Service na lista suspensa, os seguintes painéis ficam disponíveis:
Service-<service_name> (onde
<service_name>é o nome do service EAS): painel de monitoramento do service. Exibe métricas gerais como QPS, RT, CPU e Memory.LLM: Exibe métricas de monitoramento baseadas no mecanismo de inferência (SGLang ou vLLM) utilizado pelo service LLM, como throughput de requisições e uso de tokens.
GPU: Mostra métricas de hardware da GPU, incluindo utilização de SM, largura de banda de memória e erros de NVSwitch.
-
Dimensão Instance: Visualize métricas de monitoramento de instâncias individuais. Ao selecionar Instance na lista suspensa, os seguintes painéis ficam disponíveis:
Single Instance: Painel de monitoramento de instância única. Permite selecionar apenas uma instância por vez. Disponibiliza somente métricas de monitoramento no nível de minuto.
Multiple Instance: Painel de monitoramento de múltiplas instâncias. Possibilita a seleção de várias instâncias para comparação. Oferece métricas de monitoramento nos níveis de minuto e de segundo.
LLM Instance: Painel de monitoramento de instância LLM. Permite selecionar uma ou mais instâncias para comparação e exibe métricas de inferência LLM no nível da instância.
GPU Instance: Painel de monitoramento de instância GPU. Suporta a seleção de uma ou mais instâncias para comparação, apresentando métricas detalhadas de hardware da GPU no nível da instância.
A tabela a seguir mapeia cada painel à seção de métricas correspondente.
|
Painel |
Seção de métricas |
|
|
|
|
Single Instance |
Monitoring metrics > Single Instance Monitoring Dashboard (Minute-Level) |
|
Multiple Instance |
|
|
GPU / GPU Instance |
|
|
LLM / LLM Instance |
Alterar intervalo de tempo
Clique em
no lado direito da área Monitor para alterar o intervalo de tempo dos painéis.
No painel de seleção de tempo que se abre, especifique um horário inicial e final personalizado (From / To) em Absolute time range à esquerda ou selecione um intervalo predefinido, como Last 5 minutes até Last 7 days, na lista Relative time ranges à direita. O intervalo selecionado é marcado com um sinal de verificação (✓).
As métricas no nível de minuto são retidas por até 1 mês. As métricas no nível de segundo são retidas por até 1 hora.
Métricas de monitoramento
Painel de Monitoramento de Service (Nível de Minuto)
Este painel rastreia as seguintes métricas:
|
Métrica |
Descrição |
|
|
QPS |
Requisições por segundo, agrupadas por código de retorno. Somadas entre instâncias para services com múltiplas instâncias. O deslocamento de 1d mostra o QPS do dia anterior para comparação de tendências. |
|
|
Response |
Total de respostas no intervalo de tempo selecionado, agrupadas por código de retorno. Somadas entre instâncias para services com múltiplas instâncias. |
|
|
RT |
Tempo de resposta da requisição.
|
|
|
Daily Invoke |
Contagem diária de chamadas, agrupada por código de retorno. Somada entre instâncias para services com múltiplas instâncias. |
|
Painel de Monitoramento de Instância Única (Nível de Minuto)
Este painel rastreia as seguintes métricas:
|
Métrica |
Descrição |
|
QPS |
Requisições por segundo recebidas por esta instância. Agrupadas por código de retorno. |
|
RT |
Tempo de resposta das requisições para esta instância. |
|
Response |
Total de respostas recebidas por esta instância dentro do intervalo de tempo selecionado. Agrupadas por código de retorno. |
Painel de Monitoramento de Múltiplas Instâncias
Métricas no nível de minuto e de segundo:
-
Nível de Minuto
Métrica
Descrição
Instance QPS
Requisições por segundo para cada instância. Agrupadas por código de retorno.
Instance RT
Tempo médio de resposta para cada instância.
Instance CPU
Uso de CPU para cada instância, em núcleos de CPU.
Instance Memory -- RSS
Tamanho da memória física residente para cada instância.
Instance Memory -- Cache
Tamanho do cache para cada instância.
Instance GPU
Utilização da GPU para cada instância.
Instance GPU Memory
Uso de memória da GPU para cada instância.
Instance TCP Connections
Número de conexões TCP para cada instância.
-
Nível de Segundo
ImportanteA granularidade dos dados é de 5 segundos. Apenas a última 1 hora de dados é retida.
Métrica
Descrição
Instance QPS Fine
Requisições por segundo recebidas por cada instância. Agrupadas por código de retorno.
Instance RT Fine
Tempo médio de resposta para requisições recebidas por cada instância.
Painel de Monitoramento de GPU
Métricas de GPU nos níveis de service e de instância. Os valores no nível de service representam a média de todas as instâncias.
|
Métrica |
Descrição |
|
GPU Utilization |
Utilização da GPU do service. |
|
GPU Memory |
Uso de memória da GPU e memória total da GPU do service.
|
|
Memory Copy Utilization |
Utilização de cópia de memória da GPU do service. |
|
GPU Memory Utilization |
Utilização da memória da GPU do service. Cálculo: Uso de memória ÷ Memória total. |
|
PCIe |
Taxa PCIe (Peripheral Component Interconnect Express) do service, medida pelo DCGM. PCIe é um padrão de barramento de expansão serial de alta velocidade para computadores.
|
|
Memory Bandwidth |
Métrica de largura de banda de memória da GPU do service. |
|
SM Utilization and Occupancy |
Métricas relacionadas a SM (Streaming Multiprocessor) do service. Os SMs são componentes centrais de uma GPU, responsáveis por executar e agendar tarefas de computação paralela.
|
|
Graphics Engine Utilization |
Utilização do mecanismo gráfico da GPU do service. |
|
Pipe Active Ratio |
Taxa de atividade dos pipelines de computação da GPU do service.
|
|
Tflops Usage |
Volume de computação Tflops (Tera operações de ponto flutuante por segundo) dos pipelines de computação da GPU do service.
|
|
DRAM Active Ratio |
Taxa de atividade da interface de memória do dispositivo GPU ao enviar ou receber dados. |
|
SM Clock |
Frequência de clock do SM do service. |
|
GPU Temperature |
Métricas relacionadas à temperatura da GPU do service.
|
|
Power Usage |
Consumo de energia da GPU do service. |
Métricas de monitoramento de LLM
As métricas de monitoramento de LLM aparecem no painel LLM ou LLM Instance, independentemente de o service usar o mecanismo vLLM ou SGLang. Consulte as métricas correspondentes ao mecanismo utilizado.
Pré-requisitos
Os painéis de LLM são exibidos quando qualquer uma das seguintes condições é atendida:
Uso de uma imagem oficial do PAI-EAS.
-
Definição de
ServiceEngineTypecomosglangouvllmnos rótulos do service. Exemplo:{ "labels": { "ServiceEngineType": "sglang" } }
Nota:
O backend do EAS chama o endpoint
/metricsdo mecanismo a cada 10 a 15 segundos para coletar métricas do Prometheus. Portanto, entradas/metrics 200aparecem regularmente nos logs do service.As métricas no nível de minuto são retidas por até 1 mês.
Regras de agregação para múltiplas instâncias
Para services com múltiplas instâncias, as métricas de throughput, contagem e capacidade são somadas entre todas as instâncias. Já as métricas de proporção, utilização e latência média são calculadas pela média entre todas as instâncias.
Painel de Monitoramento SGLang
Requests
Latency
Token Length Distribution
Token Throughput
Cache Hierarchy
KV Cache Pool
KV Transfer
Speculative Decoding
Scheduling
HTTP
System & Engine
Caminhos comuns de solução de problemas
Painel de Monitoramento VLLM
Para services com múltiplas instâncias, as métricas de throughput são somadas e as métricas de latência correspondem à média entre as instâncias.
|
Métrica |
Descrição |
|
Requests Status |
Total de requisições para o service.
|
|
Token Throughput |
Número de tokens de entrada e gerados para todas as requisições do service.
|
|
Request Completion Status |
Estatísticas de status de conclusão para todas as requisições do service.
|
|
Time To First Token |
Latência de tempo até o primeiro token para todas as requisições do service (tempo desde o recebimento de uma requisição até a geração do primeiro token).
|
|
Time Per Output Token |
Latência de tempo por token de saída para todas as requisições do service (tempo médio necessário para cada token de saída após a geração do primeiro token).
|
|
E2E Request Latency |
Latência de ponta a ponta para todas as requisições do service (tempo desde o recebimento de uma requisição até o retorno de todos os tokens).
|
|
Queue Time |
Latência de espera na fila para todas as requisições do service (tempo que as requisições aguardam na fila para processamento pelo mecanismo).
|
|
Inference Time |
Latência de inferência para todas as requisições do service (tempo que as requisições são processadas pelo mecanismo).
|
|
Prefill Time |
Latência do estágio Prefill para todas as requisições do service (tempo que o mecanismo processa os tokens de entrada da requisição).
|
|
Decode Time |
Latência do estágio Decode para todas as requisições do service (tempo que o mecanismo gera tokens de saída).
|
|
Input Token Length |
Número de tokens de entrada processados pelo service.
|
|
Output Token Length |
Número de tokens de saída gerados pelo service.
|
|
Request Parameters(params_n & max_tokens) |
Parâmetro N e parâmetro max_tokens para todas as requisições do service.
|
|
GPU KV Cache Usage |
Utilização média do cache KV da GPU do service. |
|
CPU KV Cache Usage |
Utilização média do cache KV da CPU do service. |
|
Prefix Cache Hit Rate |
Taxa média de acerto no cache de prefixo para todas as requisições do service.
|
|
HTTP Requests by Endpoint |
Número de requisições para o service, agrupadas por método de requisição, caminho e código de status da resposta. |
|
HTTP Request Latency |
Latência média para diferentes caminhos de requisição do service. |
|
Speculative Decoding Throughput |
Contagem de decodificação especulativa para o service. Média entre instâncias para services com múltiplas instâncias.
|
|
Speculative Decoding Efficiency |
Desempenho da decodificação especulativa do service.
|
|
Token Acceptance by Position |
Número de Tokens de Rascunho aceitos em diferentes posições de geração para o service. Média entre instâncias para services com múltiplas instâncias. |
FAQ
Painel de monitoramento de LLM não exibido
Problema: Após a implantação personalizada do EAS, a página de monitoramento mostra apenas os painéis Service e GPU. O monitoramento de LLM está ausente.
Causa: A configuração do service não possui a tag ServiceEngineType, que declara o tipo de mecanismo de inferência.
Apenas a tag ServiceEngineType afeta o monitoramento de LLM. Outros parâmetros de implantação do Model Gallery não têm impacto.
Solução: Atualize a configuração do service para adicionar a tag ServiceEngineType e defina seu valor com base no mecanismo de inferência utilizado (apenas vllm ou sglang são suportados). Por exemplo:
{
"labels": {
"ServiceEngineType": "vllm"
}
}
P: Por que /metrics 200 aparece frequentemente nos logs?
Assim que a tag ServiceEngineType entra em vigor, o backend do EAS consulta o endpoint /metrics do framework de inferência a cada 10-15 segundos em todos os pods. Este endpoint retorna métricas em tempo real no formato Prometheus para o painel de monitoramento de LLM.
P: Como verificar a concorrência máxima no monitoramento?
O monitoramento do EAS não fornece uma métrica direta de "concorrência máxima". Determine a concorrência com base no tipo de service:
Services de inferência LLM (mecanismo vllm ou sglang): Alterne para o VLLM Monitoring Dashboard ou SGLang Monitoring Dashboard e verifique a métrica Running em Requests Status ou Requests Num. Esta métrica indica o número de requisições atualmente em execução na GPU, o que representa a concorrência em tempo real. Ao alterar o intervalo de tempo (por exemplo, selecionando Last 1 hours ou Last 6 hours), encontre o valor de pico da curva Running, que corresponde à concorrência máxima naquele período.
Services gerais: Estime a concorrência usando as métricas QPS (consultas por segundo) e RT (tempo de resposta) do painel de monitoramento de service. Com base na Lei de Little:
Concorrência ≈ QPS × RT Médio (segundos). Por exemplo, se o QPS for 10 e o RT médio for 2 segundos, a concorrência é de aproximadamente 20. Aplique esta fórmula durante períodos de pico para estimar a concorrência máxima.
P: Qual é a diferença entre E2E Request Latency e RT?
A E2E Request Latency é fornecida pelo mecanismo de inferência LLM, enquanto o RT é fornecido pelo mecanismo EAS (easworker). Para cenários de LLM, recomenda-se a E2E Request Latency.
Referência
Após ativar service monitoring alerts, você receberá notificações de alerta quando o service acionar regras de alerta.
Visualize EAS Cloud Monitor events através do console CloudMonitor ou operação de api para realizar O&M, auditoria ou configurações de alerta para esses eventos.
Defina métricas de monitoramento personalizadas para Auto Scaling com base na lógica de negócios. Custom Monitoring and Scaling Metrics.