Após implantar um serviço EAS, use a página de monitoramento para acompanhar o volume de requisições, a latência e o uso de recursos.
Visualizar dados de monitoramento
Faça login no PAI console. Selecione uma região na parte superior da página. Em seguida, selecione o workspace desejado e clique em Elastic Algorithm Service (EAS).
Clique em nome do serviço para abrir os detalhes e alterne para a aba Monitoring.
-
Visualize os painéis e as métricas de monitoramento.
Switch Dashboards
No canto superior esquerdo da página Monitoring, clique em lista suspensa Service para alternar entre dimensões.
Service: Dimensão de serviço. O formato padrão do nome do painel de monitoramento é
Service-<service_name>, onde<service_name>é o nome do serviço EAS.-
Instance: Painel no nível da instância com visualizações de instância única e múltipla.
-
Single Instance: Métricas para uma instância por vez. Alterne entre instâncias para comparar.
Selecione uma instância na lista suspensa Instance à direita para visualizar suas métricas de monitoramento, como QPS e RT.
Multiple Instance: Métricas para várias instâncias lado a lado.
-
Switch Time Range
Clique em
na área Monitoring para alterar o intervalo de tempo do painel.No painel seletor de horário que se abre, especifique um horário inicial e final personalizado em Absolute time range à esquerda ou selecione um intervalo predefinido, como Last 5 minutes até Last 7 days, na lista Relative time ranges à direita. O intervalo selecionado é marcado com um sinal de verificação (✓).
ImportanteAs métricas no nível de minuto são retidas por até 1 mês. As métricas no nível de segundo são retidas por até 1 hora.
ImportanteAs métricas de monitoramento de LLM aparecem apenas quando a tag do serviço contém
"ServiceEngineType": "vllm"ou"ServiceEngineType" : "sglang".
Métricas de monitoramento
Painel de Monitoramento de Serviço (Nível de Minuto)
Este painel rastreia as seguintes métricas:
|
Metric |
Description |
|
QPS |
Requisições por segundo, agrupadas por código de retorno. Somadas entre instâncias para serviços com múltiplas instâncias. O deslocamento de 1d mostra o QPS do dia anterior para comparação de tendências. | |
Response |
Total de respostas no intervalo de tempo selecionado, agrupadas por código de retorno. Somadas entre instâncias para serviços com múltiplas instâncias. | |
RT |
Tempo de resposta da requisição.
| |
|
Daily Invoke |
Contagem diária de chamadas, agrupada por código de retorno. Somada entre instâncias para serviços com múltiplas instâncias. |
|
Painel de Monitoramento de Instância Única (Nível de Minuto)
Este painel rastreia as seguintes métricas:
|
Metric |
Description |
|
QPS |
Requisições por segundo recebidas por esta instância. Agrupadas por código de retorno. |
|
RT |
Tempo de resposta das requisições para esta instância. |
|
Response |
Total de respostas recebidas por esta instância dentro do intervalo de tempo selecionado. Agrupadas por código de retorno. |
Painel de Monitoramento de Múltiplas Instâncias
Métricas no nível de minuto e no nível de segundo:
-
Minute-Level
Metric
Description
Instance QPS
Requisições por segundo para cada instância. Agrupadas por código de retorno.
Instance RT
Tempo médio de resposta para cada instância.
Instance CPU
Uso de CPU para cada instância, em núcleos de CPU.
Instance Memory -- RSS
Tamanho da memória física residente para cada instância.
Instance Memory -- Cache
Tamanho do cache para cada instância.
Instance GPU
Utilização da GPU para cada instância.
Instance GPU Memory
Uso de memória da GPU para cada instância.
Instance TCP Connections
Número de conexões TCP para cada instância.
-
Second-Level
ImportanteA granularidade dos dados é de 5 segundos. Apenas a última 1 hora de dados é retida.
Metric
Description
Instance QPS Fine
Requisições por segundo recebidas por cada instância. Agrupadas por código de retorno.
Instance RT Fine
Tempo médio de resposta para requisições recebidas por cada instância.
Painel de Monitoramento de GPU
Métricas de GPU nos níveis de serviço e instância. Os valores no nível de serviço representam a média de todas as instâncias.
|
Metric |
Description |
|
GPU Utilization |
Utilização da GPU do serviço. |
|
GPU Memory |
Uso de memória da GPU e memória total da GPU do serviço.
|
|
Memory Copy Utilization |
Utilização de cópia de memória da GPU do serviço. |
|
GPU Memory Utilization |
Utilização da memória da GPU do serviço. Cálculo: Uso de memória ÷ Memória total. |
|
PCIe |
Taxa PCIe (Peripheral Component Interconnect Express) do serviço, medida pelo DCGM. PCIe é um padrão de barramento de expansão serial de alta velocidade para computadores.
|
|
Memory Bandwidth |
Métrica de largura de banda da memória da GPU do serviço. |
|
SM Utilization and Occupancy |
Métricas relacionadas ao SM (Streaming Multiprocessor) do serviço. Os SMs são componentes principais de uma GPU, responsáveis por executar e agendar tarefas de computação paralela.
|
|
Graphics Engine Utilization |
Utilização do mecanismo gráfico da GPU do serviço. |
|
Pipe Active Ratio |
Taxa de atividade dos pipelines de computação da GPU do serviço.
|
|
Tflops Usage |
Volume de computação Tflops (Tera operações de ponto flutuante por segundo) dos pipelines de computação da GPU do serviço.
|
|
DRAM Active Ratio |
Taxa de atividade da interface de memória do dispositivo GPU durante envio ou recebimento de dados. |
|
SM Clock |
Frequência de clock do SM do serviço. |
|
GPU Temperature |
Métricas relacionadas à temperatura da GPU do serviço.
|
|
Power Usage |
Consumo de energia da GPU do serviço. |
Painel de Monitoramento VLLM
Para serviços com múltiplas instâncias, as métricas de throughput são somadas e as métricas de latência representam a média entre as instâncias.
|
Metric |
Description |
|
Requests Status |
Total de requisições para o serviço.
|
|
Token Throughput |
Número de tokens de entrada e gerados para todas as requisições do serviço.
|
|
Request Completion Status |
Estatísticas de status de conclusão para todas as requisições do serviço.
|
|
Time To First Token |
Latência até o primeiro token para todas as requisições do serviço (tempo desde o recebimento de uma requisição até a geração do primeiro token).
|
|
Time Per Output Token |
Latência por token de saída para todas as requisições do serviço (tempo médio necessário para cada token de saída após a geração do primeiro token).
|
|
E2E Request Latency |
Latência de ponta a ponta para todas as requisições do serviço (tempo desde o recebimento de uma requisição até o retorno de todos os tokens).
|
|
Queue Time |
Latência de espera na fila para todas as requisições do serviço (tempo que as requisições aguardam na fila para processamento pelo motor).
|
|
Inference Time |
Latência de inferência para todas as requisições do serviço (tempo em que as requisições são processadas pelo motor).
|
|
Prefill Time |
Latência da fase de preenchimento (prefill) para todas as requisições do serviço (tempo em que o motor processa os tokens de entrada da requisição).
|
|
Decode Time |
Latência da fase de decodificação para todas as requisições do serviço (tempo em que o motor gera tokens de saída).
|
|
Input Token Length |
Número de tokens de entrada processados pelo serviço.
|
|
Output Token Length |
Número de tokens de saída gerados pelo serviço.
|
|
Request Parameters(params_n & max_tokens) |
Parâmetro N e parâmetro max_tokens para todas as requisições do serviço.
|
|
GPU KV Cache Usage |
Utilização média do cache KV da GPU do serviço. |
|
CPU KV Cache Usage |
Utilização média do cache KV da CPU do serviço. |
|
Prefix Cache Hit Rate |
Taxa média de acerto do cache de prefixo para todas as requisições do serviço.
|
|
HTTP Requests by Endpoint |
Número de requisições para o serviço, agrupadas por método de requisição, caminho e código de status de resposta. |
|
HTTP Request Latency |
Latência média para diferentes caminhos de requisição do serviço. |
|
Speculative Decoding Throughput |
Contagem de decodificação especulativa para o serviço. Média entre instâncias para serviços com múltiplas instâncias.
|
|
Speculative Decoding Efficiency |
Desempenho da decodificação especulativa do serviço.
|
|
Token Acceptance by Position |
Número de Tokens Rascunho aceitos em diferentes posições de geração para o serviço. Média entre instâncias para serviços com múltiplas instâncias. |
Painel de Monitoramento SGLang
Para serviços com múltiplas instâncias, as métricas de throughput são somadas e as métricas de latência representam a média entre as instâncias.
|
Metric |
Description |
|
Requests Num |
Total de requisições para o serviço.
|
|
Token Throughput |
Número de tokens de entrada e gerados para todas as requisições do serviço.
|
|
Time To First Token |
Latência até o primeiro token para todas as requisições do serviço. A latência até o primeiro token é o tempo desde o recebimento de uma requisição até a geração do primeiro token.
|
|
Time Per Output Token |
Latência por token de saída para todas as requisições do serviço. A latência por token é o tempo médio necessário para cada token de saída subsequente após a geração do primeiro token.
|
|
E2E Request Latency |
Latência de ponta a ponta para todas as requisições do serviço. A latência de ponta a ponta é o tempo desde o recebimento de uma requisição até o retorno de todos os tokens.
|
|
Cache Hit Rate |
Taxa média de acerto do cache de prefixo para todas as requisições do serviço. |
|
Used Tokens Num |
Número de tokens de cache KV usados pelo serviço. Média entre instâncias para serviços com múltiplas instâncias. |
|
Token Usage |
Utilização média de tokens do cache KV do serviço. Média entre instâncias para serviços com múltiplas instâncias. |
FAQ
Painel de monitoramento de LLM não exibido
Problema: Após a implantação personalizada do EAS, a página de monitoramento mostra apenas os painéis Service e GPU. O monitoramento de LLM está ausente.
Causa: A configuração do serviço não possui a tag ServiceEngineType, que declara o tipo de motor de inferência.
Apenas a tag ServiceEngineType afeta o monitoramento de LLM. Outros parâmetros de implantação do Model Gallery não têm impacto.
Solução: Atualize a configuração do serviço para adicionar a tag ServiceEngineType e defina seu valor com base no motor de inferência usado (apenas vllm ou sglang são suportados). Por exemplo:
{
"labels": {
"ServiceEngineType": "vllm"
}
}
P: Por que /metrics 200 aparece frequentemente nos logs?
Assim que a tag ServiceEngineType entra em vigor, o backend do EAS consulta o endpoint /metrics do framework de inferência a cada 10-15 segundos em todos os pods. Este endpoint retorna métricas em tempo real no formato Prometheus para o painel de monitoramento de LLM.
Referência
Após ativar os alertas de monitoramento de serviço, você receberá notificações de alerta quando o serviço acionar regras de alerta.
Visualize os eventos do Cloud Monitor do EAS pelo console do CloudMonitor ou operação de API para realizar O&M, auditoria ou configurações de alerta para esses eventos.
Defina métricas de monitoramento personalizadas para o Auto Scaling com base na lógica de negócios. Consulte Métricas Personalizadas de Monitoramento e Dimensionamento.