Importe métricas de service de inferência e de grupo de recursos do PAI-EAS para o Managed Service for Prometheus por meio do Integration Center do CloudMonitor 2.0. Consulte métricas com PromQL e conecte-se a sistemas de monitoramento externos, como o Grafana.
Faturamento
A ativação das opções PAI-EAS Inference Service Metrics e PAI-EAS Resource Group Metrics no Integration Center do CloudMonitor 2.0 gera as seguintes cobranças:
Etapa 1: Ativar métricas de monitoramento do EAS
Faça logon no console do CloudMonitor 2.0, selecione o workspace desejado e clique em Integration Center no painel de navegação à esquerda.
Na página Integration Center, pesquise "PAI-EAS" na caixa de busca e clique em no cartão de resultado.
-
Selecione PAI-EAS Inference Service Metrics e PAI-EAS Resource Group Metrics como fontes de dados.
ImportanteAs métricas avançadas de monitoramento incluem métricas de framework de inferência (vLLM ou SGLang), métricas de computação GPU, métricas de gateway do PAI-EAS, estatísticas nos níveis de service e de locatário, além de métricas personalizadas da aplicação de inferência (com prefixo
custom_). Para mais detalhes, consulte EAS service and resource group metrics. As regiões suportadas incluem Beijing, Shanghai, Hangzhou, Ulanqab, Singapore e Heyuan. Para ativar outras regiões, abra um ticket.Ative as métricas avançadas de monitoramento para criar painéis no Grafana ou configurar alertas personalizados.
A integração é executada automaticamente em segundo plano e leva cerca de 1 a 2 minutos. Clique em Integration Management para visualizar o status da integração e confirme sua conclusão.
Etapa 2: Obter informações da fonte de dados do Prometheus
O CloudMonitor 2.0 cria uma instância do Prometheus para armazenar as métricas de monitoramento do EAS. O local de armazenamento padrão é RegionShare:{{workspaceName}}:{{regionId}}, onde {{workspaceName}} é o nome do workspace e {{regionId}} é o ID da região.
Para recuperar dados de monitoramento pela API do Prometheus, obtenha a região e a URL de acesso dessa instância do Prometheus.
Acesse a aba Integration Management. Na lista de configurações de integração, clique em no ícone de expansão ao lado da integração que deseja visualizar.
Nos itens expandidos, localize PAI-EAS Inference Service Metrics ou PAI-EAS Resource Group Metrics para ver o componente de integração, o status e a região.
Na coluna Actions, clique em Data Source para visualizar a região e a URL de acesso do service do Prometheus.
Etapa 3: Consultar e explorar métricas
Explore as métricas de monitoramento do EAS pelo Metrics Explorer ou por consultas PromQL no service do Prometheus.
Os nomes das métricas do CloudMonitor usam o prefixo
AliyunLearn_eas. Eles correspondem às definições de métricas do EAS no CloudMonitor, mas incluem informações de tag mais detalhadas.Para métricas avançadas de monitoramento, consulte Advanced EAS monitoring metrics.
Na página Data Source da Etapa 2, clique em no ID da instância para acessar a página de detalhes do Prometheus Service.
-
Na aba Metrics Explorer, visualize os detalhes das métricas dos serviços EAS.
Método
Descrição
Filtrar métricas para visualizar detalhes
Na aba Metrics Explorer, clique em Metric Explorer no construtor de consultas.
Insira uma palavra-chave de métrica, como
AliyunLearn, na caixa de pesquisa e selecione a métrica desejada na lista suspensa, como uso de núcleos de CPU, utilização de CPU ou utilização de memória GPU.Na coluna Actions, clique em no ícone de exploração para definir condições de filtro e, em seguida, clique em no ícone de adição para incluir a métrica na caixa de consulta.
Clique em Run Query para visualizar o gráfico de tendência da métrica.
Consultar métricas com expressões PromQL.
Por exemplo, para consultar o QPS total em todos os serviços:
Insira
sum(AliyunLearn_eas_qps_total). (Para sintaxe PromQL, consulte Metric data query and analysis syntax)Clique em Run Query para visualizar a tendência do QPS total de todos os serviços EAS na região atual.
Etapa 4: Usar painéis do Grafana
Visualizar o painel padrão do Grafana
O CloudMonitor 2.0 fornece um painel padrão do Grafana:
No painel de navegação à esquerda da página de detalhes do service do Prometheus, clique em Dashboard List.
Clique em no nome de um painel para visualizar o painel integrado do Grafana.
Você também pode acessar a aba Dashboard a partir da política de integração em Provisioning.
Adicionar um painel
Adicione um painel de QPS global ao painel padrão do Grafana. Para mais informações sobre o Grafana, consulte Managed Service for Grafana.
Na página de detalhes do painel, clique em no botão Add panel no canto superior direito
e, em seguida, clique em Add a new panel na caixa de diálogo exibida.No lado direito da página Edit Panel, altere o tipo de gráfico para Stat.
No canto inferior esquerdo da página, altere Data source para ${datasource}.
Na área Query, mude para code no lado direito. Na caixa de texto Metrics browser, insira a consulta PromQL
sum(AliyunLearn_eas_eas_qps_total)e clique em Run queries.Ajuste os limiares para configurar cores de exibição diferentes para faixas de valores distintas. Após a pré-visualização do gráfico aparecer, clique em Apply para salve as configurações.
Etapa 5: Configurar regras de alerta
Na página de detalhes da instância do Prometheus, visualize as regras de alerta integradas. Todas as regras de alerta integradas são de nível P2 e iniciam com o status Stopped.
No painel de navegação à esquerda da página de detalhes do service do Prometheus, clique em Alert Rules.
Na página Alert Rules, visualize as regras de alerta predefinidas. Para ative uma regra, modifique seu status Enabled/Disabled. Para alterar a configuração de notificação, clique em Edit.
Se os modelos padrão não atenderem às suas necessidades, clique em Create Alert Rule para crie uma regra de alerta personalizada. Para descrições dos parâmetros, consulte Alert rules.
Apêndice: Métricas avançadas de monitoramento do EAS
As métricas a seguir estão disponíveis apenas quando as métricas avançadas de monitoramento são ativadas na Etapa 1.
Métricas de instância de serviço
|
Métrica |
Descrição |
Tags de métrica (dimensão) |
Categoria |
Tipo |
Unidade |
Período de coleta (s) |
|
instance_cpu_count |
Número de CPUs da instância de serviço |
instance,resource_type |
CPU |
Gauge |
count |
60 |
|
instance_gpu_count |
Número de GPUs da instância de serviço |
instance,resource_type |
GPU |
Gauge |
count |
60 |
|
instance_cpu_usage |
Uso de CPU da instância de serviço |
instance |
CPU |
Gauge |
core |
60 |
|
instance_user_cpu_usage |
Uso de CPU por processos de usuário da instância de serviço |
instance |
CPU |
Gauge |
core |
60 |
|
instance_system_cpu_usage |
Uso de CPU por processos de sistema da instância de serviço |
instance |
CPU |
Gauge |
core |
60 |
|
instance_cpu_util |
Utilização de CPU da instância de serviço |
instance |
CPU |
Gauge |
% |
60 |
|
instance_memory_rss_usage |
Uso de memória da instância de serviço |
instance |
Memory |
Gauge |
byte |
60 |
|
instance_memory_cache_usage |
Uso de cache de memória da instância de serviço |
instance |
Memory |
Gauge |
byte |
60 |
|
instance_memory_total |
Memória total da instância de serviço |
instance |
Memory |
Gauge |
byte |
60 |
|
instance_memory_util |
Utilização de memória da instância de serviço |
instance |
Memory |
Gauge |
% |
60 |
|
instance_response |
Número de requisições para a instância de serviço |
instance |
Request |
Counter |
count |
60 |
|
instance_gpu_util |
Utilização de GPU da instância de serviço |
instance |
GPU |
Gauge |
% |
60 |
|
instance_gpu_memory_usage |
Uso de memória GPU da instância de serviço |
instance |
GPU |
Gauge |
MiB |
60 |
|
instance_gpu_memory_total |
Memória GPU total da instância de serviço |
instance |
GPU |
Gauge |
MiB |
60 |
|
instance_gpu_memory_util |
Utilização de memória GPU da instância de serviço |
instance |
GPU |
Gauge |
MiB |
60 |
|
instance_gpu_memory_bandwidth_limit |
Limite de largura de banda de memória GPU da instância de serviço |
instance |
GPU |
Gauge |
bytes/second |
60 |
|
instance_gpu_temperature |
Temperatura da GPU da instância de serviço |
instance |
GPU |
Gauge |
°C |
60 |
|
instance_gpu_slow_temperature |
Temperatura de throttling da GPU da instância de serviço |
instance |
GPU |
Gauge |
°C |
60 |
|
instance_gpu_shut_temperature |
Temperatura de desligamento da GPU da instância de serviço |
instance |
GPU |
Gauge |
°C |
60 |
|
instance_gpu_nvswitch_error |
Contagem de erros fatais do NVSwitch da instância de serviço |
instance |
GPU |
Gauge |
count |
60s |
|
instance_gpu_nvswitch_non_fatal_error |
Contagem de erros não fatais do NVSwitch da instância de serviço |
instance |
GPU |
Gauge |
count |
60 |
|
instance_gpu_ecc_total_vol_sbe |
Total de erros ECC voláteis de bit único da instância de serviço |
instance |
GPU |
Counter |
count |
60 |
|
instance_gpu_ecc_total_vol_dbe |
Total de erros ECC voláteis de bit duplo da instância de serviço |
instance |
GPU |
Counter |
count |
60 |
|
instance_gpu_ecc_total_agg_sbe |
Total de erros ECC agregados (persistentes) de bit único da instância de serviço |
instance |
GPU |
Counter |
count |
60 |
|
instance_gpu_ecc_total_agg_dbe |
Total de erros ECC agregados (persistentes) de bit duplo da instância de serviço |
instance |
GPU |
Counter |
count |
60 |
|
instance_gpu_remap_fail |
Contagem de falhas de remapeamento de linhas da instância de serviço |
instance |
GPU |
Gauge |
count |
60 |
|
instance_gpu_remap_pending |
Contagem de remapeamentos de linhas pendentes da instância de serviço |
instance |
GPU |
Gauge |
count |
60 |
|
instance_gpu_pcie_replay_counter |
Contador de replay PCIe da instância de serviço |
instance |
GPU |
Gauge |
count |
60 |
|
instance_gpu_pcie_transmit_measure_by_dcgm |
Taxa de transmissão PCIe medida pelo DCGM da instância de serviço |
instance |
GPU |
Gauge |
bytes/second |
60 |
|
instance_gpu_pcie_receive_measure_by_dcgm |
Taxa de recepção PCIe medida pelo DCGM da instância de serviço |
instance |
GPU |
Gauge |
bytes/second |
60 |
|
instance_gpu_graphics_engine_util |
Utilização do mecanismo gráfico da instância de serviço |
instance |
GPU |
Gauge |
ratio (0~1) |
60 |
|
instance_gpu_sm_util |
Utilização do Streaming Multiprocessor (SM) da instância de serviço |
instance |
GPU |
Gauge |
ratio (0~1) |
60 |
|
instance_gpu_dram_active |
Proporção de tempo em que a interface de memória do dispositivo está enviando ou recebendo dados ativamente na instância de serviço |
instance |
GPU |
Gauge |
ratio (0~1) |
60 |
|
instance_gpu_tensortflops_used |
TFLOPS usados pelo pipeline Tensor da instância de serviço |
instance |
GPU |
Gauge |
count |
60 |
|
instance_gpu_memory_bandwidth_used |
Uso de largura de banda de memória da instância de serviço |
instance |
GPU |
Gauge |
bytes/second |
60 |
|
instance_gpu_sm_clock |
Frequência de clock do SM da instância de serviço |
instance |
GPU |
Gauge |
MHz |
60 |
|
instance_gpu_sm_occupancy |
Proporção de warps residentes no SM da instância de serviço |
instance |
GPU |
Gauge |
ratio (0~1) |
60 |
|
instance_gpu_fp32tflops_used |
TFLOPS usados pelo pipeline FP32 da instância de serviço |
instance |
GPU |
Gauge |
count |
60 |
|
instance_gpu_fp16tflops_used |
TFLOPS usados pelo pipeline FP16 da instância de serviço |
instance |
GPU |
Gauge |
count |
60 |
|
instance_gpu_pipe_fp32_active |
Proporção de ciclos ativos do pipeline FP32 da instância de serviço |
instance |
GPU |
Gauge |
ratio (0~1) |
60 |
|
instance_gpu_pipe_fp16_active |
Proporção de ciclos ativos do pipeline FP16 da instância de serviço |
instance |
GPU |
Gauge |
ratio (0~1) |
60s |
|
instance_gpu_pipe_tensor_active |
Proporção de ciclos ativos do pipeline Tensor da instância de serviço |
instance |
GPU |
Gauge |
ratio (0~1) |
60 |
|
instance_gpu_power_usage |
Consumo de energia da GPU da instância de serviço |
instance |
GPU |
Gauge |
watts |
60 |
|
instance_accelerator_power_usage |
Consumo de energia do acelerador da instância de serviço |
instance |
GPU |
Gauge |
milliwatts |
60 |
|
instance_gpu_mem_copy_util |
Utilização de cópia de memória da instância de serviço |
instance |
GPU |
Gauge |
% |
60 |
|
instance_gpu_health_count |
Contagem total de status de saúde da GPU da instância de serviço |
instance |
GPU |
Gauge |
count |
60 |
|
instance_gpu_lost_card_num |
Número de GPUs perdidas na VM da instância de serviço |
instance |
GPU |
Gauge |
count |
60 |
|
instance_gpu_driver_hang |
Contagem de travamentos do driver da GPU da instância de serviço |
instance |
GPU |
Gauge |
count |
60 |
|
instance_gpu_profile_status |
Status de profiling Amperf da instância de serviço |
instance |
GPU |
Gauge |
count |
60 |
|
instance_gpu_uncorrectable_ecc |
Contagem de erros ECC incorrigíveis da instância de serviço |
instance |
GPU |
Gauge |
count |
60 |
|
instance_gpu_xid_cnt |
Contagem de erros Xid da instância de serviço |
instance |
GPU |
Gauge |
count |
60 |
|
instance_gpu_fatal_xid_error |
Contagem de erros fatais Xid da instância de serviço |
instance |
GPU |
Gauge |
count |
60 |
|
instance_gpu_kernel_err_cnt |
Contagem de erros não-Xid nos logs do kernel da instância de serviço |
instance |
GPU |
Gauge |
count |
60 |
|
instance_qps |
Requisições por segundo da instância de serviço |
instance |
Request |
Gauge |
count |
60 |
|
instance_traffic |
Tráfego da instância de serviço |
instance |
Request |
Gauge |
bps |
60 |
|
instance_avg_latency |
Tempo médio de resposta de requisição da instância de serviço |
instance |
Request |
Gauge |
ms |
60 |
|
instance_tpxx_latency |
Tempo de resposta TOPXX de requisição da instância de serviço |
instance |
Request |
Gauge |
ms |
60 |
|
instance_traffic_in |
Tráfego de entrada da instância de serviço |
instance |
Request |
Gauge |
bps |
60 |
|
instance_traffic_out |
Tráfego de saída da instância de serviço |
instance |
Request |
Gauge |
bps |
60 |
|
instance_tcp_connections |
Contagem de conexões TCP da instância de serviço |
instance |
Request |
Gauge |
count |
60 |
Métricas de serviço
|
Métrica |
Descrição |
Tags de métrica (dimensão) |
Categoria |
Tipo |
Unidade |
Período de coleta (s) |
|
service_replicas |
Número de instâncias de serviço |
service |
Meta |
Gauge |
count |
60 |
|
service_pending_replicas |
Número de instâncias de serviço pendentes |
service |
Meta |
Gauge |
count |
60 |
|
service_available_replicas |
Número de instâncias de serviço em execução |
service |
Meta |
Gauge |
count |
60 |
|
service_replicas_with_resource_type |
Número de instâncias de serviço (com tag de tipo de recurso) |
service |
Meta |
Gauge |
count |
60 |
|
service_cpu_count |
Total de CPUs alocadas ao serviço |
service |
CPU |
Gauge |
core |
60 |
|
service_cpu_count_with_resource_type |
Total de CPUs do serviço (com tag de tipo de recurso) |
service |
CPU |
Gauge |
core |
60 |
|
service_gpu_count_with_resource_type |
Total de GPUs do serviço (com tag de tipo de recurso) |
service |
GPU |
Gauge |
count |
60 |
|
service_rps_status_2xx |
Número de respostas 2XX do serviço |
service |
Request |
Gauge |
count |
60 |
|
service_rps_status_4xx |
Número de respostas 4XX do serviço |
service |
Request |
Gauge |
count |
60 |
|
service_rps_status_5xx |
Número de respostas 5XX do serviço |
service |
Request |
Gauge |
count |
60 |
|
service_rps_status_2xx_ratio |
Proporção de respostas 2XX do serviço |
service |
Request |
Gauge |
% |
60 |
|
service_rps_status_4xx_ratio |
Proporção de respostas 4XX do serviço |
service |
Request |
Gauge |
% |
60 |
|
service_rps_status_5xx_ratio |
Proporção de respostas 5XX do serviço |
service |
Request |
Gauge |
% |
60 |
|
service_qps |
Requisições por segundo do serviço |
service |
Request |
Gauge |
count |
60 |
|
service_avg_latency |
Tempo médio de resposta de requisição do serviço |
service |
Request |
Gauge |
ms |
60 |
|
service_tpxx_latency |
Tempo de resposta TOPXX de requisição do serviço |
service |
Request |
Gauge |
ms |
60 |
|
service_tp100_latency |
Tempo de resposta TOP100 de requisição do serviço |
service |
Request |
Gauge |
ms |
60 |
|
service_traffic_in |
Tráfego de entrada do serviço |
service |
Network |
Gauge |
bps |
60 |
|
service_traffic_out |
Tráfego de saída do serviço |
service |
Network |
Gauge |
60 |
|
|
service_cpu_usage |
Uso de CPU do serviço |
service |
CPU |
Gauge |
core |
60 |
|
service_user_cpu_usage |
Uso de CPU por processos de usuário do serviço |
service |
CPU |
Gauge |
core |
60 |
|
service_system_cpu_usage |
Uso de CPU por processos de sistema do serviço |
service |
CPU |
Gauge |
core |
60 |
|
service_cpu_util |
Utilização de CPU do serviço |
service |
CPU |
Gauge |
% |
60 |
|
service_memory_rss_usage |
Uso de memória do serviço |
service |
Memory |
Gauge |
byte |
60 |
|
service_memory_cache_usage |
Uso de cache de memória do serviço |
service |
Memory |
Gauge |
byte |
60 |
|
service_memory_total |
Memória total do serviço |
service |
Memory |
Gauge |
byte |
60 |
|
service_memory_util |
Utilização de memória do serviço |
service |
Memory |
Gauge |
% |
60 |
|
service_gpu_util |
Utilização de GPU do serviço |
service |
GPU |
Gauge |
% |
60 |
|
service_gpu_memory_usage |
Uso de memória GPU do serviço |
service |
GPU |
Gauge |
MiB |
60 |
|
service_gpu_memory_total |
Memória GPU total do serviço |
service |
GPU |
Gauge |
MiB |
60 |
|
service_gpu_memory_util |
Utilização de memória GPU do serviço |
service |
GPU |
Gauge |
MiB |
60 |
|
service_gpu_memory_bandwidth_limit |
Limite de largura de banda de memória GPU do serviço |
service |
GPU |
Gauge |
bytes/second |
60 |
|
service_gpu_temperature |
Temperatura da GPU do serviço |
service |
GPU |
Gauge |
°C |
60 |
|
service_gpu_slow_temperature |
Temperatura de throttling da GPU do serviço |
service |
GPU |
Gauge |
°C |
60 |
|
service_gpu_shut_temperature |
Temperatura de desligamento da GPU do serviço |
service |
GPU |
Gauge |
°C |
60 |
|
service_gpu_nvswitch_error |
Contagem de erros fatais do NVSwitch do serviço |
service |
GPU |
Gauge |
count |
60 |
|
service_gpu_nvswitch_non_fatal_error |
Contagem de erros não fatais do NVSwitch do serviço |
service |
GPU |
Gauge |
count |
60 |
|
service_gpu_ecc_total_vol_sbe |
Total de erros ECC voláteis de bit único do serviço |
service |
GPU |
Counter |
count |
60 |
|
service_gpu_ecc_total_vol_dbe |
Total de erros ECC voláteis de bit duplo do serviço |
service |
GPU |
Counter |
count |
60 |
|
service_gpu_ecc_total_agg_sbe |
Total de erros ECC agregados (persistentes) de bit único do serviço |
service |
GPU |
Counter |
count |
60 |
|
service_gpu_ecc_total_agg_dbe |
Total de erros ECC agregados (persistentes) de bit duplo do serviço |
service |
GPU |
Counter |
count |
60 |
|
service_gpu_remap_fail |
Contagem de falhas de remapeamento de linhas do serviço |
service |
GPU |
Gauge |
count |
60 |
|
service_gpu_remap_pending |
Contagem de remapeamentos de linhas pendentes do serviço |
service |
GPU |
Gauge |
count |
60 |
|
service_gpu_pcie_replay_counter |
Contador de replay PCIe do serviço |
service |
GPU |
Gauge |
count |
60 |
|
service_gpu_pcie_transmit_measure_by_dcgm |
Taxa de transmissão PCIe medida pelo DCGM do serviço |
service |
GPU |
Gauge |
bytes/second |
60 |
|
service_gpu_pcie_receive_measure_by_dcgm |
Taxa de recepção PCIe medida pelo DCGM do serviço |
service |
GPU |
Gauge |
bytes/second |
60 |
|
service_gpu_graphics_engine_util |
Utilização do mecanismo gráfico do serviço |
service |
GPU |
Gauge |
ratio (0~1) |
60 |
|
service_gpu_sm_util |
Utilização do Streaming Multiprocessor (SM) do serviço |
service |
GPU |
Gauge |
ratio (0~1) |
60 |
|
service_gpu_dram_active |
Proporção de tempo em que a interface de memória do dispositivo está enviando ou recebendo dados ativamente no serviço |
service |
GPU |
Gauge |
ratio (0~1) |
60 |
|
service_gpu_tensortflops_used |
TFLOPS usados pelo pipeline Tensor do serviço |
service |
GPU |
Gauge |
count |
60 |
|
service_gpu_memory_bandwidth_used |
Uso de largura de banda de memória do serviço |
service |
GPU |
Gauge |
bytes/second |
60 |
|
service_gpu_sm_clock |
Frequência de clock do SM do serviço |
service |
GPU |
Gauge |
MHz |
60 |
|
service_gpu_sm_occupancy |
Proporção de warps residentes no SM do serviço |
service |
GPU |
Gauge |
ratio (0~1) |
60 |
|
service_gpu_fp32tflops_used |
TFLOPS usados pelo pipeline FP32 do serviço |
service |
GPU |
Gauge |
count |
60 |
|
service_gpu_fp16tflops_used |
TFLOPS usados pelo pipeline FP16 do serviço |
service |
GPU |
Gauge |
count |
60 |
|
service_gpu_pipe_fp32_active |
Proporção de ciclos ativos do pipeline FP32 do serviço |
service |
GPU |
Gauge |
ratio (0~1) |
60 |
|
service_gpu_pipe_fp16_active |
Proporção de ciclos ativos do pipeline FP16 do serviço |
service |
GPU |
Gauge |
ratio (0~1) |
60 |
|
service_gpu_pipe_tensor_active |
Proporção de ciclos ativos do pipeline Tensor do serviço |
service |
GPU |
Gauge |
ratio (0~1) |
60 |
|
service_gpu_power_usage |
Consumo de energia da GPU do serviço |
service |
GPU |
Gauge |
watts |
60 |
|
service_accelerator_power_usage |
Consumo de energia do acelerador do serviço |
service |
GPU |
Gauge |
milliwatts |
60 |
|
service_gpu_mem_copy_util |
Utilização de cópia de memória do serviço |
service |
GPU |
Gauge |
% |
60 |
|
service_gpu_health_count |
Contagem total de status de saúde da GPU do serviço |
service |
GPU |
Gauge |
count |
60 |
|
service_gpu_lost_card_num |
Número de GPUs perdidas na VM do serviço |
service |
GPU |
Gauge |
count |
60 |
|
service_gpu_driver_hang |
Contagem de travamentos do driver da GPU do serviço |
service |
GPU |
Gauge |
count |
60 |
|
service_gpu_profile_status |
Status de profiling Amperf do serviço |
service |
GPU |
Gauge |
count |
60 |
|
service_gpu_uncorrectable_ecc |
Contagem de erros ECC incorrigíveis do serviço |
service |
GPU |
Gauge |
count |
60 |
|
service_gpu_xid_cnt |
Contagem de erros Xid do serviço |
service |
GPU |
Gauge |
count |
60 |
|
service_gpu_fatal_xid_error |
Contagem de erros fatais Xid do serviço |
service |
GPU |
Gauge |
count |
60 |
|
service_gpu_kernel_err_cnt |
Contagem de erros não-Xid nos logs do kernel do serviço |
service |
GPU |
Gauge |
count |
60 |
|
service_tcp_connections |
Contagem de conexões TCP do serviço |
service |
Network |
Gauge |
count |
60 |
|
service_gateway_requests |
llm-gateway: número atual de requisições recebidas pelo gateway |
service |
Request |
Gauge |
count |
60 |
|
service_gateway_pending_requests |
llm-gateway: número atual de requisições em buffer no gateway |
service |
Request |
Gauge |
count |
60 |
|
service_llm_ttft_max |
llm-gateway: tempo máximo para o primeiro token (TTFT) em requisições de streaming LLM |
service |
Request |
Gauge |
time |
60 |
|
service_llm_ttft_min |
llm-gateway: tempo mínimo para o primeiro token (TTFT) em requisições de streaming LLM |
service |
Request |
Gauge |
time |
60 |
|
service_llm_ttft_mean |
llm-gateway: tempo médio para o primeiro token (TTFT) em requisições de streaming LLM |
service |
Request |
Gauge |
time |
60 |
|
service_llm_ttft_percent |
llm-gateway: percentil do tempo para o primeiro token (TTFT) em requisições de streaming LLM |
service |
Request |
Gauge |
time |
60 |
|
service_llm_tpot_max |
llm-gateway: tempo máximo por token de saída (TPOT) em requisições de streaming LLM |
service |
Request |
Gauge |
time |
60 |
|
service_llm_tpot_min |
llm-gateway: tempo mínimo por token de saída (TPOT) em requisições de streaming LLM |
service |
Request |
Gauge |
time |
60 |
|
service_llm_tpot_mean |
llm-gateway: tempo médio por token de saída (TPOT) em requisições de streaming LLM |
service |
Request |
Gauge |
time |
60 |
|
service_llm_tpot_percent |
llm-gateway: percentil do tempo por token de saída (TPOT) em requisições de streaming LLM |
service |
Request |
Gauge |
time |
60 |
|
service_endpoint_llm_waiting_requests |
llm-gateway: número de requisições na fila do mecanismo de inferência LLM |
service |
Request |
Gauge |
count |
60 |
|
service_endpoint_llm_running_requests |
llm-gateway: número de requisições sendo processadas pelo mecanismo de inferência LLM |
service |
Request |
Gauge |
count |
60 |
|
service_endpoint_llm_gpu_cache_usage |
llm-gateway: utilização do KV-cache da GPU pelo mecanismo de inferência LLM |
service |
Request |
Gauge |
count |
60 |
|
service_endpoint_llm_tps_in |
llm-gateway: tokens de entrada por segundo do mecanismo LLM |
service |
Request |
Gauge |
count |
60 |
|
service_endpoint_llm_tps_out |
llm-gateway: tokens de saída por segundo do mecanismo LLM |
service |
Request |
Gauge |
count |
60 |
Métricas de grupo de recursos
|
Métrica |
Descrição |
Tags de métrica (dimensão) |
Categoria |
Tipo |
Unidade |
Período de coleta (s) |
|
resource_instance_cpu_util |
Utilização de CPU da instância do grupo de recursos |
instance_id |
Resource Instance |
Gauge |
% |
60 |
|
resource_instance_memory_total |
Memória total da instância do grupo de recursos |
instance_id |
Resource Instance |
Gauge |
byte |
60 |
|
resource_instance_memory_used |
Uso de memória da instância do grupo de recursos |
instance_id |
Resource Instance |
Gauge |
byte |
60 |
|
resource_instance_memory_util |
Utilização de memória da instância do grupo de recursos |
instance_id |
Resource Instance |
Gauge |
% |
60 |
|
resource_instance_memory_cache |
Uso de cache de memória da instância do grupo de recursos |
instance_id |
Resource Instance |
Gauge |
byte |
60 |
|
resource_instance_memory_free |
Memória livre da instância do grupo de recursos |
instance_id |
Resource Instance |
Gauge |
byte |
60 |
|
resource_instance_traffic_in |
Tráfego de entrada da instância do grupo de recursos |
instance_id |
Resource Instance |
Gauge |
bytes/second |
60 |
|
resource_instance_traffic_out |
Tráfego de saída da instância do grupo de recursos |
instance_id |
Resource Instance |
Gauge |
bytes/second |
60 |
|
resource_instance_disk_used |
Uso de disco da instância do grupo de recursos |
instance_id |
Resource Instance |
Gauge |
byte |
60 |
|
resource_instance_disk_total |
Disco total da instância do grupo de recursos |
instance_id |
Resource Instance |
Gauge |
byte |
60 |
|
resource_instance_disk_util |
Utilização de disco da instância do grupo de recursos |
instance_id |
Resource Instance |
Gauge |
byte |
60 |
|
resource_instance_tcp_established |
Conexões TCP estabelecidas da instância do grupo de recursos |
instance_id |
Resource Instance |
Gauge |
count |
60 |
|
resource_instance_tcp_time_wait |
Conexões TCP em estado TIME_WAIT da instância do grupo de recursos |
instance_id |
Resource Instance |
Gauge |
count |
60 |
|
resource_instance_gpu_util |
Utilização de GPU da instância do grupo de recursos |
instance_id |
Resource Instance |
Gauge |
% |
60 |
|
resource_instance_gpu_memory_usage |
Uso de memória GPU da instância do grupo de recursos |
instance_id |
Resource Instance |
Gauge |
MiB |
60 |
|
resource_instance_gpu_memory_total |
Memória GPU total da instância do grupo de recursos |
instance_id |
Resource Instance |
Gauge |
MiB |
60 |
|
resource_instance_gpu_memory_util |
Utilização de memória GPU da instância do grupo de recursos |
instance_id |
Resource Instance |
Gauge |
% |
60 |
|
resource_cpu_util |
Utilização de CPU do grupo de recursos |
resource |
Resource |
Gauge |
% |
60 |
|
resource_memory_total |
Memória total do grupo de recursos |
resource |
Resource |
Gauge |
byte |
60 |
|
resource_memory_used |
Uso de memória do grupo de recursos |
resource |
Resource |
Gauge |
byte |
60 |
|
resource_memory_util |
Utilização de memória do grupo de recursos |
resource |
Resource |
Gauge |
% |
60 |
|
resource_memory_cache |
Uso de cache de memória do grupo de recursos |
resource |
Resource |
Gauge |
byte |
60 |
|
resource_memory_free |
Memória livre do grupo de recursos |
resource |
Resource |
Gauge |
byte |
60 |
|
resource_traffic_in |
Tráfego de entrada do grupo de recursos |
resource |
Resource |
Gauge |
bytes/second |
60 |
|
resource_traffic_out |
Tráfego de saída do grupo de recursos |
resource |
Resource |
Gauge |
bytes/second |
60 |
|
resource_disk_used |
Uso de disco do grupo de recursos |
resource |
Resource |
Gauge |
byte |
60 |
|
resource_disk_total |
Disco total do grupo de recursos |
resource |
Resource |
Gauge |
byte |
60 |
|
resource_disk_util |
Utilização de disco do grupo de recursos |
resource |
Resource |
Gauge |
byte |
60 |
|
resource_tcp_established |
Conexões TCP estabelecidas do grupo de recursos |
resource |
Resource |
Gauge |
count |
60 |
|
resource_tcp_time_wait |
Conexões TCP em estado TIME_WAIT do grupo de recursos |
resource |
Resource |
Gauge |
count |
60 |
|
resource_gpu_util |
Utilização de GPU do grupo de recursos |
resource |
Resource |
Gauge |
% |
60 |
|
resource_gpu_memory_usage |
Uso de memória GPU do grupo de recursos |
resource |
Resource |
Gauge |
MiB |
60 |
|
resource_gpu_memory_total |
Memória GPU total do grupo de recursos |
resource |
Resource |
Gauge |
MiB |
60 |
|
resource_gpu_memory_util |
Utilização de memória GPU do grupo de recursos |
resource |
Resource |
Gauge |
% |
60 |