Todos os produtos
Search
Central de documentação

Platform For AI:Monitore serviços de inferência do EAS com o Prometheus

Última atualização: Aug 24, 2026

Importe métricas de service de inferência e de grupo de recursos do PAI-EAS para o Managed Service for Prometheus por meio do Integration Center do CloudMonitor 2.0. Consulte métricas com PromQL e conecte-se a sistemas de monitoramento externos, como o Grafana.

Faturamento

A ativação das opções PAI-EAS Inference Service Metrics e PAI-EAS Resource Group Metrics no Integration Center do CloudMonitor 2.0 gera as seguintes cobranças:

Etapa 1: Ativar métricas de monitoramento do EAS

  1. Faça logon no console do CloudMonitor 2.0, selecione o workspace desejado e clique em Integration Center no painel de navegação à esquerda.

  2. Na página Integration Center, pesquise "PAI-EAS" na caixa de busca e clique em no cartão de resultado.

  3. Selecione PAI-EAS Inference Service Metrics e PAI-EAS Resource Group Metrics como fontes de dados.

    Importante

    As métricas avançadas de monitoramento incluem métricas de framework de inferência (vLLM ou SGLang), métricas de computação GPU, métricas de gateway do PAI-EAS, estatísticas nos níveis de service e de locatário, além de métricas personalizadas da aplicação de inferência (com prefixo custom_). Para mais detalhes, consulte EAS service and resource group metrics. As regiões suportadas incluem Beijing, Shanghai, Hangzhou, Ulanqab, Singapore e Heyuan. Para ativar outras regiões, abra um ticket.

    Ative as métricas avançadas de monitoramento para criar painéis no Grafana ou configurar alertas personalizados.

  4. A integração é executada automaticamente em segundo plano e leva cerca de 1 a 2 minutos. Clique em Integration Management para visualizar o status da integração e confirme sua conclusão.

Etapa 2: Obter informações da fonte de dados do Prometheus

O CloudMonitor 2.0 cria uma instância do Prometheus para armazenar as métricas de monitoramento do EAS. O local de armazenamento padrão é RegionShare:{{workspaceName}}:{{regionId}}, onde {{workspaceName}} é o nome do workspace e {{regionId}} é o ID da região.

Para recuperar dados de monitoramento pela API do Prometheus, obtenha a região e a URL de acesso dessa instância do Prometheus.

  1. Acesse a aba Integration Management. Na lista de configurações de integração, clique em no ícone de expansão ao lado da integração que deseja visualizar.

  2. Nos itens expandidos, localize PAI-EAS Inference Service Metrics ou PAI-EAS Resource Group Metrics para ver o componente de integração, o status e a região.

  3. Na coluna Actions, clique em Data Source para visualizar a região e a URL de acesso do service do Prometheus.

Etapa 3: Consultar e explorar métricas

Explore as métricas de monitoramento do EAS pelo Metrics Explorer ou por consultas PromQL no service do Prometheus.

  1. Na página Data Source da Etapa 2, clique em no ID da instância para acessar a página de detalhes do Prometheus Service.

  2. Na aba Metrics Explorer, visualize os detalhes das métricas dos serviços EAS.

    Método

    Descrição

    Filtrar métricas para visualizar detalhes

    1. Na aba Metrics Explorer, clique em Metric Explorer no construtor de consultas.

    2. Insira uma palavra-chave de métrica, como AliyunLearn, na caixa de pesquisa e selecione a métrica desejada na lista suspensa, como uso de núcleos de CPU, utilização de CPU ou utilização de memória GPU.

    3. Na coluna Actions, clique em no ícone de exploração para definir condições de filtro e, em seguida, clique em no ícone de adição para incluir a métrica na caixa de consulta.

    4. Clique em Run Query para visualizar o gráfico de tendência da métrica.

    Consultar métricas com expressões PromQL.

    Por exemplo, para consultar o QPS total em todos os serviços:

    1. Insira sum(AliyunLearn_eas_qps_total). (Para sintaxe PromQL, consulte Metric data query and analysis syntax)

    2. Clique em Run Query para visualizar a tendência do QPS total de todos os serviços EAS na região atual.

Etapa 4: Usar painéis do Grafana

Visualizar o painel padrão do Grafana

O CloudMonitor 2.0 fornece um painel padrão do Grafana:

  1. No painel de navegação à esquerda da página de detalhes do service do Prometheus, clique em Dashboard List.

  2. Clique em no nome de um painel para visualizar o painel integrado do Grafana.

Nota

Você também pode acessar a aba Dashboard a partir da política de integração em Provisioning.

Adicionar um painel

Adicione um painel de QPS global ao painel padrão do Grafana. Para mais informações sobre o Grafana, consulte Managed Service for Grafana.

  1. Na página de detalhes do painel, clique em no botão Add panel no canto superior direito image e, em seguida, clique em Add a new panel na caixa de diálogo exibida.

  2. No lado direito da página Edit Panel, altere o tipo de gráfico para Stat.

  3. No canto inferior esquerdo da página, altere Data source para ${datasource}.

  4. Na área Query, mude para code no lado direito. Na caixa de texto Metrics browser, insira a consulta PromQL sum(AliyunLearn_eas_eas_qps_total) e clique em Run queries.

  5. Ajuste os limiares para configurar cores de exibição diferentes para faixas de valores distintas. Após a pré-visualização do gráfico aparecer, clique em Apply para salve as configurações.

Etapa 5: Configurar regras de alerta

Na página de detalhes da instância do Prometheus, visualize as regras de alerta integradas. Todas as regras de alerta integradas são de nível P2 e iniciam com o status Stopped.

  1. No painel de navegação à esquerda da página de detalhes do service do Prometheus, clique em Alert Rules.

  2. Na página Alert Rules, visualize as regras de alerta predefinidas. Para ative uma regra, modifique seu status Enabled/Disabled. Para alterar a configuração de notificação, clique em Edit.

Se os modelos padrão não atenderem às suas necessidades, clique em Create Alert Rule para crie uma regra de alerta personalizada. Para descrições dos parâmetros, consulte Alert rules.

Apêndice: Métricas avançadas de monitoramento do EAS

Nota

As métricas a seguir estão disponíveis apenas quando as métricas avançadas de monitoramento são ativadas na Etapa 1.

Métricas de instância de serviço

Métrica

Descrição

Tags de métrica (dimensão)

Categoria

Tipo

Unidade

Período de coleta (s)

instance_cpu_count

Número de CPUs da instância de serviço

instance,resource_type

CPU

Gauge

count

60

instance_gpu_count

Número de GPUs da instância de serviço

instance,resource_type

GPU

Gauge

count

60

instance_cpu_usage

Uso de CPU da instância de serviço

instance

CPU

Gauge

core

60

instance_user_cpu_usage

Uso de CPU por processos de usuário da instância de serviço

instance

CPU

Gauge

core

60

instance_system_cpu_usage

Uso de CPU por processos de sistema da instância de serviço

instance

CPU

Gauge

core

60

instance_cpu_util

Utilização de CPU da instância de serviço

instance

CPU

Gauge

%

60

instance_memory_rss_usage

Uso de memória da instância de serviço

instance

Memory

Gauge

byte

60

instance_memory_cache_usage

Uso de cache de memória da instância de serviço

instance

Memory

Gauge

byte

60

instance_memory_total

Memória total da instância de serviço

instance

Memory

Gauge

byte

60

instance_memory_util

Utilização de memória da instância de serviço

instance

Memory

Gauge

%

60

instance_response

Número de requisições para a instância de serviço

instance

Request

Counter

count

60

instance_gpu_util

Utilização de GPU da instância de serviço

instance

GPU

Gauge

%

60

instance_gpu_memory_usage

Uso de memória GPU da instância de serviço

instance

GPU

Gauge

MiB

60

instance_gpu_memory_total

Memória GPU total da instância de serviço

instance

GPU

Gauge

MiB

60

instance_gpu_memory_util

Utilização de memória GPU da instância de serviço

instance

GPU

Gauge

MiB

60

instance_gpu_memory_bandwidth_limit

Limite de largura de banda de memória GPU da instância de serviço

instance

GPU

Gauge

bytes/second

60

instance_gpu_temperature

Temperatura da GPU da instância de serviço

instance

GPU

Gauge

°C

60

instance_gpu_slow_temperature

Temperatura de throttling da GPU da instância de serviço

instance

GPU

Gauge

°C

60

instance_gpu_shut_temperature

Temperatura de desligamento da GPU da instância de serviço

instance

GPU

Gauge

°C

60

instance_gpu_nvswitch_error

Contagem de erros fatais do NVSwitch da instância de serviço

instance

GPU

Gauge

count

60s

instance_gpu_nvswitch_non_fatal_error

Contagem de erros não fatais do NVSwitch da instância de serviço

instance

GPU

Gauge

count

60

instance_gpu_ecc_total_vol_sbe

Total de erros ECC voláteis de bit único da instância de serviço

instance

GPU

Counter

count

60

instance_gpu_ecc_total_vol_dbe

Total de erros ECC voláteis de bit duplo da instância de serviço

instance

GPU

Counter

count

60

instance_gpu_ecc_total_agg_sbe

Total de erros ECC agregados (persistentes) de bit único da instância de serviço

instance

GPU

Counter

count

60

instance_gpu_ecc_total_agg_dbe

Total de erros ECC agregados (persistentes) de bit duplo da instância de serviço

instance

GPU

Counter

count

60

instance_gpu_remap_fail

Contagem de falhas de remapeamento de linhas da instância de serviço

instance

GPU

Gauge

count

60

instance_gpu_remap_pending

Contagem de remapeamentos de linhas pendentes da instância de serviço

instance

GPU

Gauge

count

60

instance_gpu_pcie_replay_counter

Contador de replay PCIe da instância de serviço

instance

GPU

Gauge

count

60

instance_gpu_pcie_transmit_measure_by_dcgm

Taxa de transmissão PCIe medida pelo DCGM da instância de serviço

instance

GPU

Gauge

bytes/second

60

instance_gpu_pcie_receive_measure_by_dcgm

Taxa de recepção PCIe medida pelo DCGM da instância de serviço

instance

GPU

Gauge

bytes/second

60

instance_gpu_graphics_engine_util

Utilização do mecanismo gráfico da instância de serviço

instance

GPU

Gauge

ratio (0~1)

60

instance_gpu_sm_util

Utilização do Streaming Multiprocessor (SM) da instância de serviço

instance

GPU

Gauge

ratio (0~1)

60

instance_gpu_dram_active

Proporção de tempo em que a interface de memória do dispositivo está enviando ou recebendo dados ativamente na instância de serviço

instance

GPU

Gauge

ratio (0~1)

60

instance_gpu_tensortflops_used

TFLOPS usados pelo pipeline Tensor da instância de serviço

instance

GPU

Gauge

count

60

instance_gpu_memory_bandwidth_used

Uso de largura de banda de memória da instância de serviço

instance

GPU

Gauge

bytes/second

60

instance_gpu_sm_clock

Frequência de clock do SM da instância de serviço

instance

GPU

Gauge

MHz

60

instance_gpu_sm_occupancy

Proporção de warps residentes no SM da instância de serviço

instance

GPU

Gauge

ratio (0~1)

60

instance_gpu_fp32tflops_used

TFLOPS usados pelo pipeline FP32 da instância de serviço

instance

GPU

Gauge

count

60

instance_gpu_fp16tflops_used

TFLOPS usados pelo pipeline FP16 da instância de serviço

instance

GPU

Gauge

count

60

instance_gpu_pipe_fp32_active

Proporção de ciclos ativos do pipeline FP32 da instância de serviço

instance

GPU

Gauge

ratio (0~1)

60

instance_gpu_pipe_fp16_active

Proporção de ciclos ativos do pipeline FP16 da instância de serviço

instance

GPU

Gauge

ratio (0~1)

60s

instance_gpu_pipe_tensor_active

Proporção de ciclos ativos do pipeline Tensor da instância de serviço

instance

GPU

Gauge

ratio (0~1)

60

instance_gpu_power_usage

Consumo de energia da GPU da instância de serviço

instance

GPU

Gauge

watts

60

instance_accelerator_power_usage

Consumo de energia do acelerador da instância de serviço

instance

GPU

Gauge

milliwatts

60

instance_gpu_mem_copy_util

Utilização de cópia de memória da instância de serviço

instance

GPU

Gauge

%

60

instance_gpu_health_count

Contagem total de status de saúde da GPU da instância de serviço

instance

GPU

Gauge

count

60

instance_gpu_lost_card_num

Número de GPUs perdidas na VM da instância de serviço

instance

GPU

Gauge

count

60

instance_gpu_driver_hang

Contagem de travamentos do driver da GPU da instância de serviço

instance

GPU

Gauge

count

60

instance_gpu_profile_status

Status de profiling Amperf da instância de serviço

instance

GPU

Gauge

count

60

instance_gpu_uncorrectable_ecc

Contagem de erros ECC incorrigíveis da instância de serviço

instance

GPU

Gauge

count

60

instance_gpu_xid_cnt

Contagem de erros Xid da instância de serviço

instance

GPU

Gauge

count

60

instance_gpu_fatal_xid_error

Contagem de erros fatais Xid da instância de serviço

instance

GPU

Gauge

count

60

instance_gpu_kernel_err_cnt

Contagem de erros não-Xid nos logs do kernel da instância de serviço

instance

GPU

Gauge

count

60

instance_qps

Requisições por segundo da instância de serviço

instance

Request

Gauge

count

60

instance_traffic

Tráfego da instância de serviço

instance

Request

Gauge

bps

60

instance_avg_latency

Tempo médio de resposta de requisição da instância de serviço

instance

Request

Gauge

ms

60

instance_tpxx_latency

Tempo de resposta TOPXX de requisição da instância de serviço

instance

Request

Gauge

ms

60

instance_traffic_in

Tráfego de entrada da instância de serviço

instance

Request

Gauge

bps

60

instance_traffic_out

Tráfego de saída da instância de serviço

instance

Request

Gauge

bps

60

instance_tcp_connections

Contagem de conexões TCP da instância de serviço

instance

Request

Gauge

count

60

Métricas de serviço

Métrica

Descrição

Tags de métrica (dimensão)

Categoria

Tipo

Unidade

Período de coleta (s)

service_replicas

Número de instâncias de serviço

service

Meta

Gauge

count

60

service_pending_replicas

Número de instâncias de serviço pendentes

service

Meta

Gauge

count

60

service_available_replicas

Número de instâncias de serviço em execução

service

Meta

Gauge

count

60

service_replicas_with_resource_type

Número de instâncias de serviço (com tag de tipo de recurso)

service

Meta

Gauge

count

60

service_cpu_count

Total de CPUs alocadas ao serviço

service

CPU

Gauge

core

60

service_cpu_count_with_resource_type

Total de CPUs do serviço (com tag de tipo de recurso)

service

CPU

Gauge

core

60

service_gpu_count_with_resource_type

Total de GPUs do serviço (com tag de tipo de recurso)

service

GPU

Gauge

count

60

service_rps_status_2xx

Número de respostas 2XX do serviço

service

Request

Gauge

count

60

service_rps_status_4xx

Número de respostas 4XX do serviço

service

Request

Gauge

count

60

service_rps_status_5xx

Número de respostas 5XX do serviço

service

Request

Gauge

count

60

service_rps_status_2xx_ratio

Proporção de respostas 2XX do serviço

service

Request

Gauge

%

60

service_rps_status_4xx_ratio

Proporção de respostas 4XX do serviço

service

Request

Gauge

%

60

service_rps_status_5xx_ratio

Proporção de respostas 5XX do serviço

service

Request

Gauge

%

60

service_qps

Requisições por segundo do serviço

service

Request

Gauge

count

60

service_avg_latency

Tempo médio de resposta de requisição do serviço

service

Request

Gauge

ms

60

service_tpxx_latency

Tempo de resposta TOPXX de requisição do serviço

service

Request

Gauge

ms

60

service_tp100_latency

Tempo de resposta TOP100 de requisição do serviço

service

Request

Gauge

ms

60

service_traffic_in

Tráfego de entrada do serviço

service

Network

Gauge

bps

60

service_traffic_out

Tráfego de saída do serviço

service

Network

Gauge

60

service_cpu_usage

Uso de CPU do serviço

service

CPU

Gauge

core

60

service_user_cpu_usage

Uso de CPU por processos de usuário do serviço

service

CPU

Gauge

core

60

service_system_cpu_usage

Uso de CPU por processos de sistema do serviço

service

CPU

Gauge

core

60

service_cpu_util

Utilização de CPU do serviço

service

CPU

Gauge

%

60

service_memory_rss_usage

Uso de memória do serviço

service

Memory

Gauge

byte

60

service_memory_cache_usage

Uso de cache de memória do serviço

service

Memory

Gauge

byte

60

service_memory_total

Memória total do serviço

service

Memory

Gauge

byte

60

service_memory_util

Utilização de memória do serviço

service

Memory

Gauge

%

60

service_gpu_util

Utilização de GPU do serviço

service

GPU

Gauge

%

60

service_gpu_memory_usage

Uso de memória GPU do serviço

service

GPU

Gauge

MiB

60

service_gpu_memory_total

Memória GPU total do serviço

service

GPU

Gauge

MiB

60

service_gpu_memory_util

Utilização de memória GPU do serviço

service

GPU

Gauge

MiB

60

service_gpu_memory_bandwidth_limit

Limite de largura de banda de memória GPU do serviço

service

GPU

Gauge

bytes/second

60

service_gpu_temperature

Temperatura da GPU do serviço

service

GPU

Gauge

°C

60

service_gpu_slow_temperature

Temperatura de throttling da GPU do serviço

service

GPU

Gauge

°C

60

service_gpu_shut_temperature

Temperatura de desligamento da GPU do serviço

service

GPU

Gauge

°C

60

service_gpu_nvswitch_error

Contagem de erros fatais do NVSwitch do serviço

service

GPU

Gauge

count

60

service_gpu_nvswitch_non_fatal_error

Contagem de erros não fatais do NVSwitch do serviço

service

GPU

Gauge

count

60

service_gpu_ecc_total_vol_sbe

Total de erros ECC voláteis de bit único do serviço

service

GPU

Counter

count

60

service_gpu_ecc_total_vol_dbe

Total de erros ECC voláteis de bit duplo do serviço

service

GPU

Counter

count

60

service_gpu_ecc_total_agg_sbe

Total de erros ECC agregados (persistentes) de bit único do serviço

service

GPU

Counter

count

60

service_gpu_ecc_total_agg_dbe

Total de erros ECC agregados (persistentes) de bit duplo do serviço

service

GPU

Counter

count

60

service_gpu_remap_fail

Contagem de falhas de remapeamento de linhas do serviço

service

GPU

Gauge

count

60

service_gpu_remap_pending

Contagem de remapeamentos de linhas pendentes do serviço

service

GPU

Gauge

count

60

service_gpu_pcie_replay_counter

Contador de replay PCIe do serviço

service

GPU

Gauge

count

60

service_gpu_pcie_transmit_measure_by_dcgm

Taxa de transmissão PCIe medida pelo DCGM do serviço

service

GPU

Gauge

bytes/second

60

service_gpu_pcie_receive_measure_by_dcgm

Taxa de recepção PCIe medida pelo DCGM do serviço

service

GPU

Gauge

bytes/second

60

service_gpu_graphics_engine_util

Utilização do mecanismo gráfico do serviço

service

GPU

Gauge

ratio (0~1)

60

service_gpu_sm_util

Utilização do Streaming Multiprocessor (SM) do serviço

service

GPU

Gauge

ratio (0~1)

60

service_gpu_dram_active

Proporção de tempo em que a interface de memória do dispositivo está enviando ou recebendo dados ativamente no serviço

service

GPU

Gauge

ratio (0~1)

60

service_gpu_tensortflops_used

TFLOPS usados pelo pipeline Tensor do serviço

service

GPU

Gauge

count

60

service_gpu_memory_bandwidth_used

Uso de largura de banda de memória do serviço

service

GPU

Gauge

bytes/second

60

service_gpu_sm_clock

Frequência de clock do SM do serviço

service

GPU

Gauge

MHz

60

service_gpu_sm_occupancy

Proporção de warps residentes no SM do serviço

service

GPU

Gauge

ratio (0~1)

60

service_gpu_fp32tflops_used

TFLOPS usados pelo pipeline FP32 do serviço

service

GPU

Gauge

count

60

service_gpu_fp16tflops_used

TFLOPS usados pelo pipeline FP16 do serviço

service

GPU

Gauge

count

60

service_gpu_pipe_fp32_active

Proporção de ciclos ativos do pipeline FP32 do serviço

service

GPU

Gauge

ratio (0~1)

60

service_gpu_pipe_fp16_active

Proporção de ciclos ativos do pipeline FP16 do serviço

service

GPU

Gauge

ratio (0~1)

60

service_gpu_pipe_tensor_active

Proporção de ciclos ativos do pipeline Tensor do serviço

service

GPU

Gauge

ratio (0~1)

60

service_gpu_power_usage

Consumo de energia da GPU do serviço

service

GPU

Gauge

watts

60

service_accelerator_power_usage

Consumo de energia do acelerador do serviço

service

GPU

Gauge

milliwatts

60

service_gpu_mem_copy_util

Utilização de cópia de memória do serviço

service

GPU

Gauge

%

60

service_gpu_health_count

Contagem total de status de saúde da GPU do serviço

service

GPU

Gauge

count

60

service_gpu_lost_card_num

Número de GPUs perdidas na VM do serviço

service

GPU

Gauge

count

60

service_gpu_driver_hang

Contagem de travamentos do driver da GPU do serviço

service

GPU

Gauge

count

60

service_gpu_profile_status

Status de profiling Amperf do serviço

service

GPU

Gauge

count

60

service_gpu_uncorrectable_ecc

Contagem de erros ECC incorrigíveis do serviço

service

GPU

Gauge

count

60

service_gpu_xid_cnt

Contagem de erros Xid do serviço

service

GPU

Gauge

count

60

service_gpu_fatal_xid_error

Contagem de erros fatais Xid do serviço

service

GPU

Gauge

count

60

service_gpu_kernel_err_cnt

Contagem de erros não-Xid nos logs do kernel do serviço

service

GPU

Gauge

count

60

service_tcp_connections

Contagem de conexões TCP do serviço

service

Network

Gauge

count

60

service_gateway_requests

llm-gateway: número atual de requisições recebidas pelo gateway

service

Request

Gauge

count

60

service_gateway_pending_requests

llm-gateway: número atual de requisições em buffer no gateway

service

Request

Gauge

count

60

service_llm_ttft_max

llm-gateway: tempo máximo para o primeiro token (TTFT) em requisições de streaming LLM

service

Request

Gauge

time

60

service_llm_ttft_min

llm-gateway: tempo mínimo para o primeiro token (TTFT) em requisições de streaming LLM

service

Request

Gauge

time

60

service_llm_ttft_mean

llm-gateway: tempo médio para o primeiro token (TTFT) em requisições de streaming LLM

service

Request

Gauge

time

60

service_llm_ttft_percent

llm-gateway: percentil do tempo para o primeiro token (TTFT) em requisições de streaming LLM

service

Request

Gauge

time

60

service_llm_tpot_max

llm-gateway: tempo máximo por token de saída (TPOT) em requisições de streaming LLM

service

Request

Gauge

time

60

service_llm_tpot_min

llm-gateway: tempo mínimo por token de saída (TPOT) em requisições de streaming LLM

service

Request

Gauge

time

60

service_llm_tpot_mean

llm-gateway: tempo médio por token de saída (TPOT) em requisições de streaming LLM

service

Request

Gauge

time

60

service_llm_tpot_percent

llm-gateway: percentil do tempo por token de saída (TPOT) em requisições de streaming LLM

service

Request

Gauge

time

60

service_endpoint_llm_waiting_requests

llm-gateway: número de requisições na fila do mecanismo de inferência LLM

service

Request

Gauge

count

60

service_endpoint_llm_running_requests

llm-gateway: número de requisições sendo processadas pelo mecanismo de inferência LLM

service

Request

Gauge

count

60

service_endpoint_llm_gpu_cache_usage

llm-gateway: utilização do KV-cache da GPU pelo mecanismo de inferência LLM

service

Request

Gauge

count

60

service_endpoint_llm_tps_in

llm-gateway: tokens de entrada por segundo do mecanismo LLM

service

Request

Gauge

count

60

service_endpoint_llm_tps_out

llm-gateway: tokens de saída por segundo do mecanismo LLM

service

Request

Gauge

count

60

Métricas de grupo de recursos

Métrica

Descrição

Tags de métrica (dimensão)

Categoria

Tipo

Unidade

Período de coleta (s)

resource_instance_cpu_util

Utilização de CPU da instância do grupo de recursos

instance_id

Resource Instance

Gauge

%

60

resource_instance_memory_total

Memória total da instância do grupo de recursos

instance_id

Resource Instance

Gauge

byte

60

resource_instance_memory_used

Uso de memória da instância do grupo de recursos

instance_id

Resource Instance

Gauge

byte

60

resource_instance_memory_util

Utilização de memória da instância do grupo de recursos

instance_id

Resource Instance

Gauge

%

60

resource_instance_memory_cache

Uso de cache de memória da instância do grupo de recursos

instance_id

Resource Instance

Gauge

byte

60

resource_instance_memory_free

Memória livre da instância do grupo de recursos

instance_id

Resource Instance

Gauge

byte

60

resource_instance_traffic_in

Tráfego de entrada da instância do grupo de recursos

instance_id

Resource Instance

Gauge

bytes/second

60

resource_instance_traffic_out

Tráfego de saída da instância do grupo de recursos

instance_id

Resource Instance

Gauge

bytes/second

60

resource_instance_disk_used

Uso de disco da instância do grupo de recursos

instance_id

Resource Instance

Gauge

byte

60

resource_instance_disk_total

Disco total da instância do grupo de recursos

instance_id

Resource Instance

Gauge

byte

60

resource_instance_disk_util

Utilização de disco da instância do grupo de recursos

instance_id

Resource Instance

Gauge

byte

60

resource_instance_tcp_established

Conexões TCP estabelecidas da instância do grupo de recursos

instance_id

Resource Instance

Gauge

count

60

resource_instance_tcp_time_wait

Conexões TCP em estado TIME_WAIT da instância do grupo de recursos

instance_id

Resource Instance

Gauge

count

60

resource_instance_gpu_util

Utilização de GPU da instância do grupo de recursos

instance_id

Resource Instance

Gauge

%

60

resource_instance_gpu_memory_usage

Uso de memória GPU da instância do grupo de recursos

instance_id

Resource Instance

Gauge

MiB

60

resource_instance_gpu_memory_total

Memória GPU total da instância do grupo de recursos

instance_id

Resource Instance

Gauge

MiB

60

resource_instance_gpu_memory_util

Utilização de memória GPU da instância do grupo de recursos

instance_id

Resource Instance

Gauge

%

60

resource_cpu_util

Utilização de CPU do grupo de recursos

resource

Resource

Gauge

%

60

resource_memory_total

Memória total do grupo de recursos

resource

Resource

Gauge

byte

60

resource_memory_used

Uso de memória do grupo de recursos

resource

Resource

Gauge

byte

60

resource_memory_util

Utilização de memória do grupo de recursos

resource

Resource

Gauge

%

60

resource_memory_cache

Uso de cache de memória do grupo de recursos

resource

Resource

Gauge

byte

60

resource_memory_free

Memória livre do grupo de recursos

resource

Resource

Gauge

byte

60

resource_traffic_in

Tráfego de entrada do grupo de recursos

resource

Resource

Gauge

bytes/second

60

resource_traffic_out

Tráfego de saída do grupo de recursos

resource

Resource

Gauge

bytes/second

60

resource_disk_used

Uso de disco do grupo de recursos

resource

Resource

Gauge

byte

60

resource_disk_total

Disco total do grupo de recursos

resource

Resource

Gauge

byte

60

resource_disk_util

Utilização de disco do grupo de recursos

resource

Resource

Gauge

byte

60

resource_tcp_established

Conexões TCP estabelecidas do grupo de recursos

resource

Resource

Gauge

count

60

resource_tcp_time_wait

Conexões TCP em estado TIME_WAIT do grupo de recursos

resource

Resource

Gauge

count

60

resource_gpu_util

Utilização de GPU do grupo de recursos

resource

Resource

Gauge

%

60

resource_gpu_memory_usage

Uso de memória GPU do grupo de recursos

resource

Resource

Gauge

MiB

60

resource_gpu_memory_total

Memória GPU total do grupo de recursos

resource

Resource

Gauge

MiB

60

resource_gpu_memory_util

Utilização de memória GPU do grupo de recursos

resource

Resource

Gauge

%

60