Todos os produtos
Search
Central de documentação

Application Real-Time Monitoring Service:Métricas de LLM

Última atualização: Jun 27, 2026

Este tópico descreve as principais métricas de modelos de linguagem grande (LLM) para personalizar painéis do Grafana.

Rótulos comuns

Descrição da dimensão

Chave da dimensão

Exemplo

Nome do serviço

service

llm-rag-demo

PID do serviço

pid

ggxw4lnjuz@0cb8619bb54****

Endereço IP do servidor

serverIp

127.0.0.1

Interface

rpc

query

Source da aplicação

source

  • xtrace: indica que o Managed Service for OpenTelemetry monitora a aplicação.

  • apm: indica que o Application Real-Time Monitoring Service (ARMS) monitora a aplicação.

Métricas de requisição

Nota

Por definição, as métricas de requisição abrangem os protocolos e tipos de invocação compatíveis com a instrumentação, como serviços fornecidos e dependentes. Para obter mais informações, consulte Métricas do Application Monitoring.

Descrição da métrica

Nome da métrica

Medição

Intervalo de coleta (Unidade: segundos)

Unidade

Dimensão

Total de requisições

arms_$callType_requests_count

Gauge

15

Nenhuma

Diferentes dimensões se aplicam a diferentes tipos de acesso ao serviço. Para obter mais informações, consulte Métricas do Application Monitoring.

Número de requisições com erro

arms_$callType_requests_error_count

Gauge

15

Nenhuma

Duração total das requisições

arms_$callType_requests_seconds

Gauge

15

Segundos

Número de requisições lentas

arms_$callType_requests_slow_count

Gauge

15

Nenhuma

Métricas de LLM

Além dos rótulos comuns, também é possível usar os seguintes rótulos: modelName, spanKind, usageType.

Descrição da dimensão

Chave da dimensão

Exemplo

Observações

Nome do modelo

modelName

  • gpt-4

  • text-davinci-003

Nenhuma

Tipo de operação

spanKind

LLM, CHAIN ou EMBEDDING

Para obter mais informações, consulte Definições de campos de rastro de LLM.

Nenhuma

Tipo de uso

usageType

  • input

  • output

Disponível apenas para métricas relacionadas a tokens

Tipos de operação

Descrição da métrica

Nome da métrica

Medição

Intervalo de coleta (Unidade: minutos)

Unidade

Dimensão

Número de requisições de invocação de LLM

genai_calls_count

Gauge

1

Nenhuma

  • modelName

  • spanKind

Duração da resposta de invocação de LLM

genai_calls_duration_seconds

Gauge

1

Segundos

  • modelName

  • spanKind

Número de erros na invocação de LLM

genai_calls_error_count

Gauge

1

Nenhuma

  • modelName

  • spanKind

Número de invocações lentas de LLM

genai_calls_slow_count

Gauge

1

Nenhuma

  • modelName

  • spanKind

Desempenho do LLM

Descrição da métrica

Nome da métrica

Medição

Intervalo de coleta (Unidade: minutos)

Unidade

Dimensão

Tempo até o primeiro token (TTFT) de um LLM

genai_llm_first_token_seconds

Gauge

1

Segundos

  • modelName

  • spanKind

Uso do LLM

Descrição da métrica

Nome da métrica

Medição

Intervalo de coleta (Unidade: minutos)

Unidade

Dimensão

Contagem de tokens utilizados

genai_llm_usage_tokens

Gauge

1

Nenhuma

  • modelName

  • spanKind

  • usageType

    • input

    • output