Todos os produtos
Search
Central de documentação

Application Real-Time Monitoring Service:Análise de desempenho

Última atualização: Jun 27, 2026

Após a instalação do agente Python na sua aplicação de modelo de linguagem grande (LLM), o ARMS inicia o monitoramento. A página Performance Analysis exibe métricas essenciais, como invocações de modelo, tempo médio de invocação e erros de invocação.

Pré-requisitos

Instale um agente na sua aplicação LLM. Para mais informações, consulte Conectar aplicações LLM ou serviços de inferência ao ARMS.

Visualizar análise de desempenho

  1. Faça login no console do ARMS. No painel de navegação à esquerda, escolha LLM Application Monitoring > Application List.

  2. Na página Application List, selecione a região e clique em nome da sua aplicação.

  3. Na barra de navegação superior, clique em Performance Analysis.

    Painel

    Descrição

    Model invocations

    Total de invocações de modelo no período selecionado.

    Average model invocation time

    Tempo médio por invocação de modelo durante o período selecionado.

    Model invocation errors

    Total de invocações de modelo com falha no período selecionado.

    Model invocations/1m

    Quantidade de invocações de modelo por minuto.

    Average model invocation time/1m

    Tempo médio de invocação de modelo por minuto.

    Model invocation errors/1m

    Quantidade de invocações de modelo com falha por minuto.

    Model invocation time quantile (P99)/1m

    Quantil P99 do tempo de invocação de modelo por minuto. Indica que 99% das invocações foram mais rápidas que esse valor.

    Average time to first packet/1m

    Tempo médio para receber o primeiro pacote de dados de uma invocação de modelo, por minuto.

    Time to first packet quantile (P99)/1m

    Quantil P99 do tempo até o primeiro pacote (TTFP) das invocações de modelo por minuto.

    Top 5 models by invocation count

    Os 5 modelos com maior número de invocações, em ordem decrescente.

    Top 5 models by average invocation time

    Os 5 modelos com maior tempo médio de invocação, em ordem decrescente.

    Top 5 models by invocation errors

    Os 5 modelos com mais erros de invocação, em ordem decrescente.

Documentos relacionados