Após a instalação do agente Python na sua aplicação de modelo de linguagem grande (LLM), o ARMS inicia o monitoramento. A página Performance Analysis exibe métricas essenciais, como invocações de modelo, tempo médio de invocação e erros de invocação.
Pré-requisitos
Instale um agente na sua aplicação LLM. Para mais informações, consulte Conectar aplicações LLM ou serviços de inferência ao ARMS.
Visualizar análise de desempenho
Faça login no console do ARMS. No painel de navegação à esquerda, escolha .
Na página Application List, selecione a região e clique em nome da sua aplicação.
-
Na barra de navegação superior, clique em Performance Analysis.
Painel
Descrição
Model invocations
Total de invocações de modelo no período selecionado.
Average model invocation time
Tempo médio por invocação de modelo durante o período selecionado.
Model invocation errors
Total de invocações de modelo com falha no período selecionado.
Model invocations/1m
Quantidade de invocações de modelo por minuto.
Average model invocation time/1m
Tempo médio de invocação de modelo por minuto.
Model invocation errors/1m
Quantidade de invocações de modelo com falha por minuto.
Model invocation time quantile (P99)/1m
Quantil P99 do tempo de invocação de modelo por minuto. Indica que 99% das invocações foram mais rápidas que esse valor.
Average time to first packet/1m
Tempo médio para receber o primeiro pacote de dados de uma invocação de modelo, por minuto.
Time to first packet quantile (P99)/1m
Quantil P99 do tempo até o primeiro pacote (TTFP) das invocações de modelo por minuto.
Top 5 models by invocation count
Os 5 modelos com maior número de invocações, em ordem decrescente.
Top 5 models by average invocation time
Os 5 modelos com maior tempo médio de invocação, em ordem decrescente.
Top 5 models by invocation errors
Os 5 modelos com mais erros de invocação, em ordem decrescente.