Após instalar o agente Python na sua aplicação de modelo de linguagem grande (LLM), o ARMS inicia o monitoramento. Na página de análise de desempenho, visualize informações como número de chamadas ao modelo, tempo médio de chamada e quantidade de erros.
Pré-requisitos
Instale um agente para a aplicação LLM. Para mais informações, consulte Connect an LLM application or inference service to ARMS.
Análise de desempenho da aplicação LLM
Faça login no console do ARMS. No painel de navegação à esquerda, escolha .
Na página Application List, selecione uma região no topo da página e clique em nome da aplicação de destino.
-
Na barra de navegação superior, clique em Performance analysis.
Painel
Descrição
Number of model calls
Número de chamadas ao modelo de linguagem grande no período especificado.
Average model call time
Duração média das chamadas ao modelo de linguagem grande no período especificado.
Number of model call errors
Número de chamadas com falha ao modelo de linguagem grande no período especificado.
Number of model calls/min
Número de chamadas ao modelo de linguagem grande por minuto.
Average model call time/min
Duração média das chamadas ao modelo de linguagem grande por minuto.
Model call errors/min
Número de chamadas com falha ao modelo de linguagem grande por minuto.
Model latency P99/min
Latência P99 das chamadas ao modelo de linguagem grande por minuto. Indica que 99% das chamadas foram concluídas abaixo deste valor.
Average time to first packet/min
Tempo médio para receber o primeiro pacote de dados do modelo de linguagem grande por minuto.
P99 time to first packet/min
Tempo P99 para receber o primeiro pacote de dados do modelo de linguagem grande por minuto.
Top 5 models by calls
Os cinco modelos com mais chamadas, em ordem decrescente.
Top 5 models by average call time
Os cinco modelos com maior tempo médio de chamada, em ordem decrescente.
Top 5 models by call errors
Os cinco modelos com mais erros de chamada, em ordem decrescente.