Após instale um agente do ARMS para Python em uma aplicação de Large Language Model (LLM), o Application Real-Time Monitoring Service (ARMS) coleta automaticamente dados de desempenho das operações no pipeline de LLM. A aba LLM operation fornece métricas de volume de invocações, latência e erros para quatro categorias de operações.
Use essas métricas para identificar gargalos de latência, acompanhar taxas de erro e localizar modelos ou funções específicos que degradam o desempenho.
|
Categoria de operação |
O que é monitorado |
Caso de uso típico |
|
Embedding |
Chamadas de conversão de texto para vetor |
Detectar modelos de embedding lentos ou com falhas em pipelines de busca por similaridade e classificação |
|
Search enhancement |
Estágios de recuperação e reranking em pipelines RAG |
Identificar qual estágio do RAG — recuperação ou reranking — introduz latência ou erros |
|
Tool call |
Chamadas a ferramentas externas e APIs feitas pelo LLM (mecanismos de busca, bancos de dados, calculadoras) |
Encontrar dependências externas não confiáveis que causam timeouts ou falhas |
|
Method calls |
Métodos personalizados internos e operações de tarefas na aplicação |
Localizar gargalos na lógica de negócio personalizada e no processamento interno |
Cada categoria oferece três níveis de métricas:
|
Nível |
O que é exibido |
Quando usar |
|
Métricas agregadas |
Totais e médias do intervalo de tempo selecionado |
Obter uma visão geral da integridade da categoria de operação |
|
Tendências por minuto |
Séries temporais minuto a minuto |
Correlacionar mudanças de desempenho com implantações ou picos de tráfego |
|
Rankings (Top 5) |
As 5 principais funções, modelos ou ferramentas por volume, latência ou erros |
Identificar qual componente específico requer otimização |
Pré-requisitos
Antes de começar, verifique se você tem:
Um agente do ARMS instalado para a aplicação de LLM. Para mais detalhes, consulte Monitorar aplicações de LLM no ARMS.
Acessar a aba de operações de LLM
Faça login no console do ARMS. No painel de navegação à esquerda, escolha LLM Application Monitoring > Application List.
Na página exibida, selecione uma região na barra de navegação superior e clique em na aplicação que deseja gerencie.
-
Na barra de navegação superior, selecione uma aba na lista suspensa de LLM operation.
Embedding
O Embedding converte textos, imagens ou outros tipos de dados em vetores de baixa dimensão que capturam o significado semântico. Esses vetores possibilitam cálculos de similaridade, recuperação e tarefas de classificação na aplicação de LLM.

Painel
Descrição
Number of Embedding
Total de invocações de embedding no intervalo de tempo selecionado.
Average Embedding Time
Latência média de todas as invocações de embedding no intervalo de tempo selecionado.
Number of Embedding errors
Total de invocações de embedding com falha no intervalo de tempo selecionado.
Number of Embedding/1m
Invocações de embedding por minuto.
Embedding Time/1m
Latência média de embedding por minuto.
Embedding error/1m
Invocações de embedding com falha por minuto.
Number of Embedding (Top5)
As 5 principais funções ou modelos de embedding por contagem de invocações, classificados do maior para o menor.
Embedding Time-consuming Ranking (Top5)
As 5 principais funções ou modelos de embedding por latência média, classificados do maior para o menor.
Embedding Error Ranking (Top5)
As 5 principais funções ou modelos de embedding por contagem de erros, classificados do maior para o menor.
Search enhancement
A Geração Aumentada por Recuperação (RAG) combina recuperação e reranking para melhorar a relevância e a precisão do conteúdo gerado pelo LLM. O painel de search enhancement monitora ambos os estágios separadamente, permitindo identificar se a recuperação ou o reranking é o gargalo.

Painel
Descrição
Métricas de recuperação
Number of calls
Total de invocações de recuperação no intervalo de tempo selecionado.
Average call time
Latência média de todas as operações de recuperação no intervalo de tempo selecionado.
Number of errors
Total de invocações de recuperação com falha no intervalo de tempo selecionado.
Number of calls/1m
Invocações de recuperação por minuto.
Call time/1m
Latência média de recuperação por minuto.
Number of errors/1m
Invocações de recuperação com falha por minuto.
Métricas de rerank
Number of calls
Total de invocações de rerank no intervalo de tempo selecionado.
Average call time
Latência média de todas as operações de rerank no intervalo de tempo selecionado.
Number of errors
Total de invocações de rerank com falha no intervalo de tempo selecionado.
Number of calls/1m
Invocações de rerank por minuto.
Call time/1m
Latência média de rerank por minuto.
Number of errors/1m
Invocações de rerank com falha por minuto.
Tool call
A invocação de ferramentas ocorre quando um LLM chama ferramentas externas ou API para execute tarefas como cálculos, consultas a bancos de dados, buscas na web ou traduções. Essas ferramentas podem incluir calculadoras, interfaces de consulta de banco de dados, mecanismos de busca e serviços de tradução, estendendo as capacidades do LLM para lidar com tarefas mais complexas ou específicas.

Painel
Descrição
Number of calls
Total de invocações de ferramentas no intervalo de tempo selecionado.
Average call time
Latência média de todas as invocações de ferramentas no intervalo de tempo selecionado.
Number of errors
Total de invocações de ferramentas com falha no intervalo de tempo selecionado.
Number of calls/10m
Invocações de ferramentas por minuto.
Call time/10m
Latência média de invocação de ferramentas por minuto.
Call Error/10m
Invocações de ferramentas com falha por minuto.
Call ranking (Top5)
As 5 principais ferramentas por contagem de invocações, classificadas do maior para o menor.
Call Time Row (Top5)
As 5 principais ferramentas por latência média, classificadas do maior para o menor.
Error ranking (Top5)
As 5 principais ferramentas por contagem de erros, classificadas do maior para o menor.
Method calls
As chamadas de método rastreiam métodos personalizados internos — invocações de métodos locais e operações de tarefas importantes executadas na aplicação. Essas métricas ajudam a identificar gargalos na lógica personalizada e a avaliar a eficiência do processamento interno.

Painel
Descrição
Number of calls
Total de invocações de tarefas no intervalo de tempo selecionado.
Average call time
Latência média de todas as invocações de tarefas no intervalo de tempo selecionado.
Number of model call errors
Total de invocações de tarefas com falha no intervalo de tempo selecionado.
Number of calls/10m
Invocações de tarefas por minuto.
Call time/10m
Latência média de invocação de tarefas por minuto.
Model Call Error/10m
Invocações de tarefas com falha por minuto.
Call ranking
As 5 principais tarefas por contagem de invocações, classificadas do maior para o menor.
Call Time Row (Top5)
As 5 principais tarefas por latência média, classificadas do maior para o menor.
Error ranking (Top5)
As 5 principais tarefas por contagem de erros, classificadas do maior para o menor.