Todos os produtos
Search
Central de documentação

Application Real-Time Monitoring Service:LLM operations

Última atualização: Jun 27, 2026

Após instale um agente do ARMS para Python em uma aplicação de Large Language Model (LLM), o Application Real-Time Monitoring Service (ARMS) coleta automaticamente dados de desempenho das operações no pipeline de LLM. A aba LLM operation fornece métricas de volume de invocações, latência e erros para quatro categorias de operações.

Use essas métricas para identificar gargalos de latência, acompanhar taxas de erro e localizar modelos ou funções específicos que degradam o desempenho.

Categoria de operação

O que é monitorado

Caso de uso típico

Embedding

Chamadas de conversão de texto para vetor

Detectar modelos de embedding lentos ou com falhas em pipelines de busca por similaridade e classificação

Search enhancement

Estágios de recuperação e reranking em pipelines RAG

Identificar qual estágio do RAG — recuperação ou reranking — introduz latência ou erros

Tool call

Chamadas a ferramentas externas e APIs feitas pelo LLM (mecanismos de busca, bancos de dados, calculadoras)

Encontrar dependências externas não confiáveis que causam timeouts ou falhas

Method calls

Métodos personalizados internos e operações de tarefas na aplicação

Localizar gargalos na lógica de negócio personalizada e no processamento interno

Cada categoria oferece três níveis de métricas:

Nível

O que é exibido

Quando usar

Métricas agregadas

Totais e médias do intervalo de tempo selecionado

Obter uma visão geral da integridade da categoria de operação

Tendências por minuto

Séries temporais minuto a minuto

Correlacionar mudanças de desempenho com implantações ou picos de tráfego

Rankings (Top 5)

As 5 principais funções, modelos ou ferramentas por volume, latência ou erros

Identificar qual componente específico requer otimização

Pré-requisitos

Antes de começar, verifique se você tem:

Acessar a aba de operações de LLM

  1. Faça login no console do ARMS. No painel de navegação à esquerda, escolha LLM Application Monitoring > Application List.

  2. Na página exibida, selecione uma região na barra de navegação superior e clique em na aplicação que deseja gerencie.

  3. Na barra de navegação superior, selecione uma aba na lista suspensa de LLM operation.

    Embedding

    O Embedding converte textos, imagens ou outros tipos de dados em vetores de baixa dimensão que capturam o significado semântico. Esses vetores possibilitam cálculos de similaridade, recuperação e tarefas de classificação na aplicação de LLM.

    image

    Painel

    Descrição

    Number of Embedding

    Total de invocações de embedding no intervalo de tempo selecionado.

    Average Embedding Time

    Latência média de todas as invocações de embedding no intervalo de tempo selecionado.

    Number of Embedding errors

    Total de invocações de embedding com falha no intervalo de tempo selecionado.

    Number of Embedding/1m

    Invocações de embedding por minuto.

    Embedding Time/1m

    Latência média de embedding por minuto.

    Embedding error/1m

    Invocações de embedding com falha por minuto.

    Number of Embedding (Top5)

    As 5 principais funções ou modelos de embedding por contagem de invocações, classificados do maior para o menor.

    Embedding Time-consuming Ranking (Top5)

    As 5 principais funções ou modelos de embedding por latência média, classificados do maior para o menor.

    Embedding Error Ranking (Top5)

    As 5 principais funções ou modelos de embedding por contagem de erros, classificados do maior para o menor.

    Search enhancement

    A Geração Aumentada por Recuperação (RAG) combina recuperação e reranking para melhorar a relevância e a precisão do conteúdo gerado pelo LLM. O painel de search enhancement monitora ambos os estágios separadamente, permitindo identificar se a recuperação ou o reranking é o gargalo.

    image

    Painel

    Descrição

    Métricas de recuperação

    Number of calls

    Total de invocações de recuperação no intervalo de tempo selecionado.

    Average call time

    Latência média de todas as operações de recuperação no intervalo de tempo selecionado.

    Number of errors

    Total de invocações de recuperação com falha no intervalo de tempo selecionado.

    Number of calls/1m

    Invocações de recuperação por minuto.

    Call time/1m

    Latência média de recuperação por minuto.

    Number of errors/1m

    Invocações de recuperação com falha por minuto.

    Métricas de rerank

    Number of calls

    Total de invocações de rerank no intervalo de tempo selecionado.

    Average call time

    Latência média de todas as operações de rerank no intervalo de tempo selecionado.

    Number of errors

    Total de invocações de rerank com falha no intervalo de tempo selecionado.

    Number of calls/1m

    Invocações de rerank por minuto.

    Call time/1m

    Latência média de rerank por minuto.

    Number of errors/1m

    Invocações de rerank com falha por minuto.

    Tool call

    A invocação de ferramentas ocorre quando um LLM chama ferramentas externas ou API para execute tarefas como cálculos, consultas a bancos de dados, buscas na web ou traduções. Essas ferramentas podem incluir calculadoras, interfaces de consulta de banco de dados, mecanismos de busca e serviços de tradução, estendendo as capacidades do LLM para lidar com tarefas mais complexas ou específicas.

    image

    Painel

    Descrição

    Number of calls

    Total de invocações de ferramentas no intervalo de tempo selecionado.

    Average call time

    Latência média de todas as invocações de ferramentas no intervalo de tempo selecionado.

    Number of errors

    Total de invocações de ferramentas com falha no intervalo de tempo selecionado.

    Number of calls/10m

    Invocações de ferramentas por minuto.

    Call time/10m

    Latência média de invocação de ferramentas por minuto.

    Call Error/10m

    Invocações de ferramentas com falha por minuto.

    Call ranking (Top5)

    As 5 principais ferramentas por contagem de invocações, classificadas do maior para o menor.

    Call Time Row (Top5)

    As 5 principais ferramentas por latência média, classificadas do maior para o menor.

    Error ranking (Top5)

    As 5 principais ferramentas por contagem de erros, classificadas do maior para o menor.

    Method calls

    As chamadas de método rastreiam métodos personalizados internos — invocações de métodos locais e operações de tarefas importantes executadas na aplicação. Essas métricas ajudam a identificar gargalos na lógica personalizada e a avaliar a eficiência do processamento interno.

    image

    Painel

    Descrição

    Number of calls

    Total de invocações de tarefas no intervalo de tempo selecionado.

    Average call time

    Latência média de todas as invocações de tarefas no intervalo de tempo selecionado.

    Number of model call errors

    Total de invocações de tarefas com falha no intervalo de tempo selecionado.

    Number of calls/10m

    Invocações de tarefas por minuto.

    Call time/10m

    Latência média de invocação de tarefas por minuto.

    Model Call Error/10m

    Invocações de tarefas com falha por minuto.

    Call ranking

    As 5 principais tarefas por contagem de invocações, classificadas do maior para o menor.

    Call Time Row (Top5)

    As 5 principais tarefas por latência média, classificadas do maior para o menor.

    Error ranking (Top5)

    As 5 principais tarefas por contagem de erros, classificadas do maior para o menor.

Referências