Todos os produtos
Search
Central de documentação

Application Real-Time Monitoring Service:Visão geral

Última atualização: Aug 18, 2026

Após a instalação do agente Python na sua aplicação de Large Language Model (LLM), o Application Real-Time Monitoring Service (ARMS) inicia o monitoramento. Na página Overview, visualize as principais métricas da aplicação LLM, como quantidade de chamadas ao modelo, uso de tokens, contagem de traces e sessões.

Pré-requisitos

Instale o agente na aplicação LLM. Para mais informações, consulte Connect an LLM application or inference service to ARMS.

Visão geral da aplicação LLM

  1. Faça login no console do ARMS. No painel de navegação à esquerda, escolha LLM Application Monitoring > Application list.

  2. Na página Application list, selecione uma região no topo da página e clique em nome da aplicação desejada.

  3. Na barra de navegação superior, clique em Overview.

Painel

image

Painel

Descrição

Number of model calls

Quantidade de chamadas da aplicação ao LLM no intervalo de tempo selecionado.

Token usage

Total de tokens consumidos pela aplicação no período escolhido.

Trace count

Número de traces gerados pela aplicação no intervalo de tempo definido.

Span count

Quantidade de spans produzidos pela aplicação no período analisado.

Session count

Sessões iniciadas pela aplicação no intervalo de tempo especificado.

Number of users

Total de usuários únicos que interagiram com a aplicação no período selecionado.

Operation type distribution
  • CHAIN: Ferramenta que conecta um LLM a outros componentes para executar tarefas complexas. Uma CHAIN pode incluir recuperações, embeddings, chamadas ao LLM e até mesmo outras CHAINs aninhadas.

  • EMBEDDING: Processo de embedding, como a conversão de texto em representação vetorial por meio de um modelo específico. Permite buscas por similaridade para encontrar contexto relevante.

  • RETRIEVER: Operação que acessa um armazenamento vetorial ou banco de dados para buscar informações. Geralmente usada para complementar o contexto fornecido ao LLM, melhorando a precisão e relevância das respostas.

  • RERANKER: Reordena um conjunto de documentos de entrada com base na relevância para uma consulta específica. Pode retornar os K documentos mais relevantes para uso como contexto pelo LLM.

  • LLM: Invocação de um Large Language Model. Por exemplo, chamar um LLM via SDK ou API para realizar inferência ou geração de texto.

  • TOOL: Chamada a uma ferramenta externa, como calculadora ou API de previsão do tempo, para obter dados específicos, como as condições climáticas atuais.

  • AGENT: Agente inteligente, consistindo em uma CHAIN complexa que utiliza o raciocínio do LLM para decidir a próxima ação. Pode envolver múltiplas chamadas a LLMs e TOOLs até alcançar progressivamente uma resposta final.

  • TASK: Método personalizado definido pelo usuário na aplicação. Exemplo: invocação de função local para aplicar lógica específica.

Avg LLM call per request

Média de chamadas ao LLM por requisição, calculada em intervalos de um minuto.

Request count trend

Acompanha o volume de requisições à aplicação LLM por minuto.

Model call ranking

Lista os 5 LLMs mais frequentemente chamados na aplicação.

User ranking by request count

Exibe os 5 usuários que realizaram mais requisições na aplicação.

Session count trend

Monitora a evolução do número de sessões da aplicação LLM por minuto.

Produtos suportados e configuração da taxa de amostragem

A entrada de monitoramento de LLM no console do ARMS foi renomeada para AI Agent Observability. Ao clicar nessa opção, você será redirecionado ao console do Cloud Monitor 2.0. Na Alibaba Cloud, a análise de traces de chamadas LLM conta com suporte do ARMS Application Monitoring e da observabilidade de aplicações de IA do CMS.

Para configurar a taxa de amostragem, faça login no console do ARMS. No painel de navegação à esquerda, escolha System Management > Application Configuration Template e modifique o parâmetro sampler.rate. O valor padrão é 100, indicando amostragem completa.

O agente Python oferece instrumentação automática para frameworks LLM como langchain, dify, dashscope, openai e llamaindex. Para detalhes sobre a sobrecarga de recursos do agente Python, consulte Performance test report of the ARMS agent for Python.

Documentos relacionados