Após a instalação do agente Python na sua aplicação de Large Language Model (LLM), o Application Real-Time Monitoring Service (ARMS) inicia o monitoramento. Na página Overview, visualize as principais métricas da aplicação LLM, como quantidade de chamadas ao modelo, uso de tokens, contagem de traces e sessões.
Pré-requisitos
Instale o agente na aplicação LLM. Para mais informações, consulte Connect an LLM application or inference service to ARMS.
Visão geral da aplicação LLM
Faça login no console do ARMS. No painel de navegação à esquerda, escolha .
Na página Application list, selecione uma região no topo da página e clique em nome da aplicação desejada.
Na barra de navegação superior, clique em Overview.
Painel

Painel | Descrição |
Number of model calls | Quantidade de chamadas da aplicação ao LLM no intervalo de tempo selecionado. |
Token usage | Total de tokens consumidos pela aplicação no período escolhido. |
Trace count | Número de traces gerados pela aplicação no intervalo de tempo definido. |
Span count | Quantidade de spans produzidos pela aplicação no período analisado. |
Session count | Sessões iniciadas pela aplicação no intervalo de tempo especificado. |
Number of users | Total de usuários únicos que interagiram com a aplicação no período selecionado. |
Operation type distribution |
|
Avg LLM call per request | Média de chamadas ao LLM por requisição, calculada em intervalos de um minuto. |
Request count trend | Acompanha o volume de requisições à aplicação LLM por minuto. |
Model call ranking | Lista os 5 LLMs mais frequentemente chamados na aplicação. |
User ranking by request count | Exibe os 5 usuários que realizaram mais requisições na aplicação. |
Session count trend | Monitora a evolução do número de sessões da aplicação LLM por minuto. |
Produtos suportados e configuração da taxa de amostragem
A entrada de monitoramento de LLM no console do ARMS foi renomeada para AI Agent Observability. Ao clicar nessa opção, você será redirecionado ao console do Cloud Monitor 2.0. Na Alibaba Cloud, a análise de traces de chamadas LLM conta com suporte do ARMS Application Monitoring e da observabilidade de aplicações de IA do CMS.
Para configurar a taxa de amostragem, faça login no console do ARMS. No painel de navegação à esquerda, escolha System Management > Application Configuration Template e modifique o parâmetro sampler.rate. O valor padrão é 100, indicando amostragem completa.
O agente Python oferece instrumentação automática para frameworks LLM como langchain, dify, dashscope, openai e llamaindex. Para detalhes sobre a sobrecarga de recursos do agente Python, consulte Performance test report of the ARMS agent for Python.