Após instalar o agente Python na sua aplicação de Large Language Model (LLM), o Application Real-Time Monitoring Service (ARMS) inicia o monitoramento. Visualize o uso de tokens na página Token analysis.
Em aplicações LLM, o token é a unidade básica de processamento de texto e representa a menor unidade semântica de entrada e saída do modelo. Um token pode ser uma palavra, uma subpalavra ou um caractere, dependendo do tokenizer do modelo.
Pré-requisitos
Instale um agente para a aplicação LLM. Para mais informações, consulte Integrar aplicações LLM ou serviços de inferência ao ARMS.
Visualizar análise de tokens
Faça login no console do ARMS e, no painel de navegação à esquerda, selecione .
Na página Application List, selecione uma região na barra de navegação superior e clique em nome da aplicação desejada.
-
Na barra de navegação superior, clique em Token analysis.

Painel
Descrição
Token usage
Quantidade total de tokens consumidos por todas as chamadas LLM no intervalo de tempo especificado.
Avg tokens per LLM call
Média de tokens consumidos por chamada LLM.
Avg tokens per request
Média de tokens consumidos por solicitação de usuário.
Token usage/1m
Total de tokens consumidos por todas as chamadas LLM por minuto.
Avg tokens per LLM call/1m
Média de tokens consumidos por chamada LLM por minuto.
Avg tokens per request/1m
Média de tokens consumidos por solicitação de usuário por minuto.
Token Usage Model Ranking (Top5)
Os 5 modelos com maior uso de tokens, classificados em ordem decrescente.
Token Usage Session Ranking (Top5)
As 5 sessões com maior uso de tokens, classificadas em ordem decrescente.
Token Usage User Ranking (Top5)
Os 5 usuários com maior uso de tokens, classificados em ordem decrescente.