Após instale o agente Python na sua aplicação de Large Language Model (LLM), o ARMS inicia o monitoramento. Use a página de análise de tokens para entender o uso de tokens na sua aplicação LLM.
Em aplicações LLM, o token é a unidade básica de processamento de texto. Ele representa a menor unidade semântica da entrada e saída do modelo. Um token pode ser uma palavra, uma subpalavra ou um caractere, dependendo do tokenizer do modelo.
Pré-requisitos
O agente da sua aplicação LLM deve estar instalado. Para mais informações, consulte Connect an LLM application or inference service to ARMS.
Visualize análise de tokens
Faça login no console do ARMS. No painel de navegação à esquerda, escolha .
Na página Application List, selecione a região e clique em nome da sua aplicação.
-
Na barra de navegação superior, clique em token analysis.

Painel
Descrição
token usage
Quantidade total de tokens consumidos pelas invocações de LLM no intervalo de tempo selecionado.
average tokens per LLM call
Média de tokens consumidos por invocação de LLM.
average tokens per request
Média de tokens consumidos por solicitação de usuário.
tokens consumption per minute
Total de tokens consumidos pelas invocações de LLM por minuto.
average tokens per LLM call per minute
Média de tokens consumidos por invocação de LLM por minuto.
average tokens per request per minute
Média de tokens consumidos por solicitação de usuário por minuto.
token usage model ranking (Top 5)
Exibe os 5 modelos com maior consumo de tokens, classificados em ordem decrescente.
token usage session ranking (Top 5)
Exibe as 5 sessões com maior consumo de tokens, classificadas em ordem decrescente.
token usage user ranking (Top 5)
Exibe os 5 usuários com maior consumo de tokens, classificados em ordem decrescente.