O monitoramento de modelos permite:
Visualizar registros de chamadas.
Monitorar métricas e configurar alertas para tempo até o primeiro token, duração da chamada, requisições por minuto (RPM), tokens por minuto (TPM) e taxa de falhas.
Acompanhar o consumo de tokens.
Modelos compatíveis
Monitoramento básico: Compatível com todos os modelos da lista de modelos. Já o monitoramento avançado abrange todos os modelos nas regiões China (Pequim), Singapura e EUA (Virgínia).
Recurso de alertas: Disponível para todos os modelos nas regiões China (Pequim) e Singapura.
Monitore as execuções do modelo
O sistema coleta automaticamente dados de chamadas de modelos de todos os workspaces na sua conta Alibaba Cloud. Quando ocorre uma chamada de modelo direta ou indireta, esses dados são sincronizados na lista de Monitoring do workspace de destino.
Os registros da lista são gerados para cada modelo e workspace. Um novo modelo aparece na lista após a primeira sincronização de dados. O monitoramento básico apresenta latência de dados horária. Para obter insights de dados no nível de minutos, utilize o monitoramento avançado .
No topo da lista, um painel de visão geral resume as principais métricas em cartões, incluindo Total Models, Total Calls, Total Failures, Average call duration e Average time to first token.
A tabela Monitoring exibe o Model Code, Workspace, Total Calls, Total Failures, failure rate, Average call duration e Average time to first token de cada modelo. Todas as colunas, exceto Model Code e Workspace, permitem ordenação. A coluna Actions fornece acesso às páginas Monitor e Log.
Membros do workspace padrão podem visualizar chamadas de modelos em todos os workspaces. Membros de um sub-workspace têm acesso apenas aos dados do workspace atual e não podem alternar para outros workspaces.
Localize o modelo desejado na lista e clique em Monitor na coluna Actions para visualizar as seguintes 4 categorias de métricas:
Security: Identifica violações de políticas nas conversas, como
Content Moderation Error Count.Cost: Avalia a relação custo-benefício do modelo, com métricas como
Average Usage per Request.Performance: Observa alterações no desempenho do modelo, com métricas como
call durationetime to first token.Error: Avalia a estabilidade do modelo, com métricas como
Failuresefailure rate.
Crie alertas com base nessas métricas para detectar e resolver anomalias rapidamente.
Ao clicar em Monitor na coluna Actions, a página de detalhes do modelo é aberta, contendo as abas Monitoring e Log. A aba Monitoring divide-se em duas seções: call statistics e performance metrics.
Esta aba exibe métricas relacionadas a Security, Cost e Error, como contagem de chamadas e contagem de falhas. Filtre os dados por chave de API, tipo de inferência, intervalo de tempo e granularidade temporal (por minuto ou por hora).
Rate Limiting Error Count: Indica falhas de chamada causadas por um código de status 429.
Content Moderation Error Count: Indica que a entrada ou saída foi bloqueada pelo Content Moderation Service por conter conteúdo suspeito sensível ou de alto risco, como palavrões, conteúdo político ou propagandas.
No gráfico Failures, na aba de estatísticas de chamadas, clique em Failure details para visualizar um detalhamento das falhas e diagnosticar sua causa raiz.
Métricas de desempenho
Esta aba exibe métricas relacionadas ao Performance, como requisições por minuto (RPM), tokens por minuto (TPM), duração da chamada, tempo até o primeiro token e latência de tokens subsequentes.
Visualize o consumo de tokens
Ajustar parâmetros do modelo e prompts do sistema afeta o consumo de tokens. Para ajudar você a rastrear e gerenciar custos, o monitoramento de modelos oferece os seguintes recursos:
Resumo: Agrega o consumo histórico de tokens por workspace. Filtre ainda mais os dados por intervalo de tempo e chave de API.
Rastreamento: Registra o consumo de tokens para cada chamada de modelo.
Alertas: Defina limiares de consumo de tokens e envia um alerta quando o consumo de um modelo estiver anormal.
Visualize o consumo histórico de tokens do modelo
-
Para visualizar o consumo de tokens dos últimos 30 dias:
Na página Monitoring do workspace de destino, localize o modelo e clique em Monitor na coluna Actions.
Na aba Call Statistics, visualize os dados de consumo de tokens na seção Calls.
Para visualizar usos anteriores, acesse a página Expenses and Costs.
Visualize o consumo de tokens de uma chamada específica
Este recurso está disponível atualmente apenas para alguns modelos na região China (Beijing) .
-
Faça login na sua conta Alibaba Cloud (ou como um usuário RAM com permissões suficientes). No workspace de destino, acesse a página Monitoring (Beijing) e clique em Monitoring Configuration no canto superior direito. Siga as instruções para ativar o log de auditoria e o log de inferência.
Após a ativação, o sistema registra a entrada e a saída de cada chamada de modelo no workspace. Os logs podem levar vários minutos para aparecer após uma chamada.
Localize o modelo desejado na lista de monitoramento de modelos e clique em Logs na coluna Actions.
A aba Logs exibe os registros de chamadas de inferência em tempo real do modelo. O campo Usage mostra o consumo de tokens da chamada.
Crie um alerta para consumo anormal
Consulte Configurar alertas proativos.
Histórico de conversas (logs do modelo)
Este recurso está limitado atualmente a alguns modelos na região China (Beijing).
O monitoramento de modelos registra a entrada, a saída e a latência de cada chamada, fornecendo dados cruciais para solução de problemas e auditoria de conteúdo.
Etapa 1: Ativar logs
Faça login com uma conta Alibaba Cloud (ou um usuário RAM com permissões suficientes). Na página de monitoramento de modelos do workspace de destino, clique em Monitoring Configuration no canto superior direito e siga as instruções para ativar logs de auditoria e logs de inferência.
Após ativar este recurso, o sistema começa a registrar a entrada e a saída de cada chamada de modelo dentro do workspace. Os logs podem levar vários minutos para aparecer após uma chamada.
Para interromper o registro, basta desativar os logs de inferência na Monitoring Configuration.
Etapa 2: Visualizar o histórico de conversas
Na lista de monitoramento de modelos, localize o modelo desejado e clique em Logs na coluna Actions.
A aba Logs exibe os registros de chamadas de inferência em tempo real do modelo. Os campos Request and Response mostram a entrada e a saída de cada chamada.
Configure alertas proativos
O monitoramento de modelos está disponível nas regiões Singapura e China (Pequim), mas as regras de alerta só podem ser criadas atualmente na região China (Pequim).
Falhas silenciosas, como timeouts ou picos repentinos no consumo de tokens, costumam ser difíceis de detectar com logs tradicionais de aplicativos. O monitoramento de modelos permite configurar alertas para métricas essenciais como custo, taxa de falhas e latência de resposta. Quando uma métrica se torna anormal, o sistema envia imediatamente um alerta.
Etapa 1: Ativar o monitoramento avançado
Faça login com sua conta Alibaba Cloud (ou um usuário RAM com permissões suficientes). No workspace de destino, acesse a página Model Monitoring (Singapore ou China (Beijing)) e clique em Monitoring Configuration no canto superior direito.
Na seção de monitoramento avançado, ative o Performance and usage metrics monitoring.
Etapa 2: Criar uma regra de alerta
Na página Model Alerts (Singapore ou China (Beijing)), clique em Create Alert Rule no canto superior direito.
-
Na caixa de diálogo, selecione o modelo e o modelo de monitoramento e, após confirmar as configurações, clique em Create. Quando as métricas de monitoramento especificadas (como estatísticas de chamadas ou métricas de desempenho) se tornarem anormais, o sistema notificará sua equipe.
Métodos de notificação: SMS, e-mail, chamadas telefônicas, robô de grupo DingTalk, WeCom Robot e webhooks.
-
Nível de alerta: Existem quatro níveis de alerta predefinidos e não modificáveis: General, Warning, Error e Urgent. Cada nível utiliza canais de notificação específicos:
Urgent (CRITICAL): Chamada telefônica, SMS e e-mail
Error (ERROR): SMS e e-mail
Warning (WARNING): SMS e e-mail
General (INFO): E-mail
Integração com Grafana e aplicativos personalizados
As métricas de monitoramento de modelos são armazenadas na sua instância privada do Prometheus, que suporta a API HTTP padrão do Prometheus para conexão com o Grafana ou seu aplicativo personalizado, permitindo realizar análises visuais.
Etapa 1: Obter o endereço da API HTTP
Certifique-se de que o monitoramento avançado esteja ativado.
Na página Model Monitoring (Asia Pacific SE 1 (Singapore)), Model Monitoring (US East 1 (Virginia)) ou Model Monitoring (China (Beijing)), clique em Monitoring Configuration no canto superior direito. À direita da instância CloudMonitor Prometheus, clique em View Details.
-
Na página Settings, copie o endereço da API HTTP correspondente ao ambiente de rede do seu cliente (rede pública ou acesso VPC).

Etapa 2: Conectar ao Grafana ou a um aplicativo personalizado
Conectar a aplicativos personalizados
Os exemplos a seguir mostram como recuperar dados de métricas usando a API HTTP do Prometheus. Para detalhes completos de uso, consulte a documentação da API HTTP do Prometheus.
-
Exemplo 1: Consulte o consumo de tokens de todos os modelos em todos os workspaces de uma conta Alibaba Cloud em 20 de novembro de 2025 (UTC), usando a métrica
model_usagecom tamanho de passo de60s.Exemplo
Descrição
GET {HTTP API}/api/v1/query_range?query=model_usage&start=2025-11-20T00:00:00Z&end=2025-11-20T23:59:59Z&step=60s Accept: application/json Content-Type: application/json Authorization: Basic base64Encode(AccessKey:AccessKeySecret)-
query: Defina
querycomo qualquer métrica da tabela Metrics abaixo. -
API HTTP: Substitua
{HTTP API}pelo endereço da API HTTP obtido na Etapa 1. -
Autorização: Concatene o AccessKey e o AccessKey Secret da sua conta Alibaba Cloud no formato
AccessKey:AccessKeySecret, codifique a string resultante em Base64 e forneça-a no formatoBasic encoded_string.Valor de exemplo: Basic TFRBSTV3OWlid0U4XXXXU0xb1dZMFVodmRsNw==
Importante: O AccessKey e o AccessKey Secret devem pertencer à mesma conta Alibaba Cloud da instância Prometheus da Etapa 1.
-
-
Exemplo 2: Com base no Exemplo 1, este exemplo adiciona filtros para recuperar o consumo de tokens de um modelo específico (model=
qwen-plus) em um workspace específico (workspace_id=llm-nymssti2mzww****).Exemplo
Descrição
GET {HTTP API}/api/v1/query_range?query=model_usage{workspace_id="llm-nymssti2mzww****",model="qwen-plus"}&start=2025-11-20T00:00:00Z&end=2025-11-20T23:59:59Z&step=60s Accept: application/json Content-Type: application/json Authorization: Basic base64Encode(AccessKey:AccessKeySecret)-
query: Coloque várias condições de filtro entre chaves (
{}) e separe-as por vírgulas. Por exemplo:{workspace_id="value1",model="value2"}. A tabela a seguir lista as condições de filtro compatíveis (LabelKey).
-
Conectar ao Grafana
Adicione a fonte de dados de monitoramento de modelos ao seu ambiente Grafana (seja autogerenciado ou o serviço Alibaba Cloud Grafana). Este guia usa a versão em inglês do Grafana 10.x para demonstração; o procedimento é semelhante para outras versões. Para mais detalhes, consulte a documentação oficial do Grafana.
-
Adicionar a fonte de dados:
Faça login no Grafana com uma conta de administrador. No canto superior esquerdo da página, clique em
e selecione . Clique em + Add new data source e selecione Prometheus como o tipo de fonte de dados.-
Na aba Settings, configure a fonte de dados:
Name: Insira um nome personalizado.
Prometheus server URL: Cole o endereço da API HTTP obtido na Etapa 1.
-
Auth: Ative Basic auth. Em User, insira o AccessKey da sua conta Alibaba Cloud. Em Password, insira o AccessKey secret da sua conta Alibaba Cloud.
Certifique-se de que o AccessKey e o AccessKey secret pertençam à mesma conta Alibaba Cloud da instância Prometheus da Etapa 1.

Na parte inferior da aba, clique em Save & Test.
-
Consultar as métricas:
No canto superior esquerdo da página do Grafana, clique em
. No painel de navegação à esquerda, clique em Dashboards.Na página Dashboards, clique em no canto superior direito.
Clique em + Add visualization e selecione a fonte de dados que você acabou de criar.
-
Na página Edit Panel, clique na aba Query. Na seção A, selecione _name_ e o nome da métrica no campo Label filters. Por exemplo, para consultar o consumo de tokens do modelo, use a métrica
model_usage:Exemplo
Descrição

Neste exemplo, o valor para
_name_émodel_usage. Substitua-o por qualquer nome de métrica da lista de métricas de monitoramento abaixo.Use os seguintes rótulos para refinar ainda mais sua consulta:
-
Clique em Run queries.
Se dados aparecerem no gráfico, a configuração foi bem-sucedida. Caso contrário, verifique o seguinte: 1. Confirme se o endereço da API HTTP, o AccessKey e o AccessKey secret estão corretos. 2. Garanta que a instância Prometheus da Etapa 1 contenha dados de monitoramento.
Comparação dos modos de monitoramento
O monitoramento de modelos oferece dois modos: Basic Monitoring e Advanced Monitoring.
Basic Monitoring : Serviço básico ativado automaticamente ao habilitar o Model Studio, não podendo ser desativado.
Advanced Monitoring : Este serviço deve ser ativado manualmente por uma conta Alibaba Cloud ( ou um usuário RAM com permissões suficientes ) na página Model Monitoring (Asia Pacific SE 1 (Singapore)), Model Monitoring (US East 1 (Virginia)) ou Model Monitoring (China (Beijing)) do workspace de destino. Desative este serviço a qualquer momento. Ele registra dados de chamadas apenas após a ativação.
|
Item |
Basic Monitoring |
Advanced Monitoring |
|
|
Latência de dados |
Horária |
Nível de minutos |
|
|
Estatísticas de chamadas |
Compatível |
Compatível |
|
|
Detalhes de chamadas com falha |
Não compatível |
Compatível |
|
|
Métricas de desempenho |
Compatível |
Compatível |
|
|
Escopo aplicável |
Todos os workspaces sob a conta Alibaba Cloud |
Aplica-se apenas ao workspace onde está ativado |
|
|
Faturamento |
Gratuito |
Pago |
|
Cotas e limites
Período de retenção de dados: Os dados de monitoramento básico e avançado são retidos por 30 dias por padrão. Para consultar informações de uso de períodos anteriores, utilize a página Expenses and Costs.
Limite de modelos de alerta: Crie até 100 modelos de alerta para cada workspace.
-
Limite de API: Consulte métricas de monitoramento usando a API HTTP do Prometheus.
-
Alternativa: Obtenha o consumo de tokens de uma única chamada no campo
usageda resposta. Este campo possui a seguinte estrutura. Para mais informações, consulte a referência da API Qwen.{ "prompt_tokens": 3019, "completion_tokens": 104, "total_tokens": 3123, "prompt_tokens_details": { "cached_tokens": 2048 } }
-
Faturamento
Monitoramento básico: Gratuito.
Monitoramento avançado: Quando ativado, dados de monitoramento no nível de minutos são gravados no Cloud Monitor, gerando cobranças. Para detalhes de faturamento, consulte a visão geral de faturamento do Cloud Monitor.
Logs de inferência: Quando ativados, dados de log no nível de minutos são gravados no Log Service, gerando cobranças. Para detalhes de faturamento, consulte a visão geral de faturamento do Log Service.
Perguntas frequentes
Por que não consigo ver a contagem de chamadas e o consumo de tokens no Monitoramento de Modelos após chamar um modelo?
Para solucionar o problema, verifique o seguinte:
Latência de dados: Aguarde a sincronização dos dados. Os dados do monitoramento básico têm atraso de uma hora, enquanto os do monitoramento avançado atrasam alguns minutos.
Workspace: Se estiver em um sub-workspace, visualize apenas os dados desse workspace específico. Alterne para o workspace padrão para visualizar todos os dados.
O que pode causar timeouts ao chamar um modelo grande?
As causas comuns incluem:
Saída excessivamente longa: Se o modelo gerar um grande volume de conteúdo, o tempo de resposta poderá exceder a configuração de timeout do seu cliente. Recomendamos usar saída com streaming para receber o primeiro token mais rapidamente.
Problemas de rede: Garanta que seu cliente tenha uma conexão de rede estável com os serviços da Alibaba Cloud.
Como configuro permissões para um usuário RAM ativar o monitoramento avançado?
Procedimento:
Conceda a permissão de gerenciamento global do Model Studio
AliyunBailianFullAccessao usuário RAM.Conceda a permissão de página
Model Monitoring - Operations(ouAdministrator) ao usuário RAM. Isso concede acesso de gravação à página de Monitoramento de Modelos.Anexe a política de sistema AliyunCloudMonitorFullAccess ao usuário RAM.
-
Crie e anexe uma política personalizada que conceda permissão para criar uma função vinculada ao serviço para o usuário RAM.
Acesse o console RAM. No painel de navegação à esquerda, escolha e clique em Create Policy.
-
Clique na aba JSON. Cole o seguinte documento de política no editor e clique em OK.
{ "Version": "1", "Statement": [ { "Action": "ram:CreateServiceLinkedRole", "Resource": "*", "Effect": "Allow" } ] } Insira
CreateServiceLinkedRolecomo nome da política e clique em OK.No painel de navegação à esquerda, escolha . Localize o usuário RAM desejado na lista e clique em Add Permission na coluna Actions.
Na lista Policies, selecione a política
CreateServiceLinkedRolecriada e clique em Grant permissions. Agora o usuário RAM pode criar uma função vinculada ao serviço.
Após configurar as permissões necessárias, retorne à página Model Monitoring (Asia Pacific SE 1 (Singapore)), Model Monitoring (US (Virginia)) ou Model Monitoring (China (Beijing)) e tente ativar novamente o Advanced Monitoring como o usuário RAM.
Como configuro permissões para um usuário RAM ativar Logs de Inferência?
Procedimento:
Conceda a permissão de gerenciamento global do Model Studio
AliyunBailianFullAccessao usuário RAM.Conceda a permissão de página
Model Monitoring - Operations(ouAdministrator) ao usuário RAM. Isso concede acesso de gravação à página de Monitoramento de Modelos.Anexe a política de sistema AliyunLogFullAccess ao usuário RAM.
-
Crie e anexe uma política personalizada que conceda permissão para criar uma função vinculada ao serviço para o usuário RAM.
Acesse o console RAM. No painel de navegação à esquerda, escolha e clique em Create Policy.
-
Clique na aba JSON. Cole o seguinte documento de política no editor e clique em OK.
{ "Version": "1", "Statement": [ { "Action": "ram:CreateServiceLinkedRole", "Resource": "*", "Effect": "Allow" } ] } Insira
CreateServiceLinkedRolecomo nome da política e clique em OK.No painel de navegação à esquerda, escolha . Localize o usuário RAM desejado na lista e clique em Add Permission na coluna Actions.
Na lista Policies, selecione a política
CreateServiceLinkedRolecriada e clique em Grant permissions. Agora o usuário RAM pode criar uma função vinculada ao serviço.
Após configurar as permissões necessárias, retorne à página Model Monitoring (China (Beijing)) e tente ativar novamente os Inference Logs como o usuário RAM.
Apêndice
Glossário
|
Termo |
Descrição |
|
Real-time |
Refere-se a todas as chamadas diretas e indiretas feitas a um modelo, incluindo:
|
|
Batches |
Processamento de dados offline em larga escala usando a API Batch compatível com OpenAI (entrada de arquivo) para casos de uso que não exigem respostas em tempo real. |
