Todos os produtos
Search
Central de documentação

Alibaba Cloud Model Studio:Monitoramento de modelos

Última atualização: Jul 08, 2026

O monitoramento de modelos permite:

  • Visualizar registros de chamadas.

  • Monitorar métricas e configurar alertas para tempo até o primeiro token, duração da chamada, requisições por minuto (RPM), tokens por minuto (TPM) e taxa de falhas.

  • Acompanhar o consumo de tokens.

Modelos compatíveis

  • Monitoramento básico: Compatível com todos os modelos da lista de modelos. Já o monitoramento avançado abrange todos os modelos nas regiões China (Pequim), Singapura e EUA (Virgínia).

  • Recurso de alertas: Disponível para todos os modelos nas regiões China (Pequim) e Singapura.

Monitore as execuções do modelo

O sistema coleta automaticamente dados de chamadas de modelos de todos os workspaces na sua conta Alibaba Cloud. Quando ocorre uma chamada de modelo direta ou indireta, esses dados são sincronizados na lista de Monitoring do workspace de destino.

Os registros da lista são gerados para cada modelo e workspace. Um novo modelo aparece na lista após a primeira sincronização de dados. O monitoramento básico apresenta latência de dados horária. Para obter insights de dados no nível de minutos, utilize o monitoramento avançado .

No topo da lista, um painel de visão geral resume as principais métricas em cartões, incluindo Total Models, Total Calls, Total Failures, Average call duration e Average time to first token.

A tabela Monitoring exibe o Model Code, Workspace, Total Calls, Total Failures, failure rate, Average call duration e Average time to first token de cada modelo. Todas as colunas, exceto Model Code e Workspace, permitem ordenação. A coluna Actions fornece acesso às páginas Monitor e Log.

Membros do workspace padrão podem visualizar chamadas de modelos em todos os workspaces. Membros de um sub-workspace têm acesso apenas aos dados do workspace atual e não podem alternar para outros workspaces.

Localize o modelo desejado na lista e clique em Monitor na coluna Actions para visualizar as seguintes 4 categorias de métricas:

  • Security: Identifica violações de políticas nas conversas, como Content Moderation Error Count.

  • Cost: Avalia a relação custo-benefício do modelo, com métricas como Average Usage per Request.

  • Performance: Observa alterações no desempenho do modelo, com métricas como call duration e time to first token.

  • Error: Avalia a estabilidade do modelo, com métricas como Failures e failure rate.

Crie alertas com base nessas métricas para detectar e resolver anomalias rapidamente.

Ao clicar em Monitor na coluna Actions, a página de detalhes do modelo é aberta, contendo as abas Monitoring e Log. A aba Monitoring divide-se em duas seções: call statistics e performance metrics.

Esta aba exibe métricas relacionadas a Security, Cost e Error, como contagem de chamadas e contagem de falhas. Filtre os dados por chave de API, tipo de inferência, intervalo de tempo e granularidade temporal (por minuto ou por hora).

  • Rate Limiting Error Count: Indica falhas de chamada causadas por um código de status 429.

  • Content Moderation Error Count: Indica que a entrada ou saída foi bloqueada pelo Content Moderation Service por conter conteúdo suspeito sensível ou de alto risco, como palavrões, conteúdo político ou propagandas.

No gráfico Failures, na aba de estatísticas de chamadas, clique em Failure details para visualizar um detalhamento das falhas e diagnosticar sua causa raiz.

Métricas de desempenho

Esta aba exibe métricas relacionadas ao Performance, como requisições por minuto (RPM), tokens por minuto (TPM), duração da chamada, tempo até o primeiro token e latência de tokens subsequentes.

Visualize o consumo de tokens

Ajustar parâmetros do modelo e prompts do sistema afeta o consumo de tokens. Para ajudar você a rastrear e gerenciar custos, o monitoramento de modelos oferece os seguintes recursos:

  • Resumo: Agrega o consumo histórico de tokens por workspace. Filtre ainda mais os dados por intervalo de tempo e chave de API.

  • Rastreamento: Registra o consumo de tokens para cada chamada de modelo.

  • Alertas: Defina limiares de consumo de tokens e envia um alerta quando o consumo de um modelo estiver anormal.

Visualize o consumo histórico de tokens do modelo

  • Para visualizar o consumo de tokens dos últimos 30 dias:

    1. Na página Monitoring do workspace de destino, localize o modelo e clique em Monitor na coluna Actions.

    2. Na aba Call Statistics, visualize os dados de consumo de tokens na seção Calls.

  • Para visualizar usos anteriores, acesse a página Expenses and Costs.

Visualize o consumo de tokens de uma chamada específica

Este recurso está disponível atualmente apenas para alguns modelos na região China (Beijing) .
  1. Faça login na sua conta Alibaba Cloud (ou como um usuário RAM com permissões suficientes). No workspace de destino, acesse a página Monitoring (Beijing) e clique em Monitoring Configuration no canto superior direito. Siga as instruções para ativar o log de auditoria e o log de inferência.

    Após a ativação, o sistema registra a entrada e a saída de cada chamada de modelo no workspace. Os logs podem levar vários minutos para aparecer após uma chamada.
  2. Localize o modelo desejado na lista de monitoramento de modelos e clique em Logs na coluna Actions.

  3. A aba Logs exibe os registros de chamadas de inferência em tempo real do modelo. O campo Usage mostra o consumo de tokens da chamada.

Crie um alerta para consumo anormal

Histórico de conversas (logs do modelo)

Importante

Este recurso está limitado atualmente a alguns modelos na região China (Beijing).

O monitoramento de modelos registra a entrada, a saída e a latência de cada chamada, fornecendo dados cruciais para solução de problemas e auditoria de conteúdo.

Etapa 1: Ativar logs

Faça login com uma conta Alibaba Cloud (ou um usuário RAM com permissões suficientes). Na página de monitoramento de modelos do workspace de destino, clique em Monitoring Configuration no canto superior direito e siga as instruções para ativar logs de auditoria e logs de inferência.

Após ativar este recurso, o sistema começa a registrar a entrada e a saída de cada chamada de modelo dentro do workspace. Os logs podem levar vários minutos para aparecer após uma chamada.
Para interromper o registro, basta desativar os logs de inferência na Monitoring Configuration.

Etapa 2: Visualizar o histórico de conversas

  1. Na lista de monitoramento de modelos, localize o modelo desejado e clique em Logs na coluna Actions.

  2. A aba Logs exibe os registros de chamadas de inferência em tempo real do modelo. Os campos Request and Response mostram a entrada e a saída de cada chamada.

Modelos que suportam request e response

  • Qwen Max

    • qwen3-max, qwen3-max-preview, qwen3-max-2025-09-23 e versões snapshot posteriores

    • qwen-max

  • Qwen Plus

    • qwen3,7-plus, qwen3,7-plus-2026-05-26 e versões snapshot posteriores

    • qwen3,6-plus, qwen3,6-plus-2026-04-02 e versões snapshot posteriores

    • qwen3,5-plus, qwen3,5-plus-2026-02-15 e versões snapshot posteriores

    • qwen-plus, qwen-plus-latest, qwen-plus-2025-12-01 e versões snapshot posteriores

  • Qwen Flash

    • qwen3,5-flash, qwen3,5-flash-2026-02-23

    • qwen-flash, qwen-flash-2025-07-28

  • Qwen Turbo: qwen-turbo

  • Qwen Coder: qwen3-coder-flash, qwen3-coder-flash-2025-07-28, qwen3-coder-plus, qwen3-coder-plus-2025-07-22, qwen3-coder-plus-2025-09-23

  • Modelos open-source: qwen3-235b-a22b, qwen3-235b-a22b-instruct-2507, qwen3-235b-a22b-thinking-2507, qwen3-30b-a3b, qwen3-30b-a3b-instruct-2507, qwen3-30b-a3b-thinking-2507, qwen3-next-80b-a3b-instruct, qwen3-next-80b-a3b-thinking, qwen3-coder-480b-a35b-instruct

  • Modelos de terceiros: deepseek-v3.1, deepseek-v3.2, deepseek-v3.2-exp

Configure alertas proativos

Importante

O monitoramento de modelos está disponível nas regiões Singapura e China (Pequim), mas as regras de alerta só podem ser criadas atualmente na região China (Pequim).

Falhas silenciosas, como timeouts ou picos repentinos no consumo de tokens, costumam ser difíceis de detectar com logs tradicionais de aplicativos. O monitoramento de modelos permite configurar alertas para métricas essenciais como custo, taxa de falhas e latência de resposta. Quando uma métrica se torna anormal, o sistema envia imediatamente um alerta.

Etapa 1: Ativar o monitoramento avançado

  1. Faça login com sua conta Alibaba Cloud (ou um usuário RAM com permissões suficientes). No workspace de destino, acesse a página Model Monitoring (Singapore ou China (Beijing)) e clique em Monitoring Configuration no canto superior direito.

  2. Na seção de monitoramento avançado, ative o Performance and usage metrics monitoring.

Etapa 2: Criar uma regra de alerta

  1. Na página Model Alerts (Singapore ou China (Beijing)), clique em Create Alert Rule no canto superior direito.

  2. Na caixa de diálogo, selecione o modelo e o modelo de monitoramento e, após confirmar as configurações, clique em Create. Quando as métricas de monitoramento especificadas (como estatísticas de chamadas ou métricas de desempenho) se tornarem anormais, o sistema notificará sua equipe.

    • Métodos de notificação: SMS, e-mail, chamadas telefônicas, robô de grupo DingTalk, WeCom Robot e webhooks.

    • Nível de alerta: Existem quatro níveis de alerta predefinidos e não modificáveis: General, Warning, Error e Urgent. Cada nível utiliza canais de notificação específicos:

      • Urgent (CRITICAL): Chamada telefônica, SMS e e-mail

      • Error (ERROR): SMS e e-mail

      • Warning (WARNING): SMS e e-mail

      • General (INFO): E-mail

Integração com Grafana e aplicativos personalizados

As métricas de monitoramento de modelos são armazenadas na sua instância privada do Prometheus, que suporta a API HTTP padrão do Prometheus para conexão com o Grafana ou seu aplicativo personalizado, permitindo realizar análises visuais.

Etapa 1: Obter o endereço da API HTTP

  1. Certifique-se de que o monitoramento avançado esteja ativado.

  2. Na página Model Monitoring (Asia Pacific SE 1 (Singapore)), Model Monitoring (US East 1 (Virginia)) ou Model Monitoring (China (Beijing)), clique em Monitoring Configuration no canto superior direito. À direita da instância CloudMonitor Prometheus, clique em View Details.

  3. Na página Settings, copie o endereço da API HTTP correspondente ao ambiente de rede do seu cliente (rede pública ou acesso VPC).

    1

Etapa 2: Conectar ao Grafana ou a um aplicativo personalizado

Conectar a aplicativos personalizados

Os exemplos a seguir mostram como recuperar dados de métricas usando a API HTTP do Prometheus. Para detalhes completos de uso, consulte a documentação da API HTTP do Prometheus.

  • Exemplo 1: Consulte o consumo de tokens de todos os modelos em todos os workspaces de uma conta Alibaba Cloud em 20 de novembro de 2025 (UTC), usando a métrica model_usage com tamanho de passo de 60s.

    Exemplo

    Descrição

    GET {HTTP API}/api/v1/query_range?query=model_usage&start=2025-11-20T00:00:00Z&end=2025-11-20T23:59:59Z&step=60s
    
    Accept: application/json
    Content-Type: application/json
    Authorization: Basic base64Encode(AccessKey:AccessKeySecret)
    • query: Defina query como qualquer métrica da tabela Metrics abaixo.

      Métricas

      Tipo

      Nome da métrica

      Descrição

      Contagem de chamadas

      model_call_count

      Número total de chamadas de modelo.

      Duração da chamada

      model_call_duration_total

      Duração total das chamadas de modelo.

      model_call_duration

      Duração média das chamadas de modelo.

      model_call_duration_p50

      Duração p50 das chamadas de modelo.

      model_call_duration_p99

      Duração p99 das chamadas de modelo.

      model_first_token_duration_total

      Tempo total até o primeiro token.

      model_first_token_duration

      Tempo médio até o primeiro token.

      model_first_token_duration_p50

      Tempo p50 até o primeiro token.

      model_first_token_duration_p99

      Tempo p99 até o primeiro token.

      Tempo de geração por token

      model_generation_duration_per_token_total

      Tempo total de geração por token.

      model_generation_duration_per_token

      Tempo médio de geração por token.

      model_generation_duration_per_token_p50

      Tempo p50 de geração por token.

      model_generation_duration_per_token_p99

      Tempo p99 de geração por token.

      Uso

      model_usage

      Uso total do modelo.

    • API HTTP: Substitua {HTTP API} pelo endereço da API HTTP obtido na Etapa 1.

    • Autorização: Concatene o AccessKey e o AccessKey Secret da sua conta Alibaba Cloud no formato AccessKey:AccessKeySecret, codifique a string resultante em Base64 e forneça-a no formato Basic encoded_string.

      Valor de exemplo: Basic TFRBSTV3OWlid0U4XXXXU0xb1dZMFVodmRsNw==
      Importante: O AccessKey e o AccessKey Secret devem pertencer à mesma conta Alibaba Cloud da instância Prometheus da Etapa 1.
  • Exemplo 2: Com base no Exemplo 1, este exemplo adiciona filtros para recuperar o consumo de tokens de um modelo específico (model=qwen-plus) em um workspace específico (workspace_id=llm-nymssti2mzww****).

    Exemplo

    Descrição

    GET {HTTP API}/api/v1/query_range?query=model_usage{workspace_id="llm-nymssti2mzww****",model="qwen-plus"}&start=2025-11-20T00:00:00Z&end=2025-11-20T23:59:59Z&step=60s
    
    Accept: application/json
    Content-Type: application/json
    Authorization: Basic base64Encode(AccessKey:AccessKeySecret)
    • query: Coloque várias condições de filtro entre chaves ({}) e separe-as por vírgulas. Por exemplo: {workspace_id="value1",model="value2"}. A tabela a seguir lista as condições de filtro compatíveis (LabelKey).

      Condições de filtro compatíveis

      Chave do rótulo

      Descrição

      user_id

      O ID da conta Alibaba Cloud.

      Para um usuário RAM, este é o ID do usuário (UID). Como obter

      apikey_id

      O ID da chave de API, diferente da própria chave de API. Obtenha-o na página Key Management no console (Singapore| US (Virginia) | China (Beijing)).

      56

      Nota

      Um valor -1 para apikey_id indica que a chamada se originou do console Alibaba Cloud Model Studio, e não de uma chamada de API.

      workspace_id

      O ID do workspace. Como obter

      model

      O modelo.

      protocol

      O tipo de protocolo. Valores válidos:

      • HTTP: HTTP sem streaming

      • SSE: HTTP com streaming

      • WS: Protocolo WebSocket

      sub_protocol

      O subprotocolo. Valores válidos:

      status_code

      O código de status HTTP.

      Esta LabelKey aplica-se apenas à métrica model_call_count.

      error_code

      O código de erro.

      Esta LabelKey aplica-se apenas à métrica model_call_count.

      usage_type

      O tipo de uso.

      Esta LabelKey aplica-se apenas à métrica model_usage.

      Valores válidos:

      • total_tokens

      • input_tokens

      • output_tokens

      • cache_tokens

      • image_tokens

      • audio_tokens

      • video_tokens

      • image_count

      • audio_count

      • video_count

      • duration

      • characters

      • audio_tts

      • times

Conectar ao Grafana

Adicione a fonte de dados de monitoramento de modelos ao seu ambiente Grafana (seja autogerenciado ou o serviço Alibaba Cloud Grafana). Este guia usa a versão em inglês do Grafana 10.x para demonstração; o procedimento é semelhante para outras versões. Para mais detalhes, consulte a documentação oficial do Grafana.

  1. Adicionar a fonte de dados:

    1. Faça login no Grafana com uma conta de administrador. No canto superior esquerdo da página, clique em image e selecione Administration > Data sources. Clique em + Add new data source e selecione Prometheus como o tipo de fonte de dados.

    2. Na aba Settings, configure a fonte de dados:

      • Name: Insira um nome personalizado.

      • Prometheus server URL: Cole o endereço da API HTTP obtido na Etapa 1.

      • Auth: Ative Basic auth. Em User, insira o AccessKey da sua conta Alibaba Cloud. Em Password, insira o AccessKey secret da sua conta Alibaba Cloud.

        Certifique-se de que o AccessKey e o AccessKey secret pertençam à mesma conta Alibaba Cloud da instância Prometheus da Etapa 1.

      image

    3. Na parte inferior da aba, clique em Save & Test.

  2. Consultar as métricas:

    1. No canto superior esquerdo da página do Grafana, clique em image. No painel de navegação à esquerda, clique em Dashboards.

    2. Na página Dashboards, clique em New > New dashboard no canto superior direito.

    3. Clique em + Add visualization e selecione a fonte de dados que você acabou de criar.

    4. Na página Edit Panel, clique na aba Query. Na seção A, selecione _name_ e o nome da métrica no campo Label filters. Por exemplo, para consultar o consumo de tokens do modelo, use a métrica model_usage:

      Exemplo

      Descrição

      image

      Neste exemplo, o valor para _name_ é model_usage. Substitua-o por qualquer nome de métrica da lista de métricas de monitoramento abaixo.

      Métricas

      Tipo

      Nome da métrica

      Descrição

      Contagem de chamadas

      model_call_count

      Número total de chamadas de modelo.

      Duração da chamada

      model_call_duration_total

      Duração total das chamadas de modelo.

      model_call_duration

      Duração média das chamadas de modelo.

      model_call_duration_p50

      Duração p50 das chamadas de modelo.

      model_call_duration_p99

      Duração p99 das chamadas de modelo.

      model_first_token_duration_total

      Tempo total até o primeiro token.

      model_first_token_duration

      Tempo médio até o primeiro token.

      model_first_token_duration_p50

      Tempo p50 até o primeiro token.

      model_first_token_duration_p99

      Tempo p99 até o primeiro token.

      Tempo de geração por token

      model_generation_duration_per_token_total

      Tempo total de geração por token.

      model_generation_duration_per_token

      Tempo médio de geração por token.

      model_generation_duration_per_token_p50

      Tempo p50 de geração por token.

      model_generation_duration_per_token_p99

      Tempo p99 de geração por token.

      Uso

      model_usage

      Uso total do modelo.

      Use os seguintes rótulos para refinar ainda mais sua consulta:

      Condições de filtro compatíveis

      Chave do rótulo

      Descrição

      user_id

      O ID da conta Alibaba Cloud.

      Para um usuário RAM, este é o ID do usuário (UID). Como obter

      apikey_id

      O ID da chave de API, diferente da própria chave de API. Obtenha-o na página Key Management no console (Singapore| US (Virginia) | China (Beijing)).

      56

      Nota

      Um valor -1 para apikey_id indica que a chamada se originou do console Alibaba Cloud Model Studio, e não de uma chamada de API.

      workspace_id

      O ID do workspace. Como obter

      model

      O modelo.

      protocol

      O tipo de protocolo. Valores válidos:

      • HTTP: HTTP sem streaming

      • SSE: HTTP com streaming

      • WS: Protocolo WebSocket

      sub_protocol

      O subprotocolo. Valores válidos:

      status_code

      O código de status HTTP.

      Esta LabelKey aplica-se apenas à métrica model_call_count.

      error_code

      O código de erro.

      Esta LabelKey aplica-se apenas à métrica model_call_count.

      usage_type

      O tipo de uso.

      Esta LabelKey aplica-se apenas à métrica model_usage.

      Valores válidos:

      • total_tokens

      • input_tokens

      • output_tokens

      • cache_tokens

      • image_tokens

      • audio_tokens

      • video_tokens

      • image_count

      • audio_count

      • video_count

      • duration

      • characters

      • audio_tts

      • times

    5. Clique em Run queries.

      Se dados aparecerem no gráfico, a configuração foi bem-sucedida. Caso contrário, verifique o seguinte: 1. Confirme se o endereço da API HTTP, o AccessKey e o AccessKey secret estão corretos. 2. Garanta que a instância Prometheus da Etapa 1 contenha dados de monitoramento.

Comparação dos modos de monitoramento

O monitoramento de modelos oferece dois modos: Basic Monitoring e Advanced Monitoring.

Basic Monitoring : Serviço básico ativado automaticamente ao habilitar o Model Studio, não podendo ser desativado.
Advanced Monitoring : Este serviço deve ser ativado manualmente por uma conta Alibaba Cloud ( ou um usuário RAM com permissões suficientes ) na página Model Monitoring (Asia Pacific SE 1 (Singapore)), Model Monitoring (US East 1 (Virginia)) ou Model Monitoring (China (Beijing)) do workspace de destino. Desative este serviço a qualquer momento. Ele registra dados de chamadas apenas após a ativação.

Item

Basic Monitoring

Advanced Monitoring

Latência de dados

Horária

Nível de minutos

Estatísticas de chamadas

Compatível

Compatível

Detalhes de chamadas com falha

Não compatível

Compatível

Métricas de desempenho

Compatível

Compatível

Escopo aplicável

Todos os workspaces sob a conta Alibaba Cloud

Aplica-se apenas ao workspace onde está ativado

Faturamento

Gratuito

Pago

Cotas e limites

  • Período de retenção de dados: Os dados de monitoramento básico e avançado são retidos por 30 dias por padrão. Para consultar informações de uso de períodos anteriores, utilize a página Expenses and Costs.

  • Limite de modelos de alerta: Crie até 100 modelos de alerta para cada workspace.

  • Limite de API: Consulte métricas de monitoramento usando a API HTTP do Prometheus.

    • Alternativa: Obtenha o consumo de tokens de uma única chamada no campo usage da resposta. Este campo possui a seguinte estrutura. Para mais informações, consulte a referência da API Qwen.

      {
        "prompt_tokens": 3019,
        "completion_tokens": 104,
        "total_tokens": 3123,
        "prompt_tokens_details": {
          "cached_tokens": 2048
        }
      }

Faturamento

Perguntas frequentes

Por que não consigo ver a contagem de chamadas e o consumo de tokens no Monitoramento de Modelos após chamar um modelo?

Para solucionar o problema, verifique o seguinte:

  1. Latência de dados: Aguarde a sincronização dos dados. Os dados do monitoramento básico têm atraso de uma hora, enquanto os do monitoramento avançado atrasam alguns minutos.

  2. Workspace: Se estiver em um sub-workspace, visualize apenas os dados desse workspace específico. Alterne para o workspace padrão para visualizar todos os dados.

O que pode causar timeouts ao chamar um modelo grande?

As causas comuns incluem:

  • Saída excessivamente longa: Se o modelo gerar um grande volume de conteúdo, o tempo de resposta poderá exceder a configuração de timeout do seu cliente. Recomendamos usar saída com streaming para receber o primeiro token mais rapidamente.

  • Problemas de rede: Garanta que seu cliente tenha uma conexão de rede estável com os serviços da Alibaba Cloud.

Como configuro permissões para um usuário RAM ativar o monitoramento avançado?

Procedimento:

  1. Conceda a permissão de gerenciamento global do Model Studio AliyunBailianFullAccess ao usuário RAM.

  2. Conceda a permissão de página Model Monitoring - Operations (ou Administrator) ao usuário RAM. Isso concede acesso de gravação à página de Monitoramento de Modelos.

  3. Anexe a política de sistema AliyunCloudMonitorFullAccess ao usuário RAM.

  4. Crie e anexe uma política personalizada que conceda permissão para criar uma função vinculada ao serviço para o usuário RAM.

    1. Acesse o console RAM. No painel de navegação à esquerda, escolha Permissions > Policies e clique em Create Policy.

    2. Clique na aba JSON. Cole o seguinte documento de política no editor e clique em OK.

      {
          "Version": "1",
          "Statement": [
              {
                  "Action": "ram:CreateServiceLinkedRole",
                  "Resource": "*",
                  "Effect": "Allow"
              }
          ]
      }
    3. Insira CreateServiceLinkedRole como nome da política e clique em OK.

    4. No painel de navegação à esquerda, escolha Identities > Users. Localize o usuário RAM desejado na lista e clique em Add Permission na coluna Actions.

    5. Na lista Policies, selecione a política CreateServiceLinkedRole criada e clique em Grant permissions. Agora o usuário RAM pode criar uma função vinculada ao serviço.

  5. Após configurar as permissões necessárias, retorne à página Model Monitoring (Asia Pacific SE 1 (Singapore)), Model Monitoring (US (Virginia)) ou Model Monitoring (China (Beijing)) e tente ativar novamente o Advanced Monitoring como o usuário RAM.

Como configuro permissões para um usuário RAM ativar Logs de Inferência?

Procedimento:

  1. Conceda a permissão de gerenciamento global do Model Studio AliyunBailianFullAccess ao usuário RAM.

  2. Conceda a permissão de página Model Monitoring - Operations (ou Administrator) ao usuário RAM. Isso concede acesso de gravação à página de Monitoramento de Modelos.

  3. Anexe a política de sistema AliyunLogFullAccess ao usuário RAM.

  4. Crie e anexe uma política personalizada que conceda permissão para criar uma função vinculada ao serviço para o usuário RAM.

    1. Acesse o console RAM. No painel de navegação à esquerda, escolha Permissions > Policy e clique em Create Policy.

    2. Clique na aba JSON. Cole o seguinte documento de política no editor e clique em OK.

      {
          "Version": "1",
          "Statement": [
              {
                  "Action": "ram:CreateServiceLinkedRole",
                  "Resource": "*",
                  "Effect": "Allow"
              }
          ]
      }
    3. Insira CreateServiceLinkedRole como nome da política e clique em OK.

    4. No painel de navegação à esquerda, escolha Identities > Users. Localize o usuário RAM desejado na lista e clique em Add Permission na coluna Actions.

    5. Na lista Policies, selecione a política CreateServiceLinkedRole criada e clique em Grant permissions. Agora o usuário RAM pode criar uma função vinculada ao serviço.

  5. Após configurar as permissões necessárias, retorne à página Model Monitoring (China (Beijing)) e tente ativar novamente os Inference Logs como o usuário RAM.

Apêndice

Glossário

Termo

Descrição

Real-time

Refere-se a todas as chamadas diretas e indiretas feitas a um modelo, incluindo:

  • Chamadas de API feitas através do DashScope SDK ou interface compatível com OpenAI

  • Playground

  • Estados de teste e publicação de aplicativos do Model Studio (como agentes, workflows e aplicativos de orquestração de agentes) e seus nós de invocação de modelos (como nós LLM, nós de classificação de intenção e nós de grupo de agentes)

  • Chamadas para a Assistant API (Descontinuada)

  • Chamadas de aplicativos

Batches

Processamento de dados offline em larga escala usando a API Batch compatível com OpenAI (entrada de arquivo) para casos de uso que não exigem respostas em tempo real.