Todos os produtos
Search
Central de documentação

Platform For AI:Monitoramento e alertas de treinamento

Última atualização: Jun 27, 2026

O DLC permite monitorar o uso de recursos dos seus jobs por meio de métricas detalhadas. O recurso de alertas possibilita acompanhar o consumo de recursos dos jobs do DLC em tempo real, além de configurar regras de alerta e notificações. Quando uma métrica, como GPU utilization, ultrapassa um limiar definido, o serviço envia uma notificação de alerta. Este tópico descreve como usar o CloudMonitor e o ARMS para visualizar dados de monitoramento, configurar regras de alerta e notificações e assinar métricas.

Pré-requisitos

Para configurar monitoramento e alarmes para jobs de treinamento do DLC, crie um ou mais jobs de treinamento do DLC. Para mais informações, consulte Create a training job.

Limitações

O monitoramento não está disponível para jobs de treinamento com pagamento conforme o uso que utilizam recursos de computação de uso geral.

Contas e permissões

  • Conta Alibaba Cloud: Permite executar todas as operações sem autorização adicional.

  • Usuário RAM:

    • Para visualizar dados de monitoramento de um job do DLC em um workspace, o usuário RAM precisa das seguintes permissões:

      • Adicione o usuário RAM como membro do workspace e atribua a função Administrator, Algorithm Developer ou Algorithm O&M Engineer. Para mais informações, consulte Manage workspace members.

      • Conceda ao usuário RAM acesso somente leitura ao CloudMonitor (AliyunCloudMonitorReadOnlyAccess). Para mais informações, consulte Manage RAM user permissions.

    • Para visualizar dados de monitoramento de um job do DLC em um workspace e configurar alertas de monitoramento, o usuário RAM precisa das seguintes permissões:

      • Adicione o usuário RAM como membro do workspace e atribua a função Administrator, Algorithm Developer ou Algorithm O&M Engineer. Para mais informações, consulte Manage workspace members.

      • Conceda ao usuário RAM acesso administrativo ao CloudMonitor (AliyunCloudMonitorFullAccess). Para mais informações, consulte Manage RAM user permissions.

Métricas de monitoramento

As métricas de monitoramento incluem GPU, CPU, memória, disco, rede, RDMA e CPFS. As dimensões compatíveis são job, pod (worker) e placa GPU individual. As tabelas a seguir listam métricas típicas de integridade. Para obter uma lista completa de métricas e suas descrições detalhadas, consulte Metrics for Deep Learning Containers (DLC).

Job

Métrica

Descrição

Utilização de CPU (dimensão job)

Percentual do total de recursos de CPU utilizados pelo job.

Utilização de memória (dimensão job)

Percentual do total de recursos de memória utilizados pelo job.

Taxa de leitura de disco (dimensão job)

Taxa de leitura de dados do disco para o job, em MiB/s.

Taxa de gravação em disco (dimensão job)

Taxa de gravação de dados no disco para o job, em MiB/s.

Taxa de recebimento de dados de rede (dimensão job)

Taxa de recebimento de dados pelo job, em MiB/s.

Taxa de envio de dados de rede (dimensão job)

Taxa de envio de dados pelo job, em MiB/s.

Utilização de computação da GPU (dimensão job)

Percentual do total de recursos de computação da GPU utilizados pelo job.

Utilização de memória da GPU (dimensão job)

Percentual do total de memória da GPU utilizado pelo job.

Utilização de SM da GPU (dimensão job)

Percentual do total de recursos de Streaming Multiprocessor (SM) da GPU utilizados pelo job.

Consumo de energia da GPU (dimensão job)

Consumo de energia da GPU do job, em watts.

Temperatura da GPU (dimensão job)

Temperatura da GPU do job, em graus Celsius.

Integridade geral da GPU (dimensão job)

Integridade geral das GPUs no job. Um valor de 100% indica que todas as GPUs estão íntegras. Um valor inferior a 100% indica que uma ou mais GPUs apresentam anomalias.

Taxa de recebimento de dados RDMA (dimensão job)

Taxa de recebimento de dados RDMA para o job, em MiB/s.

Taxa de envio de dados RDMA (dimensão job)

Taxa de envio de dados RDMA para o job, em MiB/s.

Taxa de gravação de dados CPFS (dimensão job)

Taxa de gravação de dados no CPFS para o job, em MiB/s.

Taxa de leitura de dados CPFS (dimensão job)

Taxa de leitura de dados do CPFS para o job, em MiB/s.

Volume de dados recebidos via NVLink (dimensão job)

Volume de dados recebidos via NVLink pelas GPUs no job.

Volume de dados enviados via NVLink (dimensão job)

Volume de dados enviados via NVLink pelas GPUs no job.

Volume de dados recebidos via PCIe (dimensão job)

Volume de dados recebidos via PCIe pelas GPUs no job.

Volume de dados enviados via PCIe (dimensão job)

Volume de dados enviados via PCIe pelas GPUs no job.

Para mais métricas, consulte Metrics for Deep Learning Containers (DLC).

Pod (worker)

Métrica

Descrição

Utilização de CPU (dimensão pod)

Percentual do total de recursos de CPU utilizados pelo pod.

Utilização de memória (dimensão pod)

Percentual do total de recursos de memória utilizados pelo pod.

Taxa de leitura de disco (dimensão pod)

Taxa de leitura de dados do disco para o pod, em MiB/s.

Taxa de gravação em disco (dimensão pod)

Taxa de gravação de dados no disco para o pod, em MiB/s.

Taxa de recebimento de dados de rede (dimensão pod)

Taxa de recebimento de dados pelo pod, em MiB/s.

Taxa de envio de dados de rede (dimensão pod)

Taxa de envio de dados pelo pod, em MiB/s.

Utilização de computação da GPU (dimensão pod)

Percentual do total de recursos de computação da GPU utilizados pelo pod.

Utilização de memória da GPU (dimensão pod)

Percentual do total de memória da GPU utilizado pelo pod.

Utilização de SM da GPU (dimensão pod)

Percentual do total de recursos de Streaming Multiprocessor (SM) da GPU utilizados pelo pod.

Consumo de energia da GPU (dimensão pod)

Consumo de energia da GPU do pod, em watts.

Temperatura da GPU (dimensão pod)

Temperatura da GPU do pod, em graus Celsius.

Integridade geral da GPU (dimensão pod)

Integridade geral das GPUs no pod. Um valor de 100% indica que todas as GPUs estão íntegras. Um valor inferior a 100% indica que uma ou mais GPUs apresentam anomalias.

Taxa de recebimento de dados RDMA (dimensão pod)

Taxa de recebimento de dados RDMA para o pod, em MiB/s.

Taxa de envio de dados RDMA (dimensão pod)

Taxa de envio de dados RDMA para o pod, em MiB/s.

Taxa de leitura de dados CPFS (dimensão pod)

Taxa de leitura de dados do CPFS para o pod, em MiB/s.

Taxa de gravação de dados CPFS (dimensão pod)

Taxa de gravação de dados no CPFS para o pod, em MiB/s.

Volume de dados recebidos via NVLink (dimensão pod)

Volume de dados recebidos via NVLink pelas GPUs no pod.

Volume de dados enviados via NVLink (dimensão pod)

Volume de dados enviados via NVLink pelas GPUs no pod.

Volume de dados recebidos via PCIe (dimensão pod)

Volume de dados recebidos via PCIe pelas GPUs no pod.

Volume de dados enviados via PCIe (dimensão pod)

Volume de dados enviados via PCIe pelas GPUs no pod.

Para mais métricas, consulte Metrics for Deep Learning Containers (DLC).

GPU card

Métrica

Descrição

Utilização da interface de memória da GPU (dimensão placa)

Percentual da capacidade da interface de memória da GPU utilizada em uma placa GPU individual.

Utilização de SM da GPU (dimensão placa)

Percentual da capacidade de SM da GPU utilizada em uma placa GPU individual.

Consumo de energia da GPU (dimensão placa)

Consumo de energia de uma placa GPU individual, em watts.

Temperatura da GPU (dimensão placa)

Temperatura de uma placa GPU individual, em graus Celsius.

Integridade geral da GPU (dimensão placa)

Integridade geral de uma placa GPU individual. Um valor de 100% indica que a placa está íntegra. Um valor inferior a 100% indica que a placa apresenta anomalias.

Para mais métricas, consulte Metrics for Deep Learning Containers (DLC).

Gráficos de monitoramento

  1. Na página de detalhes do job do DLC, alterne para a aba Monitoring para visualizar os dados de monitoramento do job. Nota: Os dados de monitoramento do job são retidos por até 30 dias.

    A aba Monitoring possui três subabas: job dimension, instance dimension e GPU dimension. Essas subabas exibem métricas para GPU, CPU, memória, rede, disco e OSS.

  2. Monitore métricas por Job Level, Instance Dimension e GPU Level, abrangendo GPU, CPU, memória, rede, disco e OSS.

  3. Clique em More para selecionar as métricas a serem exibidas. Em seguida, arraste as métricas para reordená-las e priorizar dados importantes para comparação.

    A caixa de diálogo possui duas seções: Metric Selection e Metric Sorting. No grupo GPU, as métricas disponíveis incluem utilização da GPU, utilização de memória da GPU, memória total da GPU e memória da GPU utilizada. No grupo CPU, selecione métricas como utilização de CPU. Clique em OK após fazer suas seleções.

  4. Em um gráfico de monitoramento, utilize o zoom por região (aproximar), desfazer zoom (reverter o zoom anterior), redefinir (restaurar a visualização inicial) e baixe.

    image

  5. chart sync: Quando ativado, este recurso sincroniza as ações de zoom em todos os gráficos, facilitando a comparação de múltiplas visualizações.

    Clique na lista suspensa de layout à direita e selecione One per row, Two per row ou Three per row.

  6. Personalize o número de gráficos exibidos por linha.

Usar o CloudMonitor

O CloudMonitor monitora recursos da Alibaba Cloud e aplicações de internet. Utilize o console do CloudMonitor para visualizar dados de monitoramento de jobs do PAI-Deep Learning Containers (DLC) e configurar notificações de alerta. O CloudMonitor também fornece APIs que permitem assinar dados de métricas para criar seus próprios sistemas de monitoramento e painéis. Para mais informações, consulte What is CloudMonitor?.

Faturamento

O uso do serviço CloudMonitor gera taxas. Para informações detalhadas sobre faturamento, consulte Billing of CloudMonitor.

Visualizar dados de monitoramento

  1. Faça login no console do Cloud Monitor.

  2. No painel de navegação à esquerda, escolha Visualization > Cloud Service Monitoring Dashboard.

  3. Na página cloud service monitoring dashboard, selecione PAI-Deep Learning Containers (DLC) e, na caixa de pesquisa, selecione ou pesquise um workspace ID para visualizar os gráficos de monitoramento correspondentes. Para encontrar seu workspace ID, consulte Manage workspaces.

    A área de gráficos de monitoramento exibe três painéis de métricas de GPU na aba job dimension: GPU Memory Interface Utilization (Job Dimension) (%), GPU Compute Utilization (Job Dimension) (%) e GPU SM Utilization (Job Dimension) (%). O período de relatório para essas métricas é de 10 segundos.

    Nos gráficos de monitoramento, você pode:

    • Alternar dimensões de monitoramento: Exibir métricas por dimensão de job, pod (worker) ou GPU.

      • Clique na aba job dimension. Selecione ou insira um ID de job do DLC para visualizar os dados de monitoramento de um único job.

      • Clique na aba pod dimension. Selecione ou insira um ID de pod para visualizar os dados de monitoramento de um único pod.

      • Clique na aba GPU Level. Selecione ou insira um ID de pod para visualizar dados de monitoramento da dimensão GPU para um único pod em um job do DLC especificado.

    • Alterar o intervalo de tempo: Selecione 1 hour, 3 hours, 6 hours, 12 hours, 1 day, 3 days, 7 days, 14 days ou um período Custom.

    • Ampliar: Clique no ícone de zoom image.png no canto superior direito de cada gráfico para visualizar dados detalhados de monitoramento.

Configurar alertas

Configure regras de alerta para monitorar os níveis de recursos dos jobs do PAI-Deep Learning Containers (DLC). Se uma métrica de recurso violar uma regra, o sistema envia uma notificação de alerta. Esta seção descreve como configurar alertas usando o console e as APIs do CloudMonitor.

Configurar contatos de alerta

  1. Faça login no console do Cloud Monitor.

  2. No painel de navegação à esquerda, escolha Alerts > Alert Contacts.

  3. Na aba Alert Contacts, clique em Create Contact, insira o nome, número de telefone, endereço de e-mail ou URL do webhook para o contato e clique em Confirm.

  4. Na aba Alert Contact Group, clique em Create Contact Group, insira um nome para o grupo, adicione contatos de alerta existentes ao grupo e clique em Confirm.

Configurar regras de alerta

  1. No painel de navegação à esquerda do console do CloudMonitor, escolha Cloud Resource Monitoring > Cloud Service Monitoring.

  2. Na página Cloud Service Monitoring, abra PAI-Deep Learning Containers (DLC). Na caixa de pesquisa, insira PAI-Deep Learning Containers (DLC). Nos resultados da pesquisa, na categoria Metric Monitoring, clique em PAI-Deep Learning Containers (DLC).

  3. Na página PAI-Deep Learning Containers (DLC), selecione sua região de serviço e clique em Create Alert Rule.

  4. No painel Create Alert Rule, configure os seguintes parâmetros e clique em Confirm.

    Parâmetro

    Descrição

    Product

    Produto a ser monitorado. Selecione PAI-Deep Learning Containers (DLC).

    Resource Scope

    Escopo da regra de alerta. Opções: All Resources e instance.

    • All Resources: Uma notificação de alerta é enviada se qualquer recurso DLC atender à regra de alerta.

    • instance: Na seção Associate Resources, adicione os workspaces que deseja associar. Uma notificação de alerta é enviada apenas quando um job DLC nos workspaces adicionados atende à regra de alerta.

    Rule Description

    Condições que acionam o alerta. Um alerta é disparado quando os dados de monitoramento atendem a essas condições. Para mais informações sobre como definir uma descrição de regra, consulte Create an alert rule.

    Mute For

    Intervalo de reenvio para alertas não resolvidos.

    Effective Period

    Período em que a regra de alerta está ativa. O CloudMonitor verifica alertas apenas durante este período.

    Tags

    Tags personalizadas para a regra de alerta, especificadas como pares chave-valor.

    Alert Contact Group

    Grupo de contatos que recebe notificações de alerta. Selecione um grupo com contatos de alerta configurados.

  5. Na página PAI-Deep Learning Containers (DLC), clique em View Alert Rules para visualizar os detalhes e o histórico das suas regras de alerta. Também é possível modifique as regras.

Também é possível configurar o serviço de alerta chamando operações de API. Essas operações permitem visualizar o histórico de alertas, gerencie modelos de alerta, configurar regras de alerta e gerencie contatos de alerta. Para mais informações, consulte CloudMonitor API Reference: alert service.

Assinar métricas de monitoramento

O CloudMonitor fornece um conjunto abrangente de operações de API para assinar métricas e dados de monitoramento do DLC. Isso permite criar seus próprios sistemas de monitoramento e painéis. Para etapas detalhadas, consulte Cloud Service Monitoring API Directory.

API

Descrição

DescribeMetricLast

Consulta os dados de monitoramento mais recentes de uma métrica especificada.

DescribeMetricList

Consulta os dados de monitoramento de uma métrica especificada para um serviço de nuvem específico.

DescribeMetricData

Consulta os dados de monitoramento de uma métrica para um serviço de nuvem especificado.

DescribeMetricMetaList

Lista métricas disponíveis e seus metadados.

DescribeProjectMeta

Lista serviços de nuvem que fornecem métricas de séries temporais.

DescribeMetricTop

Consulta os dados de monitoramento mais recentes de uma métrica especificada para um serviço de nuvem específico e, em seguida, consulta os dados de monitoramento classificados da métrica.

O exemplo a seguir mostra como chamar a operação de API DescribeMetricList para consultar os dados de monitoramento de uma métrica especificada para o PAI-Deep Learning Containers (DLC).

  1. Acesse a página Metrics for PAI-Deep Learning Containers (DLC).

  2. Na página da lista de métricas, localize a métrica desejada, como JOB_GPU_ACCELERATOR_DUTTY_UTIL, e clique em Get Metric Data na coluna Actions para ir à página do OpenAPI Portal.

  3. Na página do OpenAPI Portal, configure os seguintes parâmetros principais e deixe os demais com seus valores padrão. Para mais informações sobre os parâmetros, consulte DescribeMetricList.

    Parâmetro

    Descrição

    Namespace

    Defina este parâmetro como acs_pai_dlc.

    MetricName

    Métrica a ser consultada. Exemplo: CARD_GPU_DRAM_ACTIVE_UTIL.

    StartTime

    Hora de início. Exemplo: 2024-05-15 00:00:00.

    EndTime

    Hora de término. Exemplo: 2024-05-28 00:00:00.

    Nota

    O intervalo entre StartTime e EndTime deve ser de 31 dias ou menos.

  4. Após configurar os parâmetros, clique em Initiate Call para visualizar os dados de monitoramento do intervalo de tempo especificado. Uma chamada bem-sucedida retorna um código de status 200. O array Datapoints no corpo da resposta contém campos de dados como timestamp, jobId, regionId, userId, workspaceId e Value.

Usar o ARMS

O Application Real-Time Monitoring Service (ARMS) é uma plataforma de observabilidade nativa da nuvem da Alibaba Cloud. Com o ARMS, crie painéis personalizados do Grafana e configure regras de alerta flexíveis usando o Prometheus para monitorar de forma abrangente as métricas dos seus jobs do DLC. Para mais informações, consulte What is Application Real-Time Monitoring Service (ARMS)?.

Faturamento

O uso do ARMS gera taxas. Para detalhes de faturamento, consulte ARMS billing.

Integrar dados de monitoramento

Para integrar dados de monitoramento do DLC ao ARMS:

  1. Faça login no console do ARMS e, no painel de navegação à esquerda, clique em Integration Center.

  2. Na página Integration Center, clique na aba Artificial Intelligence e, em seguida, clique em PAI-DLC Distributed Training Service.

  3. No painel exibido, na aba Start Provisioning, selecione uma Data Storage Region, insira um Integration Name e clique em OK.

    A integração leva cerca de 1 a 2 minutos. Também é possível alternar para as abas Effect Preview, Collected Metrics e Alert Rule Templates para visualizar o painel de métricas, as métricas compatíveis e os nomes e detalhes dos modelos de regras de alerta.

  4. Após a conclusão da integração, clique em Provisioning para visualizar os detalhes do ambiente provisionado.

Painel do Grafana

  1. Faça login no console do ARMS. No painel de navegação à esquerda, selecione Provisioning. Na aba Provisioned Environments > Cloud Service Region Environment, clique no nome do ambiente.

  2. Na aba Component Management, na seção Component Type, selecione PAI-DLC Distributed Training Service e clique em Dashboards à direita para visualizar os painéis integrados do Grafana.

  3. Clique no nome de um painel para visualizar o painel de monitoramento. O painel PAI-DLC Distributed Training Service - Instance Details fornece filtros para workspaceId, jobId, pod e gpu. Ele organiza as métricas em painéis de Job Dimension, Card Dimension e Pod Dimension. O painel Pod Dimension mostra uma tabela de detalhes do pod, incluindo utilização de CPU, taxas de E/S de disco e uso de memória, juntamente com gráficos de séries temporais para latência de leitura do CPFS, volume de gravação de dados do CPFS e volume de leitura de dados do CPFS.

Configurar alertas do Prometheus****

Configure alertas de monitoramento usando o Prometheus da seguinte maneira:

  1. Faça login no console do ARMS. No painel de navegação à esquerda, selecione Provisioning. Na aba Provisioned Environments > Cloud Service Region Environment, clique no nome do ambiente.

  2. Na aba Component Management, na lista Component Type, selecione PAI-DLC Distributed Training Service e clique em Alert Rules para visualizar as regras de alerta integradas. Por padrão, essas regras estão no estado Stopped.

  3. As regras de alerta integradas geram eventos, mas não enviam notificações. Configure o envio de notificações para um endereço de e-mail ou outras plataformas de uma das duas maneiras a seguir:

    • Configure uma política de notificação. Essa política define regras de correspondência para eventos de alerta. Quando um evento de alerta corresponde a uma regra, o sistema envia uma notificação ao destinatário especificado por meio do método de notificação escolhido. Para mais informações, consulte Notification Policies.

    • Edite a regra de alerta para configurar o método de notificação. Na página de gerenciamento de regras de alerta, selecione o tipo de componente alvo no painel de navegação à esquerda, como PAI-DLC Distributed Training Service, PAI-DSW, PAI-Quota Service ou PAI-Quota (non-Lingjun). Localize a regra alvo na lista e clique em Edit. Na página de edição de regras de alerta do Prometheus, personalize as condições de alerta, duração, conteúdo e notificações. Para mais informações, consulte Create a Prometheus alert rule. Ao editar a regra, defina Check Type como Custom PromQL. No campo Custom PromQL Statement, insira uma expressão, como AliyunPaidlc_POD_STATE_ACTIVE{} > 80. Defina a Duration como 2 minutos e o Alert Level como P2. Na seção Alert Notification, selecione Simple Mode e configure o Recipient, Notification Period (de 00:00 a 23:59) e Repeat Policy. Após concluir a configuração, clique em Done.