Após enviar um job de treinamento, revise as informações básicas, configurações, eventos, métricas de recursos e logs para obter uma visão completa da execução. Pesquise pelo nome ou ID do job para alternar rapidamente entre instâncias em execução e históricas.
Informações básicas e configuração
Faça login no PAI console. Na barra de navegação superior, selecione a região desejada e, à direita, o workspace correspondente. Em seguida, clique em Enter DLC.
Clique em no nome do job desejado para abrir a página de visão geral.
-
A aba Overview exibe as informações básicas, de ambiente e de recursos do job.
O topo da página mostra o status do job (por exemplo, Succeeded), a duração, o tipo de computação (como General-purpose computing), o tipo de job (como PyTorchJob) e o grupo de recursos, além de uma linha do tempo com as fases desde a criação até a conclusão. As informações básicas incluem o nome e o ID do job, bem como as tags. Os dados de recursos abrangem o tipo de recurso, a quantidade de workers e o tipo de instância (por exemplo,
ecs.gn7i-c8g1.2xlarge). As informações de ambiente contêm a URL da imagem do nó, a configuração de montagem do dataset e o comando de execução. A página também apresenta seções de configuração como Fault Tolerance and Diagnosis (com opções para Auto Fault Tolerance e Health Check), Network Information (com detalhes sobre Virtual Private Cloud (VPC), grupo de segurança e vSwitch) e Roles and Permissions (com informações sobre a função RAM da instância e visibilidade). Clique em no nome do job na parte superior da página para abrir uma lista suspensa. A busca aproximada por nome ou ID permite alternar rapidamente entre instâncias em execução e históricas.
Eventos do job
Os logs de eventos registram o progresso do agendamento e da alocação de recursos do job. Utilize esses eventos para identificar e solucionar problemas.
-
Acesse a aba Event para visualizar os logs de eventos do job.
A aba Event apresenta uma linha do tempo de eventos à esquerda, indicando etapas como criação do job, preparação do ambiente, execução e conclusão, com os respectivos intervalos de tempo. À direita, o painel de logs detalha os eventos do ciclo de vida do PyTorchJob, incluindo Job Queued, Dequeued, Pod Created, Service Created, Scheduled, Running e Succeeded.
-
Na aba Overview, vá até a seção Instance. Na coluna Actions da instância, clique em Log e selecione a aba System Log para consultar os logs de eventos específicos do nó.
O log do sistema registra todo o ciclo de vida de um pod, incluindo alterações de status (ResourcePurchasing → NetworkInitializing → Initializing → ImagePulling → WaitingForRun → Running → Succeeded), registros de pull de imagens e eventos de criação e inicialização de containers.
Métricas de recursos
As principais métricas incluem utilização de GPU, uso de memória da GPU, utilização de CPU, uso de memória e I/O de rede. O monitoramento desses indicadores em tempo real possibilita compreender a demanda de recursos do job, acompanhar a utilização e o consumo, além de planejar otimizações.
Selecione a aba Monitoring para visualizar as métricas de recursos do job.
Ao criar um job de treinamento com cota de recursos, você também conta com os seguintes recursos de monitoramento:
-
As métricas estão disponíveis por Job Dimension, Pod Dimension e GPU Dimension.
O topo da página Monitoring exibe a linha do tempo do ciclo de vida do job, mostrando etapas como Job Created, Queued, Preparing Environment, Running e Succeeded, além do tempo gasto em cada fase. Abaixo da linha do tempo, alterne entre as abas Job Dimension, Pod Dimension e GPU Dimension para visualizar as métricas correspondentes. A aba GPU Dimension apresenta gráficos de linhas para utilização de GPU e uso de memória da GPU.
-
Recursos interativos permitem filtrar por horário e tipo de métrica, além de categorizar os dados. Clique em More para personalizar a visualização e ordenar as métricas. A interface de monitoramento do DLC possibilita criar um painel personalizado selecionando e reorganizando as métricas. Escolha os indicadores-chave de desempenho conforme suas necessidades de negócio e ajuste a prioridade de exibição arrastando e soltando os itens para focar no que é mais importante.
As métricas de monitoramento de GPU disponíveis incluem GPU utilization, Total GPU Memory, GPU memory usage, GPU Memory Used, GPU Memory Interface Utilization, GPU Memory Bandwidth Usage, GPU SM Core Utilization, GPU Power Consumption e GPU Temperature. Após escolher as métricas desejadas, arraste-as na área Sort metrics à direita para ajustar a ordem de exibição e clique em OK para salvar a configuração.
O DLC também oferece suporte a monitoramento e alertas para acompanhar os níveis de recursos do job em tempo real. Para mais informações, consulte Monitoramento e Alertas de Treinamento.
Logs do job
Caso um job apresente comportamento anormal ou seja necessário revisar seu histórico de execução, visualize os logs de uma das seguintes formas:
Na aba Overview, acesse a seção Instance. Na coluna Actions da instância, clique em Log para ver o log de saída do nó específico.
-
Navegue até a aba Log para buscar eventos nos logs por palavra-chave. Para mais detalhes, consulte Consultar Logs Agregados por Palavra-chave. Confira algumas dicas rápidas sobre a sintaxe de consulta:
- Basic query: error: finds logs containing "error". - Multi-word query: "Unexpected result": finds logs containing both "Unexpected" and "result". - Wildcard query: error*: finds words starting with "error". Special characters are not supported. - Phrase query: #"abc$def": matches the exact phrase "abc$def". Delimiters: Logs are split by delimiters. Delimiters in keywords are treated as null characters. To search for content containing delimiters, use a phrase query. Common delimiters include: \n\t\r,;[]{}()&^*#@~=<>/\?:'"Na página Log, o lado esquerdo exibe a lista de instâncias e o direito mostra os logs do usuário para a instância selecionada. No exemplo, o log de treinamento apresenta os resultados de validação da Epoch 16 à Epoch 18, e a saída final é
Model saved with accuracy: 98.96%, indicando que o treinamento do modelo foi concluído com sucesso.
Logs de auditoria
O PAI integra-se ao ActionTrail. É possível visualizar e pesquisar os eventos de ações do DLC dos últimos 90 dias da sua conta Alibaba Cloud diretamente no ActionTrail. Para mais informações, consulte ActionTrail.
Registros de reinicialização
Se você ativou Auto Fault Tolerance ou Health Check (lista de bloqueios e nova execução) durante a criação do job, clique em Restart Count para acessar a página de registros de reinicialização. Essa página exibe dados sobre as reinicializações, incluindo contagem, horário, motivo, resultado e duração de cada reinício.
Na lista de registros de reinicialização, clique em Error Details para ver informações detalhadas sobre uma reinicialização específica, como contagem, horário, nome do nó, nome da instância, código de erro, mensagem de erro e origem do erro.
Clique em View Aggregated Error Details para exibir a lista completa de registros de reinicialização com seus respectivos detalhes.
Documentação relacionada
Gerencie os jobs com base no status. Para mais informações, consulte Gerenciar Jobs de Treinamento.