Prepare recursos de computação, uma imagem de contêiner, um dataset e o source code para um job de treinamento do DLC.
Pré-requisitos
Se você utilizar o OSS para armazenamento, conceda ao DLC as permissões necessárias para acessá-lo. Sem as permissões adequadas, ocorrem erros de E/S ao acessar dados de um bucket do OSS montado. Para obter mais informações, consulte Dependências e autorização de produtos de nuvem: DLC.
Etapa 1: Preparar recursos
Prepare os recursos de computação para o treinamento de IA. Estão disponíveis os seguintes tipos de recursos:
-
Recursos públicos
Conclua a autorização do DLC. Os recursos públicos ficam então disponíveis na página Create Job sem a necessidade de adicionar um grupo de recursos.
-
Recursos de computação gerais
Crie um grupo de recursos dedicado, adquira recursos de computação gerais e defina uma cota de recursos para alocá-los. Associe a cota de recursos a um workspace para enviar jobs de treinamento. Para obter mais informações, consulte Cotas de recursos de computação gerais.
-
Recursos Lingjun
Prepare os recursos Lingjun e associe-os ao seu workspace. Para obter mais informações, consulte Criar uma cota de recursos.
Etapa 2: Preparar uma imagem
Prepare uma imagem de contêiner para o ambiente de treinamento. Há suporte às seguintes opções de imagem:
Imagem oficial: O PAI fornece imagens oficiais baseadas em diversos frameworks. Essas imagens são otimizadas para serviços da Alibaba Cloud, oferecendo melhor compatibilidade e desempenho. Acesse a página Imagens do AI Asset Management no PAI console. Na página Image:, na aba Alibaba Cloud Images, defina Modules como DLC para visualizar as imagens compatíveis com jobs do DLC.
-
Imagem personalizada: Caso seu job de treinamento exija ambientes ou dependências específicas, utilize uma imagem personalizada. Adicione a imagem como um ativo de IA do PAI na página do seu workspace para reutilizá-la em vários jobs de treinamento. Para obter mais informações, consulte Imagens personalizadas.
ImportanteSe você usar uma imagem personalizada com recursos Lingjun, consulte RDMA: Uso de redes de alto desempenho para treinamento distribuído para considerações relevantes.
Endereço da imagem: Especifique o endereço de uma imagem personalizada ou oficial ao enviar um job de treinamento. Visualize os endereços das imagens na página Imagens do AI Asset Management no PAI console.
Etapa 3: Preparar um dataset
Faça upload dos dados de treinamento para o OSS, NAS ou CPFS e crie um dataset, ou monte diretamente os dados de um bucket do OSS ou de um dataset público.
Tipos de dataset compatíveis
O PAI é compatível com datasets armazenados no OSS, NAS de uso geral, NAS extremo, CPFS e CPFS Lingjun. A aceleração de dataset está disponível para todos os tipos, exceto para o CPFS Lingjun.
Criar um dataset
Para etapas detalhadas, consulte Criar e gerenciar datasets. Observe as seguintes limitações:
Limitações do OSS: O OSS é um serviço de Object Storage Service distribuído, não um sistema de arquivos. Após montar um bucket do OSS, não é possível anexar dados nem sobrescrever arquivos existentes.
Requisito de VPC do CPFS: Configure o job de treinamento para usar a mesma VPC do sistema de arquivos CPFS. Uma incompatibilidade de VPC faz com que o job permaneça indefinidamente no estado Preparing environment.
Ativar aceleração de dataset
Ative a aceleração de dataset para melhorar a eficiência de leitura de dados. Para detalhes, consulte Usar o Dataset Accelerator no PAI.
Etapa 4: Preparar o source code
Adicione seu código de treinamento como um ativo de IA na página do seu workspace para reutilizá-lo em vários jobs de treinamento. Para obter mais informações, consulte Configuração de código.
Próximas etapas
Após concluir esses preparativos, crie um job de treinamento. Para obter mais informações, consulte Criar um job de treinamento.