Prepare recursos de computação, imagem de contêiner, conjunto de dados e código-fonte para um job de treinamento do DLC.
Pré-requisitos
Se você usar o OSS para armazenamento, conceda ao DLC as permissões necessárias para acessá-lo. Sem as permissões adequadas, ocorrem erros de E/S ao acessar dados de um bucket do OSS montado. Para obter mais informações, consulte Cloud product dependencies and authorization: DLC.
Etapa 1: Preparar recursos
Prepare os recursos de computação para o treinamento de IA. Estão disponíveis os seguintes tipos de recursos:
-
Recursos públicos
Conclua a DLC authorization. Os recursos públicos ficam disponíveis na página Create Job sem necessidade de adicionar um grupo de recursos.
-
Recursos de computação gerais
Crie um grupo de recursos dedicado, adquira recursos de computação gerais e defina uma cota de recursos para alocá-los. Associe a cota de recursos a um workspace para enviar jobs de treinamento. Para obter mais informações, consulte General computing resource quotas.
-
Recursos Lingjun
Prepare os recursos Lingjun e associe-os ao seu workspace. Para obter mais informações, consulte Create a resource quota.
Etapa 2: Preparar uma imagem
Prepare uma imagem de contêiner para o ambiente de treinamento. Há suporte às seguintes opções de imagem:
Imagem oficial: O PAI fornece imagens oficiais baseadas em diversos frameworks. Essas imagens são otimizadas para serviços da Alibaba Cloud, oferecendo melhor compatibilidade e desempenho. Acesse a página Imagens do AI Asset Management no PAI console. Na página Image:, aba Alibaba Cloud Images, defina Modules como DLC para visualizar as imagens compatíveis com jobs do DLC.
-
Imagem personalizada: Se o job de treinamento exigir ambientes ou dependências específicas, use uma imagem personalizada. Adicione a imagem como um ativo de IA do PAI na página do seu workspace para reutilizá-la em vários jobs de treinamento. Para obter mais informações, consulte Custom images.
ImportanteSe você usar uma imagem personalizada com recursos Lingjun, consulte RDMA: Use high-performance networks for distributed training para considerações relacionadas.
Endereço da imagem: Especifique o endereço de uma imagem personalizada ou oficial ao enviar um job de treinamento. Visualize os endereços das imagens na página Imagens do AI Asset Management no PAI console.
Etapa 3: Preparar um conjunto de dados
Faça upload dos dados de treinamento para o Object Storage Service, NAS ou CPFS e crie um conjunto de dados, ou monte diretamente os dados de um bucket do Object Storage Service ou de um conjunto de dados público.
Tipos de conjuntos de dados com suporte
O PAI oferece suporte a conjuntos de dados armazenados no Object Storage Service, General-purpose NAS, Extreme NAS, CPFS e Lingjun CPFS. A aceleração de conjuntos de dados tem suporte para todos os tipos, exceto Lingjun CPFS.
Criar um conjunto de dados
Para etapas detalhadas, consulte Create and manage datasets. Observe as seguintes limitações:
Limitações do Object Storage Service: O Object Storage Service é um serviço de armazenamento de objetos distribuído, não um sistema de arquivos. Após montar um bucket do Object Storage Service, não é possível anexar dados nem sobrescrever arquivos existentes.
Requisito de VPC do CPFS: Configure o job de treinamento para usar a mesma VPC do sistema de arquivos CPFS. Uma incompatibilidade de VPC faz com que o job permaneça indefinidamente no estado Preparing environment.
Ativar a aceleração de conjuntos de dados
Ative a aceleração de conjuntos de dados para melhorar a eficiência de leitura. Para obter detalhes, consulte Use Dataset Accelerator in PAI.
Etapa 4: Preparar o código-fonte
Adicione seu código de treinamento como um ativo de IA na página do seu workspace para reutilizá-lo em vários jobs de treinamento. Para obter mais informações, consulte Code configuration.
Próximas etapas
Após concluir essas preparações, crie um job de treinamento. Para obter mais informações, consulte Create a training job.