Ao enviar um job de treinamento do Deep Learning Containers (DLC), configure o Object Storage Service (OSS), o File Storage NAS (NAS), o Cloud Parallel File Storage (CPFS) ou o armazenamento do MaxCompute por meio de configuração de código ou montagens. Assim, você lê e grava dados diretamente no armazenamento especificado durante o treinamento.
Pré-requisitos
Ative o PAI (DLC) e crie um workspace. Para mais informações, consulte Ativar o PAI e criar um workspace padrão.
-
(Opcional) Para usar o armazenamento do Object Storage Service (OSS), conclua as etapas a seguir:
Ative o OSS e conceda as permissões necessárias ao PAI. Para mais informações, consulte Ativar o OSS e Autorizar contas de serviço do PAI.
Crie um bucket do OSS. Para mais informações, consulte Início rápido no console.
(Opcional) Para usar o File Storage NAS (NAS), crie um sistema de arquivos NAS de uso geral. Para mais informações, consulte Criar um sistema de arquivos.
(Opcional) Para usar o armazenamento do MaxCompute, ative o serviço e crie um projeto do MaxCompute. Para mais informações, consulte Ativar o MaxCompute e Criar um projeto do MaxCompute.
Uso do armazenamento OSS
Configuração do armazenamento OSS com montagens
Ao criar um job de treinamento do Deep Learning Containers (DLC), você pode montar o Object Storage Service (OSS). A tabela a seguir lista os tipos de montagem compatíveis. Para obter detalhes sobre a configuração, consulte Criar um job de treinamento.
|
Tipo de montagem |
Descrição |
|
Mount dataset |
Monte um conjunto de dados personalizado ou público.
Selecione um conjunto de dados do tipo OSS e configure o Mount Path. Durante a execução do job DLC, o sistema acessa os dados do OSS nesse caminho. |
|
Mount storage |
Monte um caminho de bucket do OSS e use a opção Read-only para definir as permissões de leitura e gravação. |
O DLC é compatível com JindoFuse e ossfs para montar o OSS:
JindoFuse: método de montagem padrão. A configuração predefinida tem limitações funcionais e pode não ser adequada para todos os cenários. Para obter detalhes, consulte JindoFuse. Ajuste os parâmetros conforme necessário para cenários específicos. Para mais informações, consulte JindoFuse.
ossfs: ao montar um caminho de bucket do OSS com o método de montagem de armazenamento, especifique
{"mountType":"ossfs"}nas Advanced Settings para usar o ossfs.
Configuração do armazenamento OSS sem montagens
Os jobs do DLC leem e gravam no Object Storage Service (OSS) usando o OSS PyTorch Connector ou um SDK do OSS. Ao criar um job de treinamento, configure os arquivos de código relevantes. Para exemplos de código, consulte OSS Connector for AI/ML ou OSS SDK.
Na seção Code Configuration, na aba Online Configuration, selecione a source do código na lista suspensa e insira o Mount Path do código.
Uso do armazenamento NAS/CPFS
Ao criar um job do Deep Learning Containers (DLC), use o armazenamento File Storage NAS (NAS) ou Cloud Parallel File Storage (CPFS) vinculando um conjunto de dados personalizado do tipo NAS/CPFS ou usando uma montagem de armazenamento. Para obter detalhes sobre a configuração, consulte Usar NAS/CPFS.
Na seção Dataset Mount, defina o Mount Path, por exemplo, /mnt/data/. Na seção Storage Mount, configure sequencialmente Select File System, File System Mount Point, File System Path e Mount Path, por exemplo, /mnt/data2/. Se o tipo de armazenamento selecionado apresentar risco de zona de disponibilidade única, um aviso laranja será exibido.
|
Tipo de montagem |
Descrição |
|
Mount dataset |
Monte um conjunto de dados personalizado. Use a opção Read-only para definir as permissões de leitura e gravação. |
|
Mount storage |
Monte um sistema de arquivos File Storage NAS (NAS) ou Cloud Parallel File Storage (CPFS) e use a opção Read-only para definir as permissões de leitura e gravação. Além disso, nas Advanced Settings, defina o parâmetro nconnect para melhorar o throughput quando os contêineres do DLC acessam o NAS. O nconnect é uma opção de montagem Linux para clientes NFS que aumenta o throughput estabelecendo mais conexões de transporte tcp entre o cliente e o servidor. Para mais informações, consulte Como resolver o baixo desempenho ao acessar o NAS a partir de um sistema operacional Linux?. Exemplo:
|
Uso do armazenamento MaxCompute
Você pode usar o armazenamento do MaxCompute sem montagens. Ao criar um job de treinamento, configure os arquivos de código pertinentes. Para exemplos de código, consulte Usar o MaxCompute.
Perguntas frequentes
P: Job PAIIO 'killed' sem erro
Esse problema ocorre devido à insuficiência de recursos. O PAIIO não limita o uso de memória, o que pode levar a um consumo elevado ao ler dados do MaxCompute. O sistema operacional provavelmente encerra o processo quando o contêiner fica sem memória, pois o SO e outros componentes do sistema também consomem recursos.