Todos os produtos
Search
Central de documentação

Platform For AI:DSW FAQ

Última atualização: Sep 18, 2026

Encontre respostas para perguntas comuns sobre o DSW.

Pergunte primeiro ao PAI Agent

Clique no ícone image no canto superior direito do PAI console para iniciar o PAI AI Assistant (Agentic PAI). O Agentic PAI fornece manuais do usuário e diretrizes operacionais para os produtos PAI de ponta a ponta. Ele oferece suporte a diagnósticos de O&M para instâncias do DSW, tarefas do DLC e serviços do EAS, identificando automaticamente as causas raiz das falhas e fornecendo recomendações de solução de problemas.

Inicialização da instância

P: Falha ao iniciar a instância do DSW

Solução de problemas: Clique no nome da instância e verifique a mensagem de erro na aba Events.

Erros comuns e soluções:

  • Seu tipo de recurso solicitado [ecs.**] não está disponível no momento, tente outras regiões ou outros tipos de recurso

    • Causa: O tipo de recurso selecionado está esgotado nesta região.

    • Solução: Tente novamente mais tarde ou mude para um tipo de recurso ou região diferente.

  • Seu uso de recursos excedeu o limite padrão. Entre em contato conosco através do sistema de tickets para aumentar o limite.

    • Causa: Cada conta do Alibaba Cloud (conta primária) pode criar no máximo 2 instâncias de GPU por região por vez. A seleção de um tipo de recurso com mais de 2 GPUs falhará.

    • Solução: Para aumentar sua cota, envie um ticket.

  • a zona de disponibilidade com vSwitch está esgotada

    • Causa: Quando um vSwitch da VPC é configurado, a busca de recursos fica limitada à zona de disponibilidade desse vSwitch, o que pode resultar em escassez de recursos.

    • Solução:

      1. Crie o vSwitch e a instância do DSW em uma zona de disponibilidade diferente.

      2. Tente um tipo de instância do DSW diferente.

  • As vendas deste recurso estão temporariamente suspensas na zona especificada. Recomendamos o uso da função de criação multizona para evitar o risco de recursos insuficientes.

    As vendas de recursos na zona de disponibilidade especificada estão suspensas. Tente o seguinte:

    • Mude para uma região diferente.

    • Selecione um tipo de recurso diferente.

    • Tente iniciar a instância fora dos horários de pico.

  • CommodityInstanceNotAvailableError: A instância do produto foi liberada devido a atrasos prolongados no passado. Crie uma nova instância para uso

    • Causa: O sistema liberou a instância devido a atrasos prolongados na conta.

    • Solução: Crie uma nova instância.

  • A cobrança da instância ECI atual foi interrompida, mas os recursos relacionados ainda estão sendo limpos.

    • Causa: Os recursos do nível gratuito são compartilhados. Durante os horários de pico, iniciar uma instância do DSW pode levar mais de 30 minutos. Se o sistema não conseguir adquirir recursos em até uma hora, ele relata o tipo selecionado como indisponível na região atual.

    • Solução: Tente o seguinte:

      • Mude para uma região diferente.

      • Altere o tipo de recurso (instâncias pendentes não suportam alterações de tipo — pare a instância manualmente primeiro e depois mude).

      • Use a instância fora dos horários de pico, como fora do horário comercial.

      • Se nenhuma das opções acima funcionar, entre em contato com o gerente da sua conta.

  • Os recursos do cluster estão totalmente utilizados. Tente mais tarde ou em outras regiões.

    • Causa: Todos os recursos de computação no cluster estão em uso.

    • Solução: Tente o seguinte:

      • Mude para uma região diferente.

      • Altere o tipo de recurso (instâncias pendentes não suportam alterações de tipo — pare a instância manualmente primeiro e depois mude).

      • Use a instância fora dos horários de pico, como fora do horário comercial.

      • Se nenhuma das opções acima funcionar, entre em contato com o gerente da sua conta.

  • A criação do ECI falhou porque a instância especificada está esgotada. Recomenda-se o uso da função de criação multizona para evitar o risco de falta de estoque.

    • Causa: O tipo de recurso especificado está esgotado.

    • Solução: Tente o seguinte:

      • Mude para uma região diferente.

      • Altere o tipo de recurso (instâncias pendentes não suportam alterações de tipo — pare a instância manualmente primeiro e depois mude).

      • Use a instância fora dos horários de pico, como fora do horário comercial.

      • Se nenhuma das opções acima funcionar, entre em contato com o gerente da sua conta.

  • back-off 10s restarting failed container=dsw-notebook pod

    • Causa: O disco do sistema está cheio e precisa ser expandido.

      Para verificar o uso do disco do sistema: clique no nome da instância na lista de instâncias do DSW, acesse a página de detalhes e verifique o status do System disk na seção Environment information.

    • Solução: Na lista de instâncias, clique em Change Settings para expandir o disco do sistema.

      Importante

      Após expandir o disco do sistema, o faturamento continua independentemente de a instância estar em execução. Para interromper todas as cobranças relacionadas ao DSW, exclua a instância. Faça backup dos seus dados antes de excluir.

  • Pod was active on the node longer than the specified deadline

    • Causa: Esse erro geralmente é gerado pela camada subjacente do ACK. As causas comuns incluem configuração incorreta de parâmetros dentro do contêiner ou pouco espaço livre no disco do sistema.

    • Solução: Siga estas etapas de solução de problemas:

      1. Verifique se a imagem personalizada contém alguma configuração anormal.

      2. Execute find / -type f -print0 | xargs -0 du -h | sort -rh | head -n 10 para identificar os maiores arquivos no disco do sistema e confirme se são arquivos de negócios esperados.

      3. Confirme a conectividade de rede entre o CPFS e a instância do DSW e verifique se a configuração da VPC é consistente.

  • found multiple security groups with the same name

    • Causa: Isso geralmente é causado por uma anomalia no backend.

    • Solução: Tente reiniciar a instância. Se o erro persistir, anote o ID da solicitação (request ID) na mensagem de erro e envie um ticket para investigação.

  • Falha ao iniciar a instância devido à fragmentação de recursos de CPU no nó

    Solução: Ajuste a ordem de inicialização das suas tarefas — pare primeiro algumas instâncias do DSW que estão ocupando recursos, inicie a instância de destino e, assim que ela for iniciada com sucesso, reinicie as outras tarefas.

  • P: Minha imagem personalizada não tem um IDE instalado — ainda posso usar o IDE baseado na web?

    Sim. O VS Code e outras ferramentas de IDE integradas ao console web do DSW fazem parte do ambiente nativo da plataforma e não dependem de nenhum pacote de IDE incluído na sua imagem personalizada.

  • Falha na inicialização: Membro do workspace não encontrado

    Sua conta não é membro do workspace de destino. Entre em contato com o administrador do workspace para adicionar sua conta como membro.

  • failed to create containerd container: failed to prepare layer from archive: failed to validate archive quota ...

    • Causa: A imagem usada para criar a instância é muito grande, causando espaço insuficiente no disco do sistema.

    • Solução: Clique no nome da instância na lista de instâncias do DSW, acesse a página de detalhes e verifique o status do System disk na seção Environment information. Clique em Expand para expandir o disco do sistema. Note que a expansão do disco do sistema incorre em cobranças adicionais de armazenamento.

  • Resource Error: create order error (status code 400)

    Causa: Esse erro geralmente é causado por um dos seguintes motivos:

    1. Atrasos na conta: A conta possui saldos não pagos e o sistema bloqueou novas solicitações de criação de recursos. Mesmo os tipos de recursos do nível gratuito não podem ser criados enquanto a conta estiver em atraso.

    2. Controle de risco: A conta acionou a política de controle de risco de segurança do Alibaba Cloud (por exemplo, uma conta recém-registrada ou atividade incomum) e a solicitação foi rejeitada.

    Etapas de solução de problemas:

    1. Faça login no Billing and Cost console para verificar se há saldos não pagos. Se houver atrasos, pague-os antes de tentar novamente.

    2. Se a conta não tiver atrasos, o controle de risco pode ser a causa. Envie um ticket com o Request ID da mensagem de erro, e o suporte técnico ajudará a investigar e remover a restrição.

Outras causas de falha na inicialização:

  • Atrasos na conta

    Se sua conta estiver em atraso, a criação da instância do DSW falhará. Os vouchers não podem compensar atrasos. Faça login no Billing and Cost console para verificar o saldo da sua conta.

P: Cota de recursos ou cota de recursos de computação insuficiente — o que devo fazer?

Mensagens de erro comuns:

  • "Your requested resource type [ecs.] is not enough currently" (esgotado)

  • "Your resource usage has exceeded the default limitation" (excedeu o limite de 2 GPUs por região)

  • "The cluster resources are fully utilized" (todos os recursos de computação estão em uso)

Análise da causa raiz:

  • Escassez de recursos compartilhados

    • Os recursos compartilhados são usados por vários usuários e podem se esgotar durante os horários de pico.

    • Os tipos de GPU de alto nível têm maior probabilidade de esgotar.

    • Cada conta está limitada a 2 GPUs por região.

  • Cota de recursos dedicados esgotada

    • Você comprou cota de recursos dedicados, mas ela foi totalmente utilizada.

    • A alocação de cota é desigual — um workspace específico não tem cota suficiente.

Soluções:

  • Mude o tipo de recurso: se o tipo de GPU atual estiver esgotado, tente outro.

  • Mude de região: use o seletor de regiões no canto superior esquerdo do PAI console para tentar uma região diferente.

  • Aumente sua cota de GPU: para usar mais de 2 placas de GPU compartilhadas, envie um ticket.

  • Compre recursos dedicados: para uma disponibilidade de recursos estável, considere a compra de cota de recursos dedicados. Para obter detalhes, consulte Purchase general compute resources e Manage resource quotas.

P: Minha instância do DSW está pendente e mostra uma mensagem de cache de recursos de GPU — o que isso significa?

Uma mensagem de cache de recursos de GPU significa que o recurso de GPU solicitado está atualmente ocupado por outra tarefa, e sua instância está na fila aguardando a liberação do recurso. Enquanto aguarda, o sistema armazena em cache o estado da instância (mostrado como pendente) e a instância é retomada automaticamente assim que o recurso ficar disponível.

Isso é uma parte normal do mecanismo de agendamento de recursos da plataforma, e não um sinal de erro do usuário ou falha do sistema.

P: Como verifico o estoque ou o tempo de reposição para um tipo específico de instância do DSW?

  • O PAI-DSW console não oferece suporte à consulta direta do estoque em tempo real ou do tempo exato de reposição para um tipo de instância específico (como ecs.gn7i ou A100) em uma determinada região.

  • Os recursos públicos são compartilhados entre vários usuários e o estoque muda dinamicamente, portanto, não é possível fornecer um tempo exato de reposição.

  • Se a criação da instância relatar "esgotado" ou recursos insuficientes, tente mudar para uma região diferente, escolher outro tipo de instância disponível ou tentar novamente fora dos horários de pico.

  • Para garantir a disponibilidade de recursos, considere a compra de cota de recursos dedicados.

P: Posso alterar o tipo de recurso de uma instância do DSW após a sua criação?

Não. A alteração do tipo de recurso (por exemplo, de recursos dedicados para recursos públicos, ou vice-versa) não é suportada. Se você precisar de um recurso como a configuração de SSH que está disponível apenas em recursos públicos enquanto sua instância usa recursos dedicados, use o método proxyclient para acessar a instância ou crie uma nova instância com um tipo de recurso público que atenda aos seus requisitos.

P: O DSW pode executar um script Python automaticamente na inicialização?

Ao criar uma instância do DSW ou ao alterar a configuração da instância, encontre o parâmetro Custom Startup Script e configure-o.

Esse parâmetro permite personalizar o ambiente ou executar tarefas de inicialização durante a inicialização da instância. O script personalizado é executado após a imagem e os recursos estarem prontos, mas antes do lançamento do JupyterLab, Code Server e outras ferramentas de desenvolvimento.

Nota
  • O tempo limite é de 3 minutos: scripts personalizados estendem o tempo de inicialização da instância. Não execute tarefas de longa duração, como downloads de imagens, em scripts personalizados.

  • Os logs do script estão disponíveis em /var/log/user-command/ após a inicialização da instância.

P: A página do DSW não responde ou está com comportamento anormal — o que devo fazer?

Se você vir uma página em branco, um notebook carregando infinitamente, um terminal que não aceita entrada ou erros do navegador como "504 Gateway Timeout", o problema geralmente está relacionado ao seu ambiente local ou ao estado da instância. Tente o seguinte:

  1. Limpe o cache do seu navegador e tente novamente.

  2. Use o modo anônimo ou privativo do seu navegador.

  3. Mude de rede — por exemplo, de uma rede corporativa para um ponto de acesso móvel — para descartar restrições de firewall.

  4. Tente um navegador diferente (Chrome ou Firefox).

  5. Se você vir um erro 504 Timeout, pare e reinicie a instância do DSW no PAI console. Acesse a instância após o seu status mudar para Running.

P: Parar, reiniciar, alterar o tipo ou alterar a imagem de uma instância do DSW com disco em nuvem causará perda de dados?

As instâncias do DSW com disco do sistema em disco de nuvem incluem: instâncias criadas no grupo de recursos compartilhados e instâncias de recursos gerais onde Disk é selecionado como o tipo de disco do sistema. O comportamento de perda de dados difere por operação:

  • Parar a instância: Os dados podem ser perdidos. Se o disco de nuvem não tiver sido expandido e a instância estiver parada por mais de 15 dias, os dados serão limpos e não poderão ser recuperados. Se o disco tiver sido expandido ou a instância estiver parada por menos de 15 dias, os dados serão preservados.

  • Reiniciar a instância: Sem perda de dados. Após parar ou reiniciar, todos os pacotes instalados via pip, arquivos de código e outros dados armazenados no disco do sistema são retidos.

  • Alterar o tipo de instância: Sem perda de dados. A alteração da configuração de recursos (CPU, memória, GPU, etc.) não afeta os dados do disco do sistema.

  • Alterar a imagem da instância: Os dados podem ser parcialmente perdidos. A alteração da imagem não afeta os conjuntos de dados montados ou o armazenamento do OSS, mas o conteúdo do disco do sistema pode ser redefinido. Faça backup dos seus dados antes de alterar a imagem — por exemplo, copie-os para um conjunto de dados ou OSS. Para obter detalhes, consulte Mount a dataset, OSS, NAS, or CPFS.

Para instâncias de recursos gerais onde Temporary Storage é selecionado como o tipo de disco do sistema — independentemente de o grupo de recursos de IA ter discos de nuvem pré-pagos — parar, reiniciar, alterar o tipo ou alterar a imagem causará perda de dados do disco do sistema.

P: Os dados podem ser recuperados de uma instância do DSW de recursos compartilhados que foi liberada após 15 dias de inatividade?

Para instâncias do DSW criadas no grupo de recursos compartilhados: se o disco do sistema não tiver sido expandido e a instância não tiver sido iniciada por mais de 15 dias consecutivos após ser parada, o disco do sistema é limpo automaticamente e não pode ser recuperado.

P: Por que a primeira inicialização de uma instância do DSW é mais lenta do que as subsequentes?

A primeira inicialização requer um pull completo da imagem, o que pode levar mais de 10 minutos dependendo do tamanho da imagem e das condições da rede. As inicializações subsequentes são mais rápidas porque a imagem é armazenada em cache.

Se os tempos de inicialização estiverem ficando progressivamente maiores, a imagem personalizada salva pode ter ficado muito grande. Limpe arquivos desnecessários e salve a imagem novamente, ou mude para uma imagem oficial mais leve.

Parada, exclusão e liberação da instância

P: Como libero uma instância do DSW?

Na lista de instâncias do DSW, use as ações Stop ou Delete na coluna de operações à direita.

Importante: Se você expandiu o disco do sistema, ele continuará a incorrer em cobranças de armazenamento mesmo quando a instância estiver parada. Para interromper todo o faturamento relacionado ao DSW, exclua a instância.

P: Não consigo encontrar minha instância do DSW — o que devo fazer?

Tente mudar para uma região ou workspace diferente.

P: Como libero um pacote de créditos de teste gratuito?

Os pacotes de créditos de teste gratuito não precisam ser liberados ou parados.

P: Como interrompo todo o faturamento do DSW? Qual é a diferença entre "Stop" e "Delete"?

  • Stop: Libera os recursos de computação (CPU/GPU) e pausa as cobranças de computação. Nota: Um disco do sistema expandido continua a incorrer em cobranças.

  • Delete: Exclui permanentemente a instância e todos os seus recursos, incluindo o disco do sistema. Todo o faturamento relacionado é interrompido completamente.

Quando escolher:

  • Stop: Você terminou temporariamente, mas deseja manter seus dados e ambiente para uma reinicialização futura.

  • Delete: Você não precisa mais da instância e deseja interromper todo o faturamento. Faça backup dos seus dados antes de prosseguir.

P: Minha instância do DSW está no estado "Stopping" ou "Deleting" há muito tempo — o que está acontecendo?

Quando você para uma instância do DSW, o sistema cria automaticamente um cache de imagem salvando a camada de leitura e gravação atual do contêiner, o que acelera a próxima inicialização. Este é um comportamento esperado, não uma falha do sistema. Se uma grande quantidade de dados foi gravada na camada do contêiner, a criação do cache leva mais tempo — potencialmente de vários minutos até algumas horas.

Importante

As instâncias do DSW criadas no grupo de recursos compartilhados não incorrem em cobranças de computação enquanto estiverem no estado "Stopping", "Saving" ou "Deleting".

Se a instância levar muito tempo para parar, as causas comuns incluem:

  • Camada de leitura e gravação do contêiner grande: Esta é a causa mais comum. Instalar muitos pacotes, baixar arquivos de modelo ou salvar conjuntos de dados no disco do sistema aumenta o tamanho da camada e estende o tempo de parada.

  • Um processo dentro da instância não foi encerrado corretamente.

  • O alto uso de memória está impedindo a instância de responder ao comando de desligamento.

Dicas para acelerar a parada:

  • Antes de parar, use o recurso Save image para definir caminhos de exclusão para arquivos ou diretórios grandes que você não precisa salvar (como arquivos de modelo e conjuntos de dados). Isso pode reduzir significativamente o tempo de parada. Para obter detalhes, consulte o tópico sobre como salvar imagens de instâncias do DSW.

  • Armazene dados grandes em um caminho montado do OSS ou NAS em vez de no disco do sistema. Isso reduz fundamentalmente o tamanho da camada de leitura e gravação do contêiner.

  • Se você não precisa da instância e não se importa em preservar dados, Delete-a para liberar recursos imediatamente.

Se a parada estiver demorando muito, aguarde pacientemente. Se não for concluída após 2 horas, envie um ticket para o suporte técnico.

P: Meus dados e código serão perdidos após parar ou excluir uma instância do DSW?

A retenção de dados depende da operação e do tipo de grupo de recursos.

  • Parar a instância:

    A retenção de dados depende do tipo de grupo de recursos.

    • Instâncias com disco do sistema em disco de nuvem (a maioria dos tipos de pagamento conforme o uso e instâncias de recursos gerais com Disk selecionado): se o disco não tiver sido expandido e a instância estiver parada por mais de 15 dias, os dados serão limpos e não poderão ser recuperados. Se o disco tiver sido expandido ou a instância estiver parada por menos de 15 dias, os dados serão preservados.

    • Instâncias usando Temporary Storage como disco do sistema: os dados são armazenados em armazenamento efêmero. Parar a instância exclui os dados e eles não podem ser recuperados.

  • Excluir a instância:

    Todos os dados do disco do sistema são apagados permanentemente e não podem ser recuperados. Faça backup de todos os dados importantes antes de excluir.

P: Por que minha instância do DSW em execução parou automaticamente?

A instância tem uma política de desligamento automático por ociosidade configurada. Essa política foi projetada para conservar recursos e é ativada por padrão para instâncias de teste gratuito.

  • Condição de gatilho: A utilização da CPU e da GPU ficam abaixo do limiar configurado por 3 horas consecutivas.

  • Recomendações:

    • Parar manualmente: para salvar recursos de forma confiável, pare a instância manualmente quando não a estiver usando. Não há garantia de que a política de desligamento automático seja acionada todas as vezes.

    • Modificar a política: para tarefas de longa duração, modifique ou desative essa política. Etapas:

      1. Acesse a página de detalhes do workspace e clique em Configure Workspace > Scheduling Settings.

      2. Encontre a seção de configuração do DSW. Aqui você pode modificar a política de desligamento e a política de exclusão do DSW. Por exemplo, para desativar o desligamento automático para instâncias específicas, adicione-as à política de exclusão pelo nome da instância.

P: Parei ou excluí todas as minhas instâncias do DSW, mas elas ainda aparecem como "Running" ou ainda estou recebendo notificações de faturamento — por quê?

Verifique as seguintes causas comuns:

  • Você pode estar confundindo um pacote de recursos com uma instância. O status "Running" que você vê pode se referir a um pacote de recursos (como "250 horas de computação/mês"), e não a uma instância. Os pacotes de recursos permanecem ativos durante todo o seu período de validade, independentemente do estado da instância.

  • Um disco do sistema expandido ainda está sendo faturado. Parar uma instância apenas pausa as cobranças de computação. Um disco do sistema expandido continua a incorrer em cobranças de armazenamento.

  • O faturamento está atrasado. O faturamento não é em tempo real — as cobranças geradas pela manhã podem não aparecer na sua fatura até a tarde.

P: Posso usar uma API, código Python ou um gatilho pós-tarefa para parar automaticamente uma instância do DSW?

Os seguintes métodos de controle automático não são suportados:

  • Iniciar um processo de treinamento no DSW ou controlar a inicialização/parada da instância por meio de chamadas de API de ambientes externos, como o ECS.

  • Executar um comando de desligamento de dentro da instância usando código Python, como os.system.

  • Configurar a instância para parar automaticamente após a conclusão de uma tarefa.

O DSW suporta apenas a política de desligamento automático por ociosidade (duração mínima de ociosidade: 1 hora), que determina o estado de ociosidade com base na utilização da CPU/GPU. Essa política não pode garantir 100% de confiabilidade de gatilho. Pare a instância manualmente após a conclusão da sua tarefa para evitar cobranças inesperadas.

Faturamento

P: Por que ainda estou sendo cobrado após parar minha instância do DSW?

As cobranças após a parada são geralmente causadas por um dos seguintes motivos:

  • Cobranças de expansão do disco do sistema: Se você expandiu o disco do sistema ao criar a instância, a capacidade de armazenamento além do nível gratuito continua a ser faturada mesmo quando a instância está parada. Para interromper essas cobranças, faça backup dos seus dados e exclua a instância.

  • Cobranças de armazenamento do OSS: Se a instância tinha o OSS Standard Storage (localmente redundante) ou recursos semelhantes montados, esses custos de armazenamento continuam mesmo após a instância do DSW ser parada. Verifique e limpe quaisquer recursos de armazenamento associados.

  • Atraso no faturamento: As faturas de pagamento conforme o uso do DSW têm um atraso de 2 a 3 horas. As cobranças que aparecem logo após você parar uma instância são normais e não indicam faturamento contínuo.

Dica de solução de problemas: Alterne entre diferentes workspaces e regiões para confirmar que todas as instâncias em execução e recursos de armazenamento associados foram parados ou liberados.

P: Como o NAT gateway e o EIP usados para acesso à rede pública do DSW são faturados?

O NAT gateway e o EIP necessários para o acesso à rede pública do DSW são produtos independentes com faturamento separado — eles não estão incluídos nas cobranças da instância do DSW. O preço do NAT gateway varia de acordo com a região. Verifique a documentação de preços do NAT gateway para a sua região e selecione um plano de baixo custo adequado. Para obter mais informações sobre a configuração de acesso à rede pública, consulte Access services in an instance over the public network.

P: Posso usar uma instância ECS com GPU em vez do PAI-DSW?

Sim, você pode usar uma instância ECS com GPU para cargas de trabalho de IA em vez do PAI-DSW.

  • Diferença principal: O ECS exige que você mesmo configure o ambiente de desenvolvimento de IA (instalando drivers, frameworks, etc.). O PAI-DSW fornece imagens pré-construídas e um ambiente de desenvolvimento pronto para uso, reduzindo o esforço de configuração.

  • Considerações de faturamento: Ao usar o ECS, esteja ciente de que o tipo de instância, a largura de banda pública, o armazenamento em disco de nuvem e o NAT gateway são faturados separadamente — ao contrário do modelo de faturamento integrado do DSW. Avalie o custo total cuidadosamente.

P: Um plano de economia do PAI precisa ser liberado manualmente após expirar?

Não. Os planos de economia do PAI são produtos de gastos pré-pagos que expiram automaticamente — nenhuma liberação ou exclusão manual é necessária e nenhuma cobrança extra é incorrida. Se você receber um lembrete de expiração, mas não precisar mais do serviço, nenhuma ação é necessária. Se você ainda tiver instâncias do DSW em execução no PAI console que não usa mais, pare-as ou exclua-as para evitar cobranças de pagamento conforme o uso.

P: Como verifico se meu plano de economia ou cota de teste gratuito se esgotou?

Faça login no Billing and Cost console e acesse "My Subscriptions" para visualizar o saldo restante e a data de expiração do seu plano de economia. Se o saldo estiver esgotado ou o plano tiver expirado, o uso subsequente dos recursos do grupo de recursos compartilhados do DSW será faturado à taxa padrão de pagamento conforme o uso.

P: Como o DSW é faturado? Por que sou cobrado mesmo quando minha instância está em execução, mas não está executando código?

  • O DSW suporta faturamento por assinatura e pagamento conforme o uso. Para obter detalhes de faturamento, consulte DSW billing overview.

  • O faturamento de pagamento conforme o uso é baseado em quanto tempo a instância é executada. Como uma instância em execução ocupa continuamente recursos de computação, o faturamento começa assim que a instância entra no estado Running — independentemente de você ter um navegador aberto, estar logado no console ou estar executando código. Fechar o navegador ou fazer logout não para a instância. Para interromper o faturamento, acesse o PAI console e pare ou exclua a instância manualmente.

P: Como visualizo minha fatura do DSW?

Os usuários de pagamento conforme o uso podem acessar a página Billing and Cost e visualizar os detalhes de faturamento itemizados. Para obter detalhes, consulte View billing details.

P: Como interrompo todo o faturamento do DSW completamente?

  • A maneira mais completa de interromper todo o faturamento do DSW é excluir a instância. Faça backup de todos os dados antes de excluir — eles não podem ser recuperados após a exclusão da instância.

  • Alterne entre workspaces e regiões para garantir que todas as instâncias foram excluídas.

P: Como as cobranças são calculadas se eu usar uma instância do DSW de pagamento conforme o uso por menos de uma hora?

As instâncias de pagamento conforme o uso são faturadas por minuto. A fórmula é: Charge = (unit price ÷ 60) × actual service duration (minutes).

P: Estou recebendo um erro de "saldo insuficiente" ao criar uma instância do DSW — o que devo fazer?

A ativação do faturamento de pagamento conforme o uso requer um saldo mínimo em dinheiro de CNY 100 na conta. As cobranças reais são deduzidas da cota da conta primária gerenciada.

Pull de modelo

P: Falha no pull do modelo com: Failed to pull image "crpi-****-vpc.cn-hangzhou.personal.cr.aliyuncs.com/apo/cat:full"

Ao criar uma instância do DSW usando uma URL de registro de imagem privada, insira tanto o nome de usuário quanto a senha do registro ao especificar o endereço da imagem.

Gerenciamento de imagens

P: A criação da imagem falha com "insufficient capacity of ephemeral storage"

Causa: O processo de criação da imagem verifica se o espaço disponível restante no disco do sistema é maior que o tamanho da camada de gravação. Se não houver espaço suficiente, esse erro ocorre.

Solução: No Terminal do DSW, execute df -h para verificar o uso do disco. Certifique-se de que o espaço usado do overlay não exceda o espaço disponível de /dev/vda4. Se exceder, configure Custom Excluded Path ao salvar a imagem para excluir arquivos grandes.

/mnt/workspace> df -h
Filesystem      Size  Used Avail Use% Mounted on
overlay          98G   82G   17G  84% /
tmpfs            64M     0   64M   0% /dev
tmpfs            16G     0   16G   0% /sys/fs/cgroup
/dev/vda4        99G   31G   68G  32% /tmp
/dev/vdb         98G   82G   17G  84% /mnt/workspace
overlay          99G   31G   68G  32% /etc/dsw
tmpfs            16G     0   16G   0% /dev/shm
/dev/vda3       8.8G  4.4G  4.0G  53% /usr/bin/nvidia-smi
tmpfs            16G   12K   16G   1% /proc/driver/nvidia
overlay          98G   82G   17G  84% /usr/lib/x86_64-linux-gnu/libcuda.so.465.19.01
devtmpfs         16G     0   16G   0% /dev/nvidia0
tmpfs            16G     0   16G   0% /proc/acpi
tmpfs            16G     0   16G   0% /sys/firmware

Neste exemplo, o overlay usou 82 GB enquanto /dev/vda4 tem 68 GB de espaço livre. Como o uso do overlay excede o espaço livre disponível em /dev/vda4, você precisa configurar um caminho de exclusão personalizado para reduzir o tamanho da camada de gravação.

P: Como uso uma imagem Docker com o DSW?

  • Inicie uma instância do DSW com uma imagem Docker: envie sua imagem Docker para o Alibaba Cloud Container Registry (ACR), adicione-a como uma imagem personalizada no workspace do PAI e, em seguida, selecione-a ao criar uma instância do DSW.

  • Para empacotar o ambiente atual do DSW em uma imagem para iniciar outras instâncias ou implantar modelos, consulte Create a DSW instance image.

  • Para instalar e usar o Docker no IDE em nuvem do DSW (contêiner aninhado): este recurso é suportado apenas para instâncias do DSW criadas a partir de um "Lingjun resource group" ou um "general resource group". Para obter detalhes, consulte Manage sub-containers with DockerBoard e Use Docker in DSW.

P: Por que a criação da imagem do DSW falha ou atinge o tempo limite?

  • Imagem muito grande: uma única camada de imagem salva no DSW não deve exceder 10 GiB. Se exceder, a compilação falha. Reduza o tamanho da imagem e tente novamente.

  • Incompatibilidade de região: a instância do DSW e a instância do ACR devem estar na mesma região. Se estiverem em regiões diferentes, a criação da imagem não conseguirá encontrar o registro de destino.

  • Espaço insuficiente no disco do sistema: se o espaço disponível restante no disco do sistema for menor que os dados a serem gravados na camada da imagem, você receberá o erro "insufficient capacity of ephemeral storage".

  • Problemas de rede: com uma instância pessoal do ACR, as imagens são enviadas pela rede pública. Imagens grandes podem atingir o tempo limite devido à instabilidade da rede ou longos tempos de transferência. Uma instância empresarial do ACR na mesma VPC que a instância do DSW suporta envio pela rede interna, o que é mais rápido e confiável.

P: Por que o botão "Save image" está acinzentado, ou por que não consigo encontrar meu registro de imagem ao salvar?

  1. Estado incorreto da instância: o recurso Save image está disponível apenas para instâncias no estado Running. Se a instância estiver parada ou em outro estado, o botão ficará acinzentado.

  2. Pré-requisitos não atendidos ou mal configurados:

    • Uma instância do ACR na mesma região que a instância do DSW já deve existir, com um namespace e um repositório de imagens criados dentro dela.

    • Confirme se a instância do DSW e a instância do ACR estão exatamente na mesma região.

P: A criação da imagem falha com: Push image registry-vpc.cn-**.aliyuncs.com//lm-mirrors:** Failed: Push container failed, Container Name: dsw-notebook

Ao salvar uma imagem, certifique-se de que uma única camada de imagem não exceda 10 GiB — caso contrário, a compilação falhará. Para instâncias do DSW de grupo de recursos compartilhados, configure caminhos de exclusão personalizados para excluir arquivos ou diretórios da imagem final. Alternativamente, monte um caminho de armazenamento (como um caminho do OSS) e armazene dados lá para mantê-los fora da imagem.

P: A criação de imagem para o ACR empresarial falha com "Failed to login" — o que devo fazer?

Esse erro geralmente é causado por permissões incorretas do ACR ou credenciais inválidas. Solucione o problema com as seguintes etapas:

  1. Altere temporariamente o tipo de repositório de imagens para "Public" e teste novamente.

  2. Se o envio for bem-sucedido após mudar para público, o problema é de permissões. Verifique e corrija a política de controle de acesso do repositório privado e a autorização da conta.

  3. Se ainda falhar com um repositório público, verifique se a conta atual tem acesso de gravação à instância do ACR.

P: Ao reconstruir uma instância a partir de uma imagem, como a instância original é tratada e ela continua sendo faturada?

  • O disco do sistema de uma instância do PAI-DSW não suporta redução. Se você precisar alterar a configuração (por exemplo, para reduzir o disco), primeiro deve criar uma imagem personalizada a partir da instância original.

  • (Recomendado) Pare a instância original após a criação da imagem para evitar incorrer em mais cobranças de computação.

  • Após criar uma nova instância a partir da nova imagem e verificar se o ambiente funciona conforme o esperado, libere (exclua) a instância original para interromper o faturamento completamente.

P: Uma imagem personalizada precisa incluir um pacote de IDE como VS Code ou Jupyter?

Não. Uma imagem personalizada não é obrigada a incluir pacotes de IDE como VS Code ou Jupyter. Mesmo que estes não estejam instalados na imagem, o ambiente de IDE integrado ao console web do DSW ainda funciona normalmente.

Se você deseja que um IDE ou dependência específica seja pré-instalada por padrão na sua imagem, adicione o software relevante à imagem antes de salvá-la, ou instale-o manualmente após a inicialização da instância.

Expansão do disco do sistema

P: Qual é o tamanho do disco do sistema em uma instância do DSW e o que devo fazer quando ele está cheio?

Os arquivos e dados da instância do DSW são armazenados no disco do sistema por padrão, e uma cota de armazenamento gratuita é fornecida.

  • Verificar a cota gratuita

    As instâncias criadas em grupos de recursos públicos incluem uma cota gratuita de 100 GiB. Os recursos de computação de uso geral recebem o disco do sistema gratuito apenas após atender às especificações de recursos necessárias. Os recursos do Lingjun AI Computing não incluem um disco de nuvem gratuito. Para ver a cota gratuita exata, verifique a opção de disco do sistema na página de configuração da instância:

    1. Clique no nome da instância na lista de instâncias.

    2. No canto superior direito, clique em Change Settings e role para baixo para encontrar System Disk.

  • Verificar o uso do disco do sistema

    Clique no nome da instância do DSW e verifique o uso do disco do sistema na seção Environment information.

  • Expandir o disco do sistema quando estiver cheio

    Se o uso do disco do sistema exceder a cota gratuita, expand the system disk or mount a dataset.

P: O disco do sistema pode ser reduzido após a expansão?

Os discos do sistema do DSW não podem ser reduzidos após a expansão. Se uma instância existente do DSW tiver mais disco do sistema do que o necessário e você quiser fazer backup de dados importantes, use Mount a dataset, OSS, NAS, or CPFS para fazer backup dos seus dados no OSS. Você pode então excluir a instância para interromper o faturamento e criar uma nova com um tamanho de disco adequado.

Configuração de montagem

P: Como monto e uso meu próprio sistema de arquivos em uma instância do DSW?

Monte o OSS, NAS, CPFS ou Lingjun CPFS ao criar a instância e, em seguida, use o Terminal do DSW para navegar até o diretório de montagem e acessar seus arquivos.

O DSW suporta apenas a montagem de sistemas de arquivos na mesma região no momento da criação da instância. Para obter detalhes, consulte Create a DSW instance.

P: A montagem de um conjunto de dados NAS no PAI-DSW falha com "The specified MountTarget 3b79d4a2ac-xmk97.cn-shanghai.nas.aliyuncs.com is not in VPC vpc(VPC instance)"

  • Causa: um destino de montagem foi configurado quando o conjunto de dados NAS foi criado.

  • Solução: deixe o destino de montagem em branco ao criar o conjunto de dados.

P: A montagem do NAS em um servidor FTP baseado em ECS falha com "mount: wrong fs type, bad option, bad superblock"

  • Sintoma

    [root@iZufxxx file]# sudo mount -t nfs -o vers=4.0  3f8axxx-lfc99.cn-shanghai.nas.aliyuncs.com:/ /usr/sftp/file
    mount: wrong fs type, bad option, bad superblock on 3f8axxx-lfc99.cn-shanghai.nas.aliyuncs.com:/,
           missing codepage or helper program, or other error
           (for several filesystems (e.g. nfs, cifs) you might
           need a /sbin/mount.<type> helper program)
    
           In some cases useful info is found in syslog - try
           dmesg | tail or so.
    [root@iZufxxx file]#
  • Solução

    Instale o pacote nfs-utils antes de executar o comando mount.

    yum install nfs-utils

P: Após montar um conjunto de dados OSS, acessar o diretório de montagem retorna um "Input/output error"

root@dsw-xxx:/mnt/workspace# cd /mnt
root@dsw-xxx:/mnt# ls -ll
total 9
drw-rw-r--  0   99   99  512 Jan  1  1970 data
drwxr-xr-x  5 root root 4096 Dec 13 02:42 systemDisk
drwxr-xr-x  5 root root 4096 Dec 13 02:42 workspace
root@dsw-xxx:/mnt# cd data
root@dsw-xxx:/mnt/data# ls -ll
ls: reading directory '.': Input/output error
total 0
root@dsw-xxx:/mnt/data#

O erro é causado pela função não ter permissão de acesso ao OSS (AliyunPAIDLCAccessingOSSRole). Para obter as etapas de autorização, consulte Authorize the PAI service account.

P: Como reduzo o risco de falta de memória (OOM) ao montar um conjunto de dados OSS com o Jindo?

Após montar um conjunto de dados OSS, configure parâmetros avançados para reduzir o risco de OOM:

  • Opção 1: Use o Jindo 6.8.1, que inclui otimizações de memória.

    {
        "fs.jindo.fuse.pod.image.tag":"6.8.1"
    }
  • Opção 2: Use o ossfs.

    Especifique o seguinte ao enviar a tarefa:

    {
        "mountType": "ossfs"
    }

    Para reduzir ainda mais o risco de OOM, desative a otimização readdirplus para reduzir o consumo de cache de metadados ao listar o conteúdo do diretório:

    {
        "mountType": "ossfs",
        "fs.ossfs.args": "-oreaddirplus=false"
    }

P: Montei o OSS com sucesso, mas por que não consigo vê-lo no navegador de arquivos do JupyterLab?

O navegador de arquivos do DSW mostra o diretório de trabalho da instância, que é /mnt/workspace por padrão. O caminho de montagem que você especificou para o OSS (por exemplo, /mnt/data) está fora do diretório de trabalho padrão, portanto, não aparece na lista de arquivos.

Para acessar os arquivos montados:

  • Acesso via código: os arquivos são montados com sucesso. No seu código, use o caminho de montagem completo, por exemplo open('/mnt/data/my_file.csv').

  • Altere o ponto de montagem: defina o caminho de montagem para um subdiretório dentro do diretório de trabalho, por exemplo /mnt/workspace/my_oss_data. Após a montagem, a pasta my_oss_data aparece no navegador de arquivos.

  • Acesso via Terminal: execute cd /mnt/data no Terminal do DSW para navegar até o diretório de montagem e, em seguida, use ls e outros comandos para visualizar e gerenciar arquivos.

P: Ao usar um caminho OSS montado, meu programa retorna "Transport endpoint is not connected" ou "Input/output error"

Esses erros indicam que a conexão entre a instância do DSW e a montagem do OSS caiu. Causas comuns e etapas de solução de problemas:

  1. Permissões da função RAM: verifique se a função RAM configurada para a instância do DSW tem permissão de acesso ao OSS (por exemplo, AliyunPAIDLCAccessingOSSRole). Permissões insuficientes são uma causa comum de falhas de leitura do OSS.

  2. Recursos insuficientes do serviço de montagem: sob cargas de trabalho pesadas de leitura/gravação aleatória ou grandes quantidades de arquivos pequenos, o processo ossfs ou JindoFuse pode travar devido a condições de falta de memória (OOM). Nas Advanced settings da configuração de montagem, desative o cache de metadados ou aumente a alocação de memória. Para obter detalhes, consulte JindoFuse.

  3. Restaurar a conexão:

    • Para montagens configuradas na inicialização, reinicie a instância do DSW. O sistema remontará automaticamente.

    • Use o PAI SDK para executar um comando de montagem dinâmica e remontar o caminho sem reiniciar a instância.

P: Quais tipos de armazenamento o DSW suporta para montagem? Posso montar o Alibaba Cloud Drive ou tabelas do MaxCompute?

O DSW suporta OSS, NAS e CPFS por meio da criação de conjuntos de dados ou montagem de caminho direto.

  • O Alibaba Cloud Drive não é suportado: o DSW não suporta a montagem do Alibaba Cloud Drive pessoal. Armazene dados no OSS em vez disso.

  • As tabelas do MaxCompute não são suportadas para montagem direta: os dados da tabela do MaxCompute (anteriormente ODPS) não podem ser montados como um diretório de sistema de arquivos. Acesse-os a partir do código do DSW usando o PAI SDK ou API. Para obter detalhes, consulte Read and write MaxCompute tables with PyODPS.

P: Meu código e dados serão perdidos se eu parar ou excluir uma instância do DSW? Como persisto e migro dados?

O disco do sistema da instância do DSW é um armazenamento temporário. Para grupos de recursos públicos, os dados são limpos se a instância ficar parada por mais de 15 dias. Para grupos de recursos dedicados, os dados são limpos quando a instância é parada ou excluída.

Para persistir dados e código e migrar entre instâncias, use armazenamento montado externo.

  • Persistência: salve todos os dados, códigos e modelos importantes em um caminho montado do OSS ou NAS. Mesmo que a instância do DSW seja excluída, seus ativos permanecem seguros no seu próprio OSS ou NAS.

  • Migração: para mover dados de uma instância do DSW para outra, monte o mesmo caminho do OSS ou NAS na nova instância. Esta é a abordagem de migração mais direta.

P: Montei o OSS com sucesso, mas os arquivos no meu diretório de trabalho não aparecem no OSS

O caminho de montagem padrão do OSS é /mnt/data, enquanto o diretório de trabalho padrão do DSW é /mnt/workspace. Os arquivos no diretório de trabalho não são visíveis no OSS porque estão em um caminho diferente. Copie os arquivos do diretório de trabalho para /mnt/data para torná-los visíveis no OSS:

cp -r /mnt/workspace/. /mnt/data/

P: Como copio todos os dados de /mnt/workspace para um diretório de conjunto de dados montado?

Execute o seguinte comando no Terminal da instância do DSW:

cp -r /mnt/workspace/ /mnt/data/

/mnt/data é o caminho de montagem padrão do conjunto de dados. Este comando preserva a estrutura e o conteúdo originais do arquivo. Após a cópia, verifique o status da montagem e verifique os dados do OSS com:

mount | grep oss

Leitura, upload e download de dados

P: Como uso o **DSW** para ler dados do OSS?

Leia dados do OSS usando o Python SDK ou API. Para obter detalhes, consulte Read and write data in OSS.

P: Como faço o upload ou download de uma pasta?

O DSW não suporta o upload ou download de pastas diretamente. Comprima a pasta em um arquivo compactado primeiro. O Terminal do DSW fornece um ambiente Linux com ferramentas padrão como tar, gzip e unzip. O exemplo a seguir usa o tar.

  1. Execute tar --version para verificar se o tar está instalado. Se não estiver, instale-o:

    # For Debian-based systems (e.g., Ubuntu)
    sudo apt install tar
    
    # For Red Hat-based systems (e.g., CentOS, Fedora)
    sudo yum install tar
  2. Comprima ou extraia a pasta:

    # Compress a folder (/path/to/directory is the folder to compress)
    tar -cvf archive_name.tar /path/to/directory
    
    # Extract a folder
    tar -xvf archive_name.tar

P: Como transfiro ou compartilho dados entre duas instâncias do DSW?

Duas abordagens estão disponíveis:

P: Clicar em "Download" não tem efeito ou o download falha

Isso geralmente é causado por congestionamento de rede ou problemas no navegador. Tente o seguinte:

  1. Aguarde um momento. Arquivos grandes levam mais tempo para responder.

  2. Mude para um navegador diferente ou use o modo privativo (anônimo) do seu navegador.

  3. Para arquivos maiores que 200 MB ou em redes instáveis, baixe via um caminho OSS montado.

P: A área de preparação de transferência de arquivos está sem espaço

A área de preparação de transferência de arquivos tem uma capacidade total de 10 GB. Acesse a página de gerenciamento da área de preparação e clear staging area files para liberar espaço. Se a página não atualizar, tente atualizar o navegador.

P: Por que o upload sempre redireciona para a área de preparação de transferência de arquivos?

Este é o comportamento esperado. Para garantir a estabilidade e a velocidade do upload, todos os arquivos maiores que 10 MB são roteados automaticamente pela área de preparação de transferência de arquivos antes de serem salvos na sua instância.

P: A barra de progresso trava ou não responde ao fazer o upload de um arquivo grande pela área de preparação de transferência de arquivos — o que devo fazer?

  • Causa: Isso geralmente é causado por um ambiente de rede local instável, o que pode deixar o upload travado e a barra de progresso sem se mover, e às vezes causar uma falha na transferência.

  • Solução: Faça o upload do arquivo para o Object Storage Service (OSS) primeiro e, em seguida, monte ou leia os dados do OSS a partir da instância do DSW. Para obter orientações, consulte Mount and manage data sources.

P: Como faço o upload de um arquivo grande (como um modelo com mais de 5 GB) ou grandes volumes de dados para o DSW?

O disco do sistema da instância do DSW é limitado e temporário. Em vez de fazer o upload de arquivos grandes diretamente, faça o upload dos seus dados para o Alibaba Cloud Object Storage Service (OSS) primeiro e, em seguida, monte o OSS na instância do DSW. Para obter detalhes, consulte Mount a dataset, OSS, NAS, or CPFS.

P: Por que a criação da instância do DSW falha com o erro FAIL_TO_INIT_DATASET?

Quando o caminho de montagem do OSS aponta para um arquivo em vez de um diretório, o DSW detecta durante a etapa de criação da instância que o caminho não pode ser reconhecido como um diretório. Consequentemente, ele se recusa a inicializar o conjunto de dados e retorna o erro FAIL_TO_INIT_DATASET.

Para resolver isso, verifique se existe um arquivo com o mesmo nome no mesmo nível do caminho de montagem no OSS. Se existir, exclua o arquivo ou modifique o caminho do diretório de montagem para garantir que ele aponte para um diretório válido e, em seguida, recrie a instância.

Conexão remota à instância

P: A conexão do ProxyClient com uma instância do DSW cai com "client_loop: send disconnect: Broken pipe"

Ao se conectar a uma instância do DSW via SSH, uma conexão ociosa pode ser derrubada e o seguinte prompt aparece:

Welcome to PAI DSW!

(base) [root@dsw-367946-867cc4957c-phxnp ~]$FATA[0245] proxy-read:websocket: close 1006 (abnormal closure): unexpected EOF
                        client_loop: send disconnect: Broken pipe

Para uma conexão mais confiável, use Remote connection: Direct SSH connection.

P: A conexão remota via VS Code falha ao abrir uma pasta local

Isso geralmente é causado pelo cliente VS Code. Faça o upload dos arquivos locais para o DSW na nuvem. Para obter instruções, consulte Upload and download files.

P: A configuração de conexão direta SSH falha com "Failed to update private zone items: Failed to add zone"

O erro indica que o serviço de resolução de DNS interno não está ativado. Ative-o seguindo as etapas em Activate Private DNS.

P: A conexão do VS Code com o DSW falha com "the input device is not a TTY"

Esse erro geralmente é causado por uma configuração TTY ausente no servidor SSH. Para corrigi-lo:

  1. No Terminal da instância do DSW, edite /etc/ssh/sshd_config e adicione ou confirme a presença de PermitTTY yes.

  2. Salve o arquivo e execute sudo service ssh restart para reiniciar o serviço SSH.

  3. Reconecte-se usando o VS Code.

P: Posso chamar diretamente os recursos de GPU do PAI de um IDE externo para executar código?

Não. Tanto o DSW quanto o DLC exigem que o código seja executado no ambiente de nuvem. Chamar recursos de GPU do PAI diretamente de um IDE externo local via API não é suportado.

Use a conexão direta SSH para conectar um IDE local (como VS Code ou PyCharm) à instância do DSW para desenvolvimento, ou faça o upload do código para o DSW ou DLC para executá-lo. Para obter instruções de conexão SSH, consulte a seção "Conexão remota à instância" neste tópico.

Para mais problemas de conexão remota, consulte FAQ.

Problemas de rede

P: A velocidade de download da rede é muito lenta

As instâncias do DSW e DLC usam um gateway compartilhado por padrão. Os limites de largura de banda podem tornar a velocidade de download insuficiente para arquivos grandes. Para melhorar a velocidade de download:

P: Uma instância do DSW tem um endereço IP público?

As instâncias do DSW não têm um endereço IP público por padrão. Para acessar a internet ou permitir acesso externo à sua instância do DSW, configure um NAT gateway ou use um Elastic IP (EIP). Para obter detalhes, consulte Network configuration.

P: Ao expor uma instância do DSW via NAT gateway, vários serviços podem compartilhar a mesma porta pública?

Ao usar DSW custom services para expor APIs, todos os serviços personalizados roteados pelo mesmo NAT gateway devem usar portas públicas exclusivas — incluindo serviços em diferentes instâncias do DSW.

P: Por que minha instância do DSW não consegue acessar a internet?

As instâncias do DSW usam o Public Gateway para acessar a internet por padrão. Se o acesso à internet não estiver funcionando, verifique a página de configuração da instância para ver se o Internet Access Gateway está definido como Private Gateway. Se um gateway privado estiver selecionado, você deve configurar um Elastic IP (EIP) e uma entrada SNAT. Para obter detalhes, consulte Improve internet access with a private gateway. Caso contrário, mude para o gateway público.

P: Acessar o Hugging Face retorna um erro "Network is unreachable"

O pull de modelos no exterior (como modelos do huggingface.co) a partir de uma instância do DSW pode falhar devido a restrições de rede transfronteiriças. Para resolver isso, crie uma instância do Global Accelerator (GA) para habilitar o acesso à rede transfronteiriça para sua instância do DSW. Para obter detalhes, consulte Pull models or container images from overseas regions.

Instalação de bibliotecas de terceiros

P: Como uso bibliotecas de terceiros no **DSW**?

O DSW suporta a instalação de bibliotecas de terceiros. Para obter detalhes, consulte Manage third-party libraries.

P: Os pacotes instalados com pip e o código que escrevi serão perdidos após parar uma instância do DSW?

Não, se a instância usar um disco de nuvem como disco do sistema. Os dados do disco — incluindo os ambientes /mnt/workspace e /root — são preservados quando a instância é parada. Todos os ambientes e arquivos estão disponíveis quando a instância é reiniciada. Os dados só são totalmente excluídos quando a instância é excluída.

P: Por que um pacote de terceiros instalado não entra em vigor?

Após instalar um pacote com pip, se o import não conseguir encontrá-lo, reinicie o serviço ou o kernel primeiro. Se o erro persistir, verifique o ambiente Python ativo. O DSW instala pacotes no ambiente Python 3 por padrão. Para instalar em um ambiente diferente, mude para esse ambiente primeiro:

# Install into the Python 2 environment
source activate python2
pip install --user xxx

# Install into the TensorFlow 2.0 environment
source activate tf2
pip install --user xxx

Substitua xxx pelo nome do pacote a ser instalado.

P: Um comando pip install no DSW falha com um conflito de dependência ou erro de versão

Isso geralmente é causado por incompatibilidade de ambiente. Solucione o problema na seguinte ordem:

  1. Mude de imagem (recomendado): pare a instância atual, crie uma nova instância do DSW e selecione uma imagem oficial diferente. Por exemplo, se o PyTorch 2.1 não funcionar, tente a imagem do PyTorch 2.3 ou a série modelscope, que geralmente tem melhor compatibilidade.

  2. Instale uma versão específica: verifique a documentação do pacote para uma versão compatível com o seu ambiente DSW (versão Python/CUDA) e, em seguida, execute pip install package_name==x.y.z.

  3. Mude a fonte de download: tente um espelho como o espelho PyPI da Universidade Tsinghua: pip install -i https://pypi.tuna.tsinghua.edu.cn/simple <yourLibraryName>.

  • Diferenças de ambiente de imagem dedicada versus de uso geral: as imagens dedicadas (como a série isaaclab) são personalizadas para cenários específicos e podem causar inconsistências entre os ambientes Terminal e Notebook, módulos ausentes ou comportamento de comando diferente. Se você encontrar esses problemas, mude para uma imagem oficial de uso geral recomendada na documentação (como modelscope:1.26.0-pytorch2.6.0-gpu-py311-cu124-ubuntu22.04).

  • A instalação do plugin novnc falha com "exit status 100": esse erro geralmente é causado por um conflito de versão do turbovnc. Pare a instância atual e mude para uma imagem oficial com dependências pré-instaladas compatíveis (como modelscope:1.34.0-pytorch2.3.1tensorflow2.16.1-gpu-py311-cu121-ubuntu22.04) para evitar instabilidade do sistema devido a downgrades manuais de pacotes.

P: Instalei uma biblioteca no Terminal do DSW, mas o Jupyter Notebook não consegue importá-la

O Terminal e o Jupyter podem estar usando ambientes Python diferentes. Execute which python para confirmar qual ambiente Python está ativo, ou instale a biblioteca diretamente no Notebook, por exemplo:

!which python
/usr/local/bin/python

!pip install bottle
Looking in indexes: https://mirrors.aliyun.com/pypi/simple/
Collecting bottle
  Downloading https://mirrors.aliyun.com/pypi/packages/83/f6/b55...
                                            103.8/103.8 kB 6.7 ...
Installing collected packages: bottle
Successfully installed bottle-0.13.4
WARNING: Running pip as the 'root' user can result in broken per...

[notice] A new release of pip is available: 23.3.2 -> 25.1.1
[notice] To update, run: pip install --upgrade pip

P: Meu código diz que a versão do driver CUDA é muito baixa. Devo atualizar manualmente o driver NVIDIA no DSW?

Não atualize o driver. Os drivers e o CUDA da instância do DSW são pré-instalados e bloqueados. A modificação manual pode corromper a instância irremediavelmente. A abordagem correta é mudar a imagem do DSW: pare a instância atual, crie uma nova e selecione uma imagem oficial com uma versão superior do CUDA e do driver.

Por exemplo, a imagem oficial modelscope:1.9.4-pytorch2.0.1tensorflow2.13.0-gpu-py38-cu118-ubuntu20.04 inclui o CUDA 11.8 (indicado por cu118).

P: A imagem suporta GPU, mas meu código não consegue usá-la (torch.cuda.is_available() retorna False)

Este é um problema de invocação em tempo de execução, não uma incompatibilidade de versão do driver CUDA. Solucione o problema com as seguintes etapas:

  1. Verifique a lógica do código para confirmar se o modelo ou tensor tem como alvo explícito o dispositivo GPU usando .to('cuda') ou torch.device('cuda').

  2. Execute nvidia-smi no Terminal para verificar se o sistema detecta o dispositivo GPU.

  3. Reinicie a instância do DSW para redefinir a alocação de recursos da GPU.

  4. (Para Alibaba Cloud Linux 3) Se as etapas acima não resolverem o problema e o sistema for o Alibaba Cloud Linux 3, um problema de versão do systemd pode estar impedindo que os cgroups aloquem corretamente os dispositivos GPU. Execute sudo yum upgrade systemd no Terminal para atualizar o systemd e, em seguida, reinicie a instância.

P: Posso usar o Docker para implantar aplicativos dentro de uma instância do DSW?

Para recursos Lingjun, envie um ticket para ser adicionado à lista de permissões para uso do Docker. Para instâncias do DSW não-Lingjun, a execução do Docker dentro do contêiner da instância não é suportada.

P: A instância do DSW não tem unzip ou 7z. Como extraio arquivos?

Instale-os usando apt-get:

  • Instale o unzip: execute apt-get update && apt-get install -y unzip no Terminal e, em seguida, extraia com unzip your_file.zip.

  • Instale o p7zip (para 7z): execute apt-get update && apt-get install -y p7zip-full no Terminal e, em seguida, extraia com 7z x your_file.7z.

P: A instalação do pacote trava ou atinge o tempo limite

Travamentos na instalação, tempos limite ou velocidades muito lentas são geralmente causados por problemas de rede. Solucione o problema com as seguintes etapas:

Etapa 1: Verificar a conectividade de rede

Execute ping www.aliyun.com no Terminal para testar o acesso à internet. Se a rede estiver inacessível, prossiga para a etapa 2.

Etapa 2: Verificar a configuração do gateway

Na página de configuração da instância, verifique o tipo de Internet Access Gateway:

  • Gateway público: O DSW usa o Public Gateway por padrão. Verifique o tipo de gateway na página de configuração da instância. O gateway público tem limites de largura de banda que podem ser insuficientes para arquivos grandes — considere mudar para um gateway privado.

  • Gateway privado: o gateway privado fornece velocidades de rede mais altas, mas requer um NAT gateway público com um EIP e uma entrada SNAT configurados na VPC. Sem isso, a instância não consegue acessar a internet. Para obter detalhes, consulte Improve internet access with a private gateway.

Etapa 3: Mudar a fonte de download do pip

O DSW usa o espelho do Alibaba Cloud por padrão, que pode ser lento durante os horários de pico ou flutuações de rede. Tente mudar para outro espelho doméstico:

# Tsinghua University mirror (recommended)
pip install -i https://pypi.tuna.tsinghua.edu.cn/simple --trusted-host pypi.tuna.tsinghua.edu.cn <yourLibraryName>

# USTC mirror
pip install -i https://pypi.mirrors.ustc.edu.cn/simple --trusted-host pypi.mirrors.ustc.edu.cn <yourLibraryName>

# Douban mirror
pip install -i https://pypi.doubanio.com/simple --trusted-host pypi.doubanio.com <yourLibraryName>

Para alterar permanentemente a fonte padrão do pip, consulte View or change the pip source.

Etapa 4: Usar instalação offline

Se a rede estiver indisponível ou altamente instável, instale os pacotes offline:

  1. Em uma máquina local com uma boa conexão de rede, baixe o pacote .whl:

    # Run on the local machine
    pip download <yourLibraryName> -d ./packages
  2. Faça o upload do arquivo .whl para a instância do DSW. Para obter instruções de upload, consulte Upload and download files.

  3. Instale o pacote offline no DSW:

    pip install /path/to/your-package.whl

P: Como obtenho acesso root no WebIDE do DSW?

A maioria das imagens oficiais do DSW é executada como root por padrão. Se o prompt do Terminal mostrar root@..., você já está executando como root. O aviso "not recommended to run as root" do pip pode ser ignorado com segurança. Se sua imagem não usar login root, essa é uma configuração específica da imagem — mude para uma imagem que suporte acesso root.

P: Como inicio um servidor X no DSW?

O DSW não suporta a inicialização de um servidor X.

Implantação de modelo

P: Como implanto um modelo gerado pelo **DSW**?

  • Implantar com o EAS

    Após concluir o treinamento do modelo, implante-o como um serviço online usando o PAI-EAS. Para obter detalhes, consulte Deploy a model as an online service.

  • Baixar o modelo para implantação local

    Clique com o botão direito no modelo gerado pelo DSW para baixá-lo para sua máquina local.

Execução da instância

P: Por que sou solicitado a fazer login novamente após deixar a página ociosa por um tempo?

Por segurança, a sessão de login do DSW expira após 3 horas. Você precisará fazer login novamente após a expiração, mas isso não afeta nenhuma tarefa em execução. Para tarefas de longa duração, execute-as no Terminal do DSW usando o comando nohup para mantê-las em execução em segundo plano.

A duração do tempo limite da sessão atualmente não é configurável e o padrão é de 3 horas, portanto, você não pode modificar o tempo limite da sessão ou definir uma duração de desconexão.

P: Se eu fechar o navegador ou desligar meu computador, os trabalhos de treinamento no DSW continuarão em execução?

Sim. As instâncias do DSW são executadas na nuvem, portanto, fechar seu dispositivo local não afeta o estado delas. No entanto, algumas instâncias — especialmente as instâncias de teste gratuito — podem ter uma política de parada automática por ociosidade configurada. Se a utilização da CPU ou da GPU ficar abaixo de um determinado limiar por um período de tempo, o sistema pode tratar a instância como ociosa e pará-la automaticamente, interrompendo suas tarefas.

P: O DSW suporta destilação de modelo?

O DSW fornece apenas um ambiente de desenvolvimento baseado em nuvem e não oferece um recurso de destilação de modelo com um clique. Se você deseja realizar a destilação de modelo com um clique, pode usar o PAI Model Gallery. Para obter detalhes, consulte Model Distillation.

P: Por que o preenchimento automático de tab e outros recursos do bash não estão disponíveis no Terminal?

Algumas imagens têm restrições de uso. Digite bash no Terminal e pressione Enter para ativar os recursos do bash.

# bash
root@dsw-xxx-rxdxg:/mnt/workspace# ls
demos  lingxitest.tar
root@dsw-xxx-rxdxg:/mnt/workspace#

P: O que devo fazer se o tipo de instância do DSW não atender aos meus requisitos?

Atualize o tipo de instância seguindo estas etapas:

  1. Na lista de instâncias do DSW, clique no nome da instância para abrir a página de detalhes da instância.

  2. Na aba Instance Settings, clique em Change Settings.

  3. No painel Change Instance Settings, atualize o tipo de instância.

    Nota

    Se a instância estiver em execução quando você atualizar o tipo, a instância será reiniciada imediatamente. Certifique-se de ter salvo todo o trabalho na instância antes de prosseguir.

P: A utilização de memória está alta — como libero memória?

image Se o uso de memória estiver afetando as operações normais, use uma destas abordagens:

  • Se a memória estiver tão alta que você não consegue mais interagir via linha de comando, clique em Stop Instance no canto superior direito, ou volte para o DSW console e clique em Stop ao lado da instância. Aguarde a instância parar e, em seguida, reabra-a.

  • Se você ainda puder interagir via linha de comando, execute o top no Terminal da instância para visualizar o uso de memória por processo. %MEM mostra a porcentagem de memória e PID mostra o ID do processo.

    top – 10:40:20 up 22 min,  0 users,  load average: 0.95, 0.40, 0.15
    Tasks:  21 total,   2 running,  19 sleeping,   0 stopped,   0 zombie
    %Cpu(s): 12.9 us,  0.6 sy,  0.0 ni, 86.4 id,  0.0 wa,  0.0 hi,  0.0 si,  0.0 st
    MiB Mem :  16000.0 total,   5889.6 free,   8838.5 used,   1271.9 buff/cache
    MiB Swap:      0.0 total,      0.0 free,      0.0 used.   5889.6 avail Mem
    
      PID USER      PR  NI    VIRT    RES    SHR S  %CPU  %MEM     TIME+ COMMAND
      360 root      20   0 8992776   8.0g  17096 R 100.0  51.1   2:12.54 python
      207 root      20   0   11.2g 304160  50372 S   4.0   1.9   0:44.11 node
      106 root      20   0  288712 104764  18316 S   1.0   0.6   0:03.11 jupyter-lab
      122 root      20   0  638252 104652  32672 S   1.0   0.6   0:17.24 app
      244 root      20   0  648536  54848  37924 S   0.3   0.3   0:01.22 node
        1 root      20   0   10416   3828   3464 S   0.0   0.0   0:00.04 bash
       90 root      20   0   15420   3856   2240 S   0.0   0.0   0:00.00 sshd
       99 root      20   0   34500  25712  10688 S   0.0   0.2   0:00.48 supervisord
      100 root      20   0   16280   8612   5140 S   0.0   0.1   0:00.01 supervisor_stdo
      101 root      20   0   10420   3632   3300 S   0.0   0.0   0:00.00 launch_dswagent
      102 root      20   0   10420   3724   3384 S   0.0   0.0   0:00.00 launch_jupyterl
      103 root      20   0   10420   3628   3280 S   0.0   0.0   0:00.00 launch_code_ser
      105 root      20   0   29632  28416   1668 S   0.0   0.2   0:01.51 app
      154 root      20   0  721936  63232  37132 S   0.0   0.4   0:00.59 node
      172 root      20   0  995584 131364  41032 S   0.0   0.8   0:05.36 node
      218 root      20   0  848572  50384  37464 S   0.0   0.3   0:00.24 node
      256 root      20   0   10684   4468   3768 S   0.0   0.0   0:00.00 bash
      311 root      20   0  134328  50316  10432 S   0.0   0.3   0:00.93 python
      312 root      20   0  138020  54140  11004 S   0.0   0.3   0:01.06 python
     3670 root      20   0   10656   4368   3704 S   0.0   0.0   0:00.09 bash
     3694 root      20   0   13224   3980   3400 R   0.0   0.0   0:00.08 top

    Para encerrar um processo com alto uso de memória, execute:

    kill PID

    Substitua PID pelo ID do processo que deseja encerrar. A utilização de memória deve cair após a execução do comando.

    C 0.9%  M 4.3%

P: RuntimeError: CUDA error: too many resources requested for launch

Causa: Este erro significa que um kernel CUDA está solicitando mais recursos do que os disponíveis. Geralmente está relacionado aos limites de hardware da GPU.

Solução: Reinicie a instância e execute o programa novamente. Se o erro persistir, mude para uma instância de GPU com especificações superiores.

P: Posso criar um espaço de swap para usar memória virtual quando o DSW ficar sem memória?

O DSW é executado como um contêiner e não suporta a criação ou gerenciamento de espaço de swap pelos seguintes motivos:

  • Restrições de permissão: Os contêineres têm permissões de kernel limitadas e não podem montar arquivos de swap. Mesmo com acesso root dentro do contêiner, as políticas de recursos no nível do host não podem ser contornadas.

  • Política da plataforma: A plataforma gerencia e limita os recursos centralmente para garantir estabilidade e segurança em um ambiente multilocatário.

Se você estiver com pouca memória, otimize seu código ou atualize o tipo de instância.

P: Como soluciono e resolvo um erro de falta de memória (OOM) enquanto uma instância do DSW está em execução?

Quando uma instância do DSW relata um erro de falta de memória (OOM) ou o OOM killer do kernel encerra um processo, solucione o problema na seguinte ordem:

  1. No Terminal, execute top, pressione M para classificar os processos por uso de memória e use a coluna %MEM para identificar processos com alto uso de memória e seus PID valores.

  2. Confirme se o processo com alto uso de memória não é necessário e, em seguida, execute kill -9 <PID> para encerrá-lo. Substitua <PID> pelo ID do processo identificado na etapa anterior.

  3. Se a instância estiver travada ou não puder aceitar comandos porque a memória está esgotada, use o PAI console para Stop e, em seguida, inicie-a novamente. Parar a instância não exclui dados.

  4. Se a memória permanecer insuficiente, atualize o tipo de instância. Chame ListEcsSpecs para consultar os tipos de instância disponíveis e, em seguida, chame UpdateInstance para alterar o tipo de instância. Alternativamente, na página de detalhes da instância do DSW, abra a aba Instance Settings, clique em Change Settings e atualize o tipo de instância no painel Change Instance Settings. Antes de alterar a configuração de uma instância em execução, salve seu trabalho porque a alteração do tipo de instância a reinicia imediatamente.

  5. Reduza o uso de pico de memória no seu código diminuindo o tamanho do lote, usando acumulação de gradiente para preservar o tamanho efetivo do lote, excluindo variáveis desnecessárias com del e chamando gc.collect() para recuperar memória.

Perguntas frequentes relacionadas

Use as seguintes perguntas frequentes neste tópico para orientações complementares:

P: A VRAM de várias placas GPU pode ser combinada? Qual é o limite da VRAM de uma única GPU?

Não, a VRAM de várias placas GPU (por exemplo, 2 x A10) não pode ser simplesmente somada. A VRAM da GPU é fisicamente isolada — seu programa vê vários espaços de VRAM independentes, e não um grande pool combinado.

No modo de treinamento padrão, cada GPU deve carregar independentemente o conjunto completo de parâmetros do modelo, gradientes e estados do otimizador. Se um trabalho pode ser executado é, portanto, determinado pelo limite de VRAM de uma única GPU. Se a VRAM exigida pelo seu modelo exceder a capacidade de uma única GPU (por exemplo, 24 GB em uma única A10), o trabalho fica sem memória (CUDA out of memory) mesmo que várias placas GPU estejam conectadas.

P: O DSW suporta passthrough de GPU, carregamento do módulo nvidia-drm ou habilitação de comunicação P2P?

O DSW tem as seguintes limitações nesta área:

  • As instâncias de contêiner do DSW não suportam o carregamento do módulo de kernel nvidia-drm ou passthrough de GPU. Os recursos da GPU são montados apenas através de --gpus=all.

  • A comunicação P2P entre placas GPU é determinada pelo hardware subjacente. A plataforma não fornece uma opção no nível do usuário para habilitá-la. Se o nvidia-smi mostrar NS, o hardware atual não suporta comunicação P2P e ela não pode ser habilitada por software.

  • O PAI é um serviço gerenciado. Ele não suporta a instalação de drivers ou patches personalizados para habilitar a comunicação P2P — os drivers da GPU e a capacidade de comunicação subjacente são gerenciados uniformemente pela plataforma.

P: O VS Code mostra linhas onduladas vermelhas no código Python no DSW — o que devo fazer?

Linhas onduladas vermelhas podem aparecer no WebIDE do DSW (VS Code) mesmo quando a sintaxe está correta. Isso geralmente é um problema de análise específico do ambiente de IDE na nuvem. Siga estas etapas para diagnosticar o problema:

  1. Recorte e cole o código em um editor VS Code local para verificar se os erros aparecem lá. Isso confirma se o problema é específico do ambiente de IDE na nuvem.

  2. Se a verificação local estiver limpa, faça o upload novamente ou cole o código de volta no DSW.

  3. Se o problema persistir e estiver afetando seu desenvolvimento, envie um ticket para investigação adicional pelo suporte técnico do PAI.

P: Posso alterar a região de uma instância do DSW? Os dados migrarão automaticamente?

As instâncias do DSW não suportam a alteração de regiões ou zonas de disponibilidade, e os dados não migram automaticamente.

  • Para usar o DSW em uma região diferente, crie uma imagem personalizada a partir da instância atual na região original para fazer backup dos seus dados e, em seguida, crie uma nova instância a partir dessa imagem na região de destino.

  • Se a criação da instância falhar devido a recursos insuficientes, tente um tipo de instância diferente ou aguarde até que os recursos fiquem disponíveis. Isso não envolve uma mudança de região e seus dados não serão perdidos.

P: Como preservo os dados ao mudar uma instância do DSW para uma região diferente?

A abordagem depende da sua configuração de armazenamento:

  1. Sem armazenamento externo (apenas disco do sistema): Criar uma nova instância em uma região diferente sem um backup resultará em perda de dados. Crie primeiro uma imagem personalizada a partir da instância em execução na região original e, em seguida, crie uma nova instância a partir dessa imagem na região de destino para restaurar seu ambiente e dados.

  2. Armazenamento NAS/OSS montado: Seus dados existem independentemente da instância e não requerem um backup de imagem. Migre os dados no NAS/OSS diretamente para a região de destino.

P: O PAI-DSW suporta migração de workspace entre regiões com um clique?

O DSW não suporta importação com um clique entre regiões. Como alternativa, faça o upload de arquivos do workspace de origem para uma área de preparação de transferência de arquivos ou OSS e, em seguida, baixe-os ou monte-os em uma instância do DSW na região de destino.