Tous les produits
Search
Centre de documentation

Platform For AI:Créer une instance DSW

Dernière mise à jour :Aug 20, 2026

DSW (Data Science Workshop) fournit un environnement de développement intégré (IDE) basé sur le cloud pour le développement de l'IA. Les développeurs familiers avec Notebook ou VS Code peuvent commencer immédiatement le développement de modèles. Cette rubrique explique comment créer une instance DSW et comment résoudre les problèmes courants qui surviennent lors du démarrage ou de la libération des instances.

Démarrage rapide

  1. Connectez-vous à la console PAI, sélectionnez la Region cible Region, cliquez sur Workspaces Workspaces et accédez à l'espace de travail cible.

  2. Dans le volet de navigation de gauche, choisissez Interactive Modeling (DSW) Interactive Modeling (DSW) > Create Instance Create Instance. Configurez les paramètres clés suivants et laissez les autres par défaut. Pour tous les paramètres, consultez la Référence des paramètres de la console.

    Parameter

    Description

    Instance Name

    Exemple : dsw_test.

    Resource Type

    Sélectionnez Public Resources, qui utilise la facturation au paiement à l'utilisation.

    Instance Type

    Sélectionnez une spécification telle que ecs.gn7i-c8g1,2xlarge (1 GPU A10, 8 vCPU, 30 GiB de mémoire).

    Si cette spécification est en rupture de stock, essayez une autre spécification dans la liste ou changez de région.

    Image config

    Sélectionnez Alibaba Cloud Image, puis recherchez et sélectionnez modelscope:1.31.0-pytorch2.8.0-gpu-py311-cu124-ubuntu22,04 (Python 3.11, CUDA 12.4).

    Les images ModelScope incluent un large ensemble de bibliothèques tierces intégrées et sont compatibles avec la plupart des flux de travail de développement IA.

    Cliquez sur OK OK pour créer l'instance. Lorsque le statut de l'instance passe à Running Running, l'instance est créée avec succès.

    Si l'instance ne démarre pas, consultez Démarrage de l'instance DSW .
  3. Sur la page de liste des instances DSW, cliquez sur Open Open sous la colonne Actions Actions pour ouvrir l'instance DSW et commencer à développer votre modèle.

    Pour plus de détails sur l'interface de l'instance DSW, ainsi que sur la manière d'arrêter, de libérer ou de modifier une instance DSW, consultez Accéder et gérer les instances DSW.

    Important
    • Pour les instances DSW créées à l'aide de ressources publiques, la facturation commence dès que le statut de l'instance passe à Running Running—même si vous n'ouvrez pas l'IDE basé sur le web ni n'exécutez de code.

    • La fermeture du navigateur ou la déconnexion n'arrête pas l'instance et ne met pas en pause la facturation.

    • Si vous utilisez un bon de ressource d'essai gratuit, le système passe automatiquement à la facturation au paiement à l'utilisation une fois le quota épuisé. L'instance ne s'arrête pas automatiquement.

  4. Arrêtez l'instance. Lorsque vous avez terminé votre travail de développement et que vous n'avez plus besoin de l'instance DSW, retournez à la page de liste des instances DSW :

    • Pour mettre l'instance en pause temporairement, cliquez sur Stop Stop. Si le disque système a été étendu, les frais de stockage pour le disque système continuent même après l'arrêt de l'instance.

      Important

      Par défaut, les données sont stockées sur un disque cloud gratuit. Si l'instance est arrêtée pendant plus de 15 jours, le contenu du disque cloud est effacé et ne peut pas être récupéré. Les instances avec un disque système étendu ne sont pas soumises à cette limite.

    • Pour supprimer définitivement l'instance, cliquez sur More More > Delete Delete. Cela arrête toute facturation. Sauvegardez toutes les données importantes avant la suppression, car les données supprimées ne peuvent pas être récupérées.

    Important

    Les factures DSW au paiement à l'utilisation sont générées toutes les heures avec un délai de 2 à 3 heures. Après l'arrêt ou la suppression d'une instance, vous pouvez encore recevoir des notifications de frais pendant quelques heures pour l'utilisation encourue avant l'action. Il s'agit d'un comportement de facturation normal et n'indique pas de doubles facturations.

Configurations typiques des cas d'utilisation

La configuration par défaut de l'instance DSW peut ne pas répondre à toutes les exigences de développement IA. Le tableau suivant résume les configurations pour les scénarios courants :

Scenario

Challenge

Configuration

Reference

Stockage persistant du code et des données

Le disque système de l'instance DSW est temporaire—les données sont effacées lorsque l'instance est supprimée ou arrêtée pendant une période prolongée. Vous avez besoin d'un stockage à long terme pour les fichiers importants, ou pour partager des données entre plusieurs instances.

Montez le stockage cloud (tel que Object Storage Service (OSS)) dans un répertoire spécifique de l'instance en utilisant Dataset Mounting Dataset Mounting ou Mount storage Mount storage.

Monter un dataset, OSS, NAS ou CPFS

Vitesses de téléchargement Internet public plus rapides

L'instance DSW utilise une passerelle partagée par défaut, ce qui limite la bande passante. Cela peut ralentir les téléchargements de fichiers volumineux.

Dans les paramètres réseau, configurez un Virtual Private Cloud (VPC) et utilisez Private Gateway Private Gateway. Vous devez également créer une passerelle NAT et une EIP (adresse IP élastique) pour le VPC.

Améliorer l'accès Internet avec une passerelle privée

Développement distant basé sur SSH

Vous préférez utiliser des outils locaux tels que VS Code ou PyCharm pour le développement et le débogage, et ne souhaitez pas être limité à l'IDE basé sur le web.

Dans les paramètres d'accès, activez Enable SSH Enable SSH, renseignez SSH Public Key SSH Public Key et sélectionnez Access over Internet Access over Internet. Associez une passerelle NAT et une EIP existantes.

Connexion distante : Connexion SSH directe

Accès aux services Web à l'intérieur de l'instance

Vous souhaitez exposer une application Web s'exécutant dans l'instance sur Internet afin qu'elle puisse être consultée ou partagée via une URL.

Dans les paramètres d'accès, ajoutez un Custom Services Custom Services, configurez le port du service et activez l'accès public. Vous devez également ajouter une règle entrante dans le groupe de sécurité pour autoriser le trafic sur ce port.

Accéder aux services d'une instance via le réseau public

Référence des paramètres de la console

Informations de base

Parameter

Description

Instance Name Instance Name

Configurez le nom de l'instance en suivant les instructions à l'écran.

Tag Tag

Ajoutez des libellés aux instances pour la découverte multidimensionnelle des ressources, le regroupement, les opérations par lots et l'allocation des coûts.

Informations sur les ressources

Parameter

Description

Resource Type

  • Public Resources : Facturation au paiement à l'utilisation. Ne peut pas être converti en facturation par abonnement (annuelle/mensuelle).

    Remarque

    Limite de cartes GPU : Lors de l'utilisation de ressources publiques, chaque compte Alibaba Cloud (compte principal) est limité à 2 cartes GPU par région. Le dépassement de cette limite peut provoquer des erreurs. Pour augmenter la limite, soumettez un ticket.

    • Instance Type : Choisissez parmi les spécifications GPU, CPU ou d'essai gratuit. Pour les détails des spécifications, consultez Aperçu des familles d'instances.

    • Bidding Purchase : Utilisez une instance préemptible pour réduire les coûts d'exécution. Si No preemptible instances in stock s'affiche, essayez une autre spécification.

      Ce paramètre est actuellement pris en charge dans les régions suivantes : Chine (Hangzhou), Chine (Shanghai), Chine (Beijing), Chine (Ulanqab), Chine (Shenzhen), Chine (Guangzhou), Japon (Tokyo) et Singapour.

    • Driver Settings : Définissez la version du pilote pour les instances GPU utilisant des ressources publiques. Les versions majeures de pilotes prises en charge varient selon le type de GPU.

  • Resource Quota : Facturation par abonnement (annuelle/mensuelle).

    • Resource Quota : Choisissez parmi les ressources de calcul générales ou les ressources de calcul Lingjun. Si aucune ressource n'est disponible, cliquez sur Associate Resource Quota pour configurer.

    • Instance Type : Définissez le GPU, le CPU et la mémoire en fonction de vos besoins.

      Le tableau suivant décrit les modèles de GPU et les familles d'instances correspondantes prises en charge par DSW :

      GPU model

      Instance family

      Example specifications

      NVIDIA A10

      gn7i

      ecs.gn7i-c8g1,2xlarge, ecs.gn7i-c16g1,4xlarge, ecs.gn7i-c32g1,8xlarge, ecs.gn7i-c32g1,16xlarge

      NVIDIA L20

      gn8is

      ecs.gn8is.2xlarge, ecs.gn8is.4xlarge, ecs.gn8is.2x.8xlarge, ecs.gn8is.4x.16xlarge

      GPU H (96 GiB de mémoire GPU)

      gn8v

      ecs.gn8v.4xlarge, ecs.gn8v.6xlarge, ecs.gn8v.2x.8xlarge, ecs.gn8v.2x.12xlarge, ecs.gn8v.4x.8xlarge, ecs.gn8v.4x.24xlarge

      NVIDIA V100

      gn6v/gn6e

      -

      NVIDIA T4

      gn6i

      -

      NVIDIA P100

      gn5

      -

      GU100

      gn7e

      -

      NVIDIA Quadro RTX6000

      ebmgn6g

      -

      Remarque

      DSW ne prend pas en charge les instances GPU des modèles H100 ou H800.

    • Priority : La priorité va de 1 à 9. Une valeur plus élevée indique une priorité plus élevée.

    • Idle Resources : La tâche peut s'exécuter sur des ressources inactives dans les quotas actuels ou autres sous le compte, améliorant ainsi l'utilisation des ressources. Lorsque ces ressources sont nécessaires pour les tâches du quota d'origine, la tâche en temps d'inactivité est terminée et les ressources sont retournées automatiquement. Enregistrez régulièrement votre environnement et vos données pendant le développement.

      • Acceptable : La tâche peut utiliser les ressources de calcul inactives des quotas actuels ou autres sous le compte.

      • Only : La tâche utilise uniquement les ressources inactives sous le compte et ne consomme pas son propre quota.

    • Node-Specific Scheduling : Sélectionnez un nœud spécifique pour créer l'instance DSW.

    • CPU Affinity : Liez les processus dans un conteneur ou un Pod à des cœurs CPU spécifiques. Cela réduit les échecs de cache CPU et les changements de contexte, améliorant l'utilisation du CPU et les performances de l'application. Adapté aux charges de travail sensibles aux performances et en temps réel. Actuellement pris en charge uniquement en Chine (Beijing) et en Chine (Shenzhen).

    • Driver Settings : Définissez la version du pilote pour les instances GPU utilisant des quotas de ressources de calcul Lingjun. Les versions majeures de pilotes prises en charge varient selon le type de GPU.

Informations sur l'environnement

Paramètre

Description

Image Configuration

Les types d'images suivants sont pris en charge :

  • Alibaba Cloud Image : PAI fournit des images officielles pour les frameworks open source courants et les versions Python. Par exemple, pytorch:2.4.1-gpu-py312-cu124-ubuntu22,04 indique PyTorch 2.4.1, pour les instances GPU, Python 3.12 et CUDA 12.4.

    Pour trouver une version spécifique, effectuez une recherche par mot-clé dans la zone de recherche. Par exemple, recherchez cu124 pour trouver des images avec CUDA 12.4.

  • Custom Image : Utilisez une image personnalisée ajoutée à PAI. Le référentiel d'images doit être configuré avec un accès en lecture public, ou l'image doit être stockée dans Container Registry (ACR). Pour plus de détails, consultez la section Images personnalisées.

  • Image Address : Prend en charge les adresses d'images personnalisées ou officielles accessibles via Internet public.

    • Pour améliorer la vitesse de téléchargement de l'image, consultez la section Accélération des images.

    • Pour les adresses d'images privées, cliquez sur Saisir le nom d'utilisateur et le mot de passe et configurez les identifiants du référentiel, ou définissez temporairement le référentiel avec un accès en lecture public.

System Disk

Utilisé pour stocker des fichiers pendant le développement. Lorsque le Resource Type est défini sur Public Resources, ou lorsque le Resource Quota utilise une ressource de calcul générale par abonnement (au moins 2 cœurs CPU et 4 GiB de mémoire, ou avec GPU), chaque instance inclut un disque cloud gratuit de 100 GiB en tant que disque système. Le disque peut être étendu ; consultez la console pour les tarifs.

Avertissement
  • Si vous utilisez uniquement le disque cloud gratuit, le contenu du disque est effacé si l'instance est arrêtée pendant plus de 15 jours.

  • Après l'extension du disque, l'intégralité du disque cloud (gratuit + payant) n'est plus soumise à la règle d'arrêt et d'effacement après 15 jours. Cependant, la partie étendue entraîne des frais continus jusqu'à la suppression de l'instance.

  • L'extension du disque est irréversible. Étendez-le uniquement selon vos besoins.

  • Le disque cloud est libéré lors de la suppression de l'instance. Sauvegardez les données importantes avant de supprimer l'instance.

Pour un stockage persistant, configurez le Dataset Mounting ou le Mount storage.

Dataset Mounting

Stockez des jeux de données pour la lecture ou conservez les fichiers générés pendant le développement. Les types de jeux de données suivants sont pris en charge :

  • Custom Dataset : Créez un jeu de données personnalisé pour stocker les fichiers de données d'entraînement. Prend en charge l'accès en lecture seule et la sélection de version.

  • Public Dataset : PAI fournit des jeux de données publics préconfigurés. Seul le mode de montage en lecture seule est pris en charge.

Mount Path : Chemin où le jeu de données est monté dans DSW, par exemple /mnt/data. Accédez à ce chemin dans votre code pour récupérer les fichiers du jeu de données.

Remarque
  • Plusieurs jeux de données ne peuvent pas partager le même chemin de montage.

  • Si un jeu de données CPFS est configuré, une configuration réseau est requise et le VPC sélectionné doit correspondre au VPC CPFS. Sinon, la création de l'instance DSW peut échouer.

  • Lorsqu'un groupe de ressources dédié est sélectionné, le premier jeu de données doit être un jeu de données NAS et sera monté à la fois sur le chemin que vous avez spécifié et sur le répertoire de travail par défaut de DSW /mnt/workspace/.

Pour plus de détails sur le montage, consultez la section Monter un jeu de données, OSS, NAS ou CPFS.

Mount storage

Montez le stockage pour lire des jeux de données ou conserver les fichiers générés pendant le développement.

Pour plus de détails sur le montage, consultez la section Monter un jeu de données, OSS, NAS ou CPFS.

Enable Multi-Container Isolation (DinD)

Une fois activée, cette option permet de créer plusieurs sous-conteneurs isolés au sein de l'instance actuelle. Cette fonctionnalité convient au partage d'instances DSW entre plusieurs utilisateurs. Pour plus de détails, consultez la section Gestion des sous-conteneurs (DockerBoard).

Working Directory

Disponible lorsque les ressources publiques sont sélectionnées. Le répertoire de travail correspond au chemin de démarrage pour Notebook et l'IDE basé sur le web, et sa valeur par défaut est /mnt/workspace.

Autres configurations

Paramètre

Description

Custom Startup Script

Exécutez des scripts personnalisés lors du démarrage de l'instance pour configurer l'environnement ou effectuer des tâches d'initialisation. Le script s'exécute après que l'image et les ressources sont prêtes, mais avant le démarrage des applications de développement telles que JupyterLab et Code Server.

Remarque
  • Délai d'expiration de 3 minutes : Les scripts personnalisés augmentent le temps de démarrage de l'instance. Le délai d'expiration est de 3 minutes ; n'utilisez pas de scripts pour des tâches de longue durée telles que le téléchargement d'images.

  • Journaux d'exécution du script : Après le démarrage de l'instance, retrouvez les journaux du script sous /var/log/user-command/.

Environment Variable

Appliquée au démarrage du conteneur principal, aux processus système et aux processus utilisateur. Ajoutez des variables d'environnement personnalisées ou remplacez les valeurs par défaut du système selon vos besoins.

Remarque : Évitez de modifier les variables d'environnement suivantes :

# Changes will not take effect
USER_NAME # This will be overwritten by the logic in the service

# System variables that should not be modified, as changes may affect normal operation
JUPYTER_NAME: Defaulted to a value constructed from instance information; can be used to modify the URL access path for JupyterLab.
JUPYTER_COMMAND: The command to start Jupyter; defaulted to "lab" to launch JupyterLab.
JUPYTER_SERVER_ADDR: The listening address for the JupyterLab service; defaulted to 0.0.0.0.
JUPYTER_SERVER_PORT: The listening port for the JupyterLab service; defaulted to 8088.
JUPYTER_SERVER_AUTH: The access password for JupyterLab; defaulted to empty.
JUPYTER_SERVER_ROOT: The working directory for Jupyter; has lower priority than WORKSPACE_DIR.
CODE_SERVER_ADDR: The listening address for the code-server service; defaulted to 0.0.0.0.
CODE_SERVER_PORT: The listening port for the code-server service; defaulted to 8082.
CODE_SERVER_AUTH: The access password for code-server; defaulted to empty.
WORKSPACE_DIR: This environment variable is set based on the workspace directory parameter configured when the instance is created. It can change the startup directory for Jupyter and code-server. An error may occur if the specified path does not exist.

Advanced Configurations

La configuration avancée vous permet d'ajuster les paramètres du noyau requis pour certaines charges de travail. Actuellement prise en charge uniquement pour les instances de groupe de ressources Lingjun. Pour plus de détails sur les paramètres, consultez le tableau ci-dessous.

Paramètre de configuration avancée

Description

Valeur d'exemple

VmMaxMapCount

Définit le nombre maximal de régions mappées en mémoire qu'un processus peut avoir. Valeur par défaut : 65530. Les valeurs inférieures à 65530 n'ont aucun effet ; des valeurs excessivement élevées peuvent gaspiller de la mémoire.

1024000

EnableNvidiaIBGDA

Active IBGDA lors du chargement du pilote GPU. Requis pour DeepEP.

true

EnableNvidiaGDRCopy

Installe le module noyau GDRCopy (version 2.4.4). Requis pour DeepEP.

true

VpmuFeature

Active les capacités d'analyse des points chauds du CPU asys. Valeurs valides : 0, 1, 2. Par défaut : 0 (désactivé) ; 1 (partiel) ; 2 (complet). L'activation de VPMU peut avoir un impact sur les performances ; activez-la uniquement si nécessaire.

2

EnableVcpuTier

Active l'optimisation d'épinglage des CPU RunD. Par défaut : false. Cela permet aux vCPU RunD d'être planifiés rapidement sur les cœurs CPU disponibles par le noyau, mais peut provoquer des conflits de planification et des interférences HyperThread. Les conditions suivantes doivent également être remplies :

  1. L'instance doit être une instance carte complète (aucune autre instance ou tâche sur le nœud).

  2. Nombre de CPU >= 4 × nombre de GPU.

  3. Le nombre de CPU doit être pair.

true

VcpuTierHighCPU

Spécifie manuellement HighCPU après l'activation de EnableVcpuTier. Si non spécifié, la valeur par défaut correspond au nombre de GPU par worker (par exemple, 8 ou 16). La valeur doit se situer dans la plage [nombre de GPU, nombre de CPU / 2).

4

Informations réseau

Paramètre

Description

VPC Settings

Disponible uniquement lorsque le Resource Type est défini sur Public Resources.

Pour utiliser une instance DSW au sein d'un VPC, créez un VPC dans la même région que l'instance DSW et configurez ce paramètre. Vous devez également configurer le vSwitch et le Security Group. Pour les stratégies de configuration adaptées à différents scénarios, consultez la section Configuration réseau.

vSwitch

Disponible lorsqu'un VPC est configuré. Un vSwitch est un sous-réseau au sein du VPC. Votre instance DSW et les autres ressources cloud se connectent via le vSwitch.

Security Group

Requis lorsqu'un VPC est configuré. Le groupe de sécurité agit comme un pare-feu virtuel pour l'instance DSW, contrôlant tout le trafic réseau entrant et sortant.

Internet Access Gateway

Les méthodes de configuration suivantes sont prises en charge :

  • Public Gateway : La passerelle publique présente des limitations de bande passante qui peuvent ne pas répondre aux exigences lors d'une forte concurrence ou de téléchargements de fichiers volumineux.

  • Private Gateway : Pour contourner les limites de bande passante de la passerelle publique, créez une passerelle NAT publique dans le VPC DSW, associez une EIP et configurez des entrées SNAT. Pour plus de détails, consultez la section Améliorer l'accès Internet avec une passerelle privée.

Le paramètre suivant est disponible uniquement lorsque la Mount Configuration utilise un jeu de données CPFS :

  • Activer toutes les options : Désactivé par défaut. Lorsqu'il est désactivé, le système désactive les VPC incompatibles avec les jeux de données CPFS.

Remarque

Si un jeu de données CPFS est sélectionné dans la configuration de montage, la configuration du VPC est requise et le VPC doit correspondre au VPC CPFS.

Extended CIDR Block

Disponible après la configuration du vSwitch. Utilisez un bloc CIDR étendu pour augmenter l'espace d'adressage du VPC lorsque les adresses IP disponibles sont insuffisantes pour les charges de travail croissantes, ou lorsque la planification réseau initiale n'a pas alloué suffisamment d'adresses. Pour plus de détails, consultez la section Blocs CIDR secondaires.

Configuration d'accès

Paramètre

Description

Enable SSH

Active l'accès SSH distant à l'instance. Disponible après la sélection d'un VPC. Une fois activé, un Custom Services nommé SSH apparaît. Si vous utilisez une image personnalisée, assurez-vous que sshd est installé.

SSH Public Key

Disponible après l'activation du bouton bascule SSH Configuration.

Remarque

Pour prendre en charge à la fois la connexion basée sur le VPC et la connexion via Internet public, ajoutez des clés publiques pour plusieurs clients. Ajoutez les clés une par ligne (en appuyant sur Entrée entre chacune). Jusqu'à 10 clés publiques sont prises en charge.

Service Access and Port Configuration

Utilisé pour configurer l'accès distant SSH ou Accéder aux services d'une instance via le réseau public.

  • Listener Port : Port sur lequel le service exécuté dans l'instance DSW écoute.

  • Service Access Method :

    • Access over VPC : Pris en charge par défaut. Accédez aux services de l'instance DSW depuis d'autres points de terminaison au sein du VPC (tels que ECS).

    • Access over Internet : Sélectionnez cette option pour ajouter un accès Internet public. Vous devez également configurer la NAT Gateway et l'EIP.

  • Internet Access Port : Port exposé pour l'accès Internet public.

Create Private Zone in VPC

Créez une Private Zone (nom de domaine interne faisant autorité) pour accéder au service SSH de l'instance ou à d'autres services personnalisés au sein du VPC à l'aide d'un nom de domaine fixe, au lieu de suivre une adresse IP d'instance changeante. Remarque : la création d'une Private Zone entraîne des frais. Pour les tarifs, consultez la section Tarification d'Alibaba Cloud DNS.

Public Network Access

NLB :

  • NLB Instance Resource Group : Sélectionnez le groupe de ressources où réside l'instance NLB.

  • NLB Instance : Sélectionnez l'instance NLB dans le même VPC que l'instance DSW.

DNAT + EIP :

  • NAT Gateway : Mappe les requêtes Internet public (EIP:port) vers l'instance DSW privée (adresse IP privée:port).

  • EIP : Fournit l'adresse IP publique pour accéder aux services de l'instance via Internet.

Rôles et autorisations

Paramètre

Description

Visibility

Sélectionnez Visible to the Instance Owner ou Visible to Current Workspace.

Instance Owner

Seuls les administrateurs de l'espace de travail peuvent modifier le propriétaire de l'instance.

Show More

Paramètre

Description

Instance RAM Role

Associez un rôle RAM à une instance DSW pour accéder à d'autres ressources cloud depuis l'instance. Cette approche utilise des identifiants temporaires Security Token Service (STS), ce qui élimine la nécessité de configurer des AccessKeys à long terme et réduit le risque de fuite d'identifiants.

Le rôle RAM de l'instance peut être configuré comme suit :

  • Default Roles of PAI : accorde l'accès aux produits internes PAI, à MaxCompute et à OSS. Les identifiants temporaires délivrés sous ce rôle accordent les mêmes autorisations que le propriétaire de l'instance DSW lors de l'accès aux produits PAI et aux tables MaxCompute, et n'autorisent l'accès qu'au bucket de stockage par défaut configuré pour l'espace de travail actuel lors de l'accès à OSS.

  • Custom Roles : configurez un rôle personnalisé lorsque vous avez besoin d'une gestion fine ou personnalisée des autorisations.

  • Does Not Associate Role : ne sélectionnez aucun rôle si vous souhaitez accéder directement à d'autres produits cloud à l'aide d'une AccessKey.

Pour plus de détails sur la configuration du rôle RAM de l'instance, consultez la rubrique Configurer un rôle RAM pour une instance DSW.

FAQ

Démarrage de l'instance DSW

Q : L'instance DSW ne démarre pas

Dépannage : cliquez sur le nom de l'instance et vérifiez le message d'erreur dans l'onglet Events.

Erreurs courantes et solutions :

  • Your requested resource type [ecs.**] is not enough currently, please try other regions or other resource types

    • Cause : le type de ressource sélectionné est en rupture de stock dans cette région.

    • Solution : réessayez ultérieurement ou basculez vers un autre type de ressource ou une autre région.

  • Your resource usage has exceeded the default limitation. Please contact us via ticket system to raise the limitation.

    • Cause : chaque compte Alibaba Cloud (compte principal) peut créer au maximum 2 instances GPU par région à la fois. La sélection d'un type de ressource avec plus de 2 GPU échouera.

    • Solution : pour augmenter votre quota, soumettez un ticket.

  • the available zone with vSwitch is out of stock

    • Cause : lorsqu'un vSwitch VPC est configuré, la recherche de ressources est limitée à la zone de disponibilité de ce vSwitch, ce qui peut entraîner des pénuries de ressources.

    • Solution :

      1. Créez le vSwitch et l'instance DSW dans une autre zone de disponibilité.

      2. Essayez un autre type d'instance DSW.

  • Sales of this resource are temporarily suspended in the specified zone. We recommend that you use the multi-zone creation function to avoid the risk of insufficient resource.

    Les ventes de ressources dans la zone de disponibilité spécifiée sont suspendues. Essayez les solutions suivantes :

    • Basculez vers une autre région.

    • Sélectionnez un autre type de ressource.

    • Essayez de démarrer l'instance pendant les heures creuses.

  • CommodityInstanceNotAvailableError: Commodity instance has been released due to prolonged arrears at past. Please create a new instance for use

    • Cause : le système a libéré l'instance en raison d'impayés prolongés sur le compte.

    • Solution : créez une nouvelle instance.

  • The charge of current ECI instance has been stopped, but the related resources are still being cleaned.

    • Cause : les ressources de niveau gratuit sont partagées. Pendant les heures de pointe, le démarrage d'une instance DSW peut prendre plus de 30 minutes. Si le système ne parvient pas à acquérir des ressources dans l'heure, il signale que le type sélectionné n'est pas disponible dans la région actuelle.

    • Solution : essayez les solutions suivantes :

      • Basculez vers une autre région.

      • Modifiez le type de ressource (les instances en attente ne prennent pas en charge les modifications de type : arrêtez d'abord l'instance manuellement, puis effectuez le changement).

      • Utilisez l'instance pendant les heures creuses, par exemple en dehors des heures ouvrables.

      • Si aucune des solutions ci-dessus ne fonctionne, contactez votre gestionnaire de compte.

  • The cluster resources are fully utilized. Please try later or other regions.

    • Cause : toutes les ressources de calcul du cluster sont utilisées.

    • Solution : essayez les solutions suivantes :

      • Basculez vers une autre région.

      • Modifiez le type de ressource (les instances en attente ne prennent pas en charge les modifications de type : arrêtez d'abord l'instance manuellement, puis effectuez le changement).

      • Utilisez l'instance pendant les heures creuses, par exemple en dehors des heures ouvrables.

      • Si aucune des solutions ci-dessus ne fonctionne, contactez votre gestionnaire de compte.

  • Create ECI failed because the specified instance is out of stock. It is recommended to use the multi-zone creation function to avoid the risk of stockout.

    • Cause : le type de ressource spécifié est en rupture de stock.

    • Solution : essayez les solutions suivantes :

      • Basculez vers une autre région.

      • Modifiez le type de ressource (les instances en attente ne prennent pas en charge les modifications de type : arrêtez d'abord l'instance manuellement, puis effectuez le changement).

      • Utilisez l'instance pendant les heures creuses, par exemple en dehors des heures ouvrables.

      • Si aucune des solutions ci-dessus ne fonctionne, contactez votre gestionnaire de compte.

  • back-off 10s restarting failed container=dsw-notebook pod

    • Cause : le disque système est plein et doit être étendu.

      Pour vérifier l'utilisation du disque système : cliquez sur le nom de l'instance dans la liste des instances DSW, accédez à la page des détails et vérifiez l'état du System disk dans la section Environment information.

    • Solution : dans la liste des instances, cliquez sur Change Settings pour étendre le disque système.

      Important

      Après l'extension du disque système, la facturation se poursuit indépendamment de l'état d'exécution de l'instance. Pour arrêter tous les frais liés à DSW, supprimez l'instance. Sauvegardez vos données avant la suppression.

  • Pod was active on the node longer than the specified deadline

    • Cause : cette erreur est généralement générée par la couche ACK sous-jacente. Les causes courantes incluent une configuration incorrecte des paramètres à l'intérieur du conteneur ou un manque d'espace libre sur le disque système.

    • Solution : suivez ces étapes de dépannage :

      1. Vérifiez si l'image personnalisée contient une configuration anormale.

      2. Exécutez find / -type f -print0 | xargs -0 du -h | sort -rh | head -n 10 pour identifier les fichiers les plus volumineux sur le disque système et confirmer s'il s'agit de fichiers métier attendus.

      3. Confirmez la connectivité réseau entre CPFS et l'instance DSW, et vérifiez que la configuration VPC est cohérente.

  • found multiple security groups with the same name

    • Cause : cela est généralement dû à une anomalie backend.

    • Solution : essayez de redémarrer l'instance. Si l'erreur persiste, notez l'ID de demande figurant dans le message d'erreur et soumettez un ticket pour investigation.

  • Instance fails to start due to CPU resource fragmentation on the node

    Solution : ajustez l'ordre de démarrage de vos tâches : arrêtez d'abord certaines instances DSW qui occupent des ressources, démarrez l'instance cible, et une fois qu'elle a démarré avec succès, redémarrez les autres tâches.

  • Q : Mon image personnalisée ne dispose pas d'un IDE installé — puis-je toujours utiliser l'IDE basé sur le web ?

    Oui. Les outils IDE VS Code et autres intégrés à la console web DSW font partie de l'environnement intégré de la plateforme et ne dépendent d'aucun package IDE inclus dans votre image personnalisée.

  • Startup failed: Workspace member not found

    Votre compte n'est pas membre de l'espace de travail cible. Contactez votre administrateur d'espace de travail pour ajouter votre compte en tant que membre.

  • failed to create containerd container: failed to prepare layer from archive: failed to validate archive quota ...

    • Cause : l'image utilisée pour créer l'instance est trop volumineuse, ce qui entraîne un espace insuffisant sur le disque système.

    • Solution : cliquez sur le nom de l'instance dans la liste des instances DSW, accédez à la page des détails et vérifiez l'état du System disk dans la section Environment information. Cliquez sur Expand pour étendre le disque système. Notez que l'extension du disque système entraîne des frais de stockage supplémentaires.

  • Resource Error: create order error (status code 400)

    Cause : cette erreur est généralement causée par l'un des éléments suivants :

    1. Impayés sur le compte : le compte présente des soldes impayés et le système a bloqué les nouvelles demandes de création de ressources. Même les types de ressources de niveau gratuit ne peuvent pas être créés tant que le compte est en situation d'impayés.

    2. Contrôle des risques : le compte a déclenché la politique de contrôle des risques de sécurité d'Alibaba Cloud (par exemple, un compte nouvellement enregistré ou une activité inhabituelle) et la demande a été rejetée.

    Étapes de dépannage :

    1. Connectez-vous à la console Billing and Cost pour vérifier les soldes impayés. En cas d'impayés, réglez-les avant de réessayer.

    2. Si le compte n'a pas d'impayés, le contrôle des risques peut en être la cause. Soumettez un ticket avec l'ID de demande figurant dans le message d'erreur ; l'assistance technique vous aidera à enquêter et à lever la restriction.

Autres causes d'échec de démarrage :

  • Impayés sur le compte

    Si votre compte est en situation d'impayés, la création d'instance DSW échouera. Les bons ne peuvent pas compenser les impayés. Connectez-vous à la console Billing and Cost pour vérifier le solde de votre compte.

Arrêt et libération de l'instance DSW

Q : Comment libérer une instance DSW ?

Dans la liste des instances DSW, utilisez les actions Stop ou Delete dans la colonne d'opérations à droite.

Important : Si vous avez étendu le disque système, il continue d'engendrer des frais de stockage même lorsque l'instance est arrêtée. Pour arrêter toute la facturation liée à DSW, supprimez l'instance.

Q : Je ne trouve pas mon instance DSW — que dois-je faire ?

Essayez de basculer vers une autre région ou un autre espace de travail.

Q : Comment libérer un pack de crédits d'essai gratuit ?

Les packs de crédits d'essai gratuit n'ont pas besoin d'être libérés ou arrêtés.

Q : Comment arrêter toute la facturation DSW ? Quelle est la différence entre « Stop » et « Delete » ?

  • Stop : libère les ressources de calcul (CPU/GPU) et met en pause les frais de calcul. Remarque : un disque système étendu continue d'engendrer des frais.

  • Delete : supprime définitivement l'instance et toutes ses ressources, y compris le disque système. Toute la facturation associée s'arrête complètement.

Quand choisir :

  • Stop : vous avez temporairement terminé, mais vous souhaitez conserver vos données et votre environnement pour un redémarrage futur.

  • Delete : vous n'avez plus besoin de l'instance et souhaitez arrêter toute la facturation. Sauvegardez vos données avant de procéder.

Q : Mon instance DSW est restée longtemps à l'état « Stopping » ou « Deleting » — que se passe-t-il ?

Lorsque vous arrêtez une instance DSW, le système génère automatiquement un cache d'image en enregistrant la couche lecture-écriture actuelle du conteneur, ce qui accélère le prochain démarrage. Il s'agit d'un comportement attendu, pas d'une défaillance système. Si une grande quantité de données a été écrite dans la couche du conteneur, la génération du cache prend plus de temps — potentiellement de plusieurs minutes à quelques heures.

Important

Les instances DSW créées dans le groupe de ressources partagé n'engendrent pas de frais de calcul lorsqu'elles sont à l'état « Stopping », « Saving » ou « Deleting ».

Si l'arrêt de l'instance prend beaucoup de temps, les causes courantes incluent :

  • Couche lecture-écriture du conteneur volumineuse : c'est la cause la plus fréquente. L'installation de nombreux packages, le téléchargement de fichiers de modèles ou l'enregistrement de jeux de données sur le disque système augmentent tous la taille de la couche et prolongent le temps d'arrêt.

  • Un processus à l'intérieur de l'instance ne s'est pas terminé correctement.

  • Une utilisation élevée de la mémoire empêche l'instance de répondre à la commande d'arrêt.

Conseils pour accélérer l'arrêt :

  • Avant l'arrêt, utilisez la fonctionnalité Save image pour définir des chemins d'exclusion pour les fichiers ou répertoires volumineux que vous n'avez pas besoin de sauvegarder (tels que les fichiers de modèles et les jeux de données). Cela peut réduire considérablement le temps d'arrêt. Pour plus de détails, consultez la rubrique sur la sauvegarde des images d'instances DSW.

  • Stockez les données volumineuses dans un chemin OSS ou NAS monté plutôt que sur le disque système. Cela réduit fondamentalement la taille de la couche lecture-écriture du conteneur.

  • Si vous n'avez pas besoin de l'instance et que la conservation des données ne vous importe pas, supprimez-la pour libérer immédiatement les ressources.

Si l'arrêt prend trop de temps, patientez. S'il n'est pas terminé après 2 heures, soumettez un ticket pour obtenir l'assistance technique.

Q : Mes données et mon code seront-ils perdus après l'arrêt ou la suppression d'une instance DSW ?

La conservation des données dépend de l'opération effectuée et du type de groupe de ressources.

  • Arrêt de l'instance :

    La conservation des données dépend du type de groupe de ressources.

    • Instances avec un disque système sur disque cloud (la plupart des types paiement à l'utilisation et les instances de ressources générales avec Disk sélectionné) : si le disque n'a pas été étendu et que l'instance a été arrêtée pendant plus de 15 jours, les données sont effacées et ne peuvent pas être récupérées. Si le disque a été étendu ou si l'instance a été arrêtée pendant moins de 15 jours, les données sont conservées.

    • Instances utilisant Temporary Storage comme disque système : les données sont stockées dans un stockage éphémère. L'arrêt de l'instance supprime les données et elles ne peuvent pas être récupérées.

  • Suppression de l'instance :

    Toutes les données du disque système sont définitivement effacées et ne peuvent pas être récupérées. Sauvegardez toutes les données importantes avant la suppression.

Q : Pourquoi mon instance DSW en cours d'exécution s'est-elle arrêtée automatiquement ?

L'instance dispose d'une politique d'arrêt automatique en cas d'inactivité configurée. Cette politique est conçue pour économiser les ressources et est activée par défaut pour les instances d'essai gratuit.

  • Condition de déclenchement : l'utilisation du CPU et du GPU reste inférieure au seuil configuré pendant 3 heures consécutives.

  • Recommandations :

    • Arrêt manuel : pour économiser les ressources de manière fiable, arrêtez l'instance manuellement lorsque vous ne l'utilisez pas. La politique d'arrêt automatique n'est pas garantie de se déclencher à chaque fois.

    • Modification de la politique : pour les tâches de longue durée, modifiez ou désactivez cette politique. Étapes :

      1. Accédez à la page des détails de l'espace de travail et cliquez sur Configure Workspace > Scheduling Settings.

      2. Trouvez la section de configuration DSW. Ici, vous pouvez modifier la politique d'arrêt DSW et la politique d'exclusion. Par exemple, pour désactiver l'arrêt automatique pour des instances spécifiques, ajoutez-les à la politique d'exclusion par nom d'instance.

Q : J'ai arrêté ou supprimé toutes mes instances DSW, mais elles apparaissent toujours comme « Running » ou je reçois toujours des notifications de facturation — pourquoi ?

Vérifiez les causes courantes suivantes :

  • Vous confondez peut-être un pack de ressources avec une instance. Le statut « Running » que vous voyez peut faire référence à un pack de ressources (tel que « 250 heures de calcul/mois »), et non à une instance. Les packs de ressources restent actifs tout au long de leur période de validité, quel que soit l'état de l'instance.

  • Un disque système étendu est toujours facturé. L'arrêt d'une instance met uniquement en pause les frais de calcul. Un disque système étendu continue d'engendrer des frais de stockage.

  • La facturation est différée. La facturation n'est pas en temps réel : les frais générés le matin peuvent ne pas apparaître dans votre facture avant l'après-midi.

Q : Puis-je utiliser une API, du code Python ou un déclencheur post-tâche pour arrêter automatiquement une instance DSW ?

Les méthodes de contrôle automatique suivantes ne sont pas prises en charge :

  • Démarrage d'un processus d'entraînement dans DSW ou contrôle du démarrage/arrêt de l'instance via des appels API depuis des environnements externes tels qu'ECS.

  • Exécution d'une commande d'arrêt depuis l'instance à l'aide de code Python, tel que os.system.

  • Configuration de l'instance pour qu'elle s'arrête automatiquement après la fin d'une tâche.

DSW prend uniquement en charge la politique d'arrêt automatique en cas d'inactivité (durée minimale d'inactivité : 1 heure), qui détermine l'état d'inactivité en fonction de l'utilisation du CPU/GPU. Cette politique ne peut pas garantir une fiabilité de déclenchement de 100 %. Arrêtez l'instance manuellement après la fin de votre tâche pour éviter des frais imprévus.