Pour utiliser Dataset Accelerator, créez un slot d'accélération et associez-le à une source de données. Le système pré-traite le jeu de données en fonction de son type, de sa taille et du modèle d'entraînement pour améliorer la vitesse d'accès. Cette rubrique explique comment créer et gérer des slots d'accélération.
Prérequis
Vous avez créé une instance d'accélération de jeu de données. Pour plus d'informations, consultez la section Créer et gérer des instances d'accélération de jeu de données.
Créer un slot d'accélération
Connectez-vous à la PAI console. Dans le volet de navigation de gauche, choisissez .
-
Ouvrez le panneau de création de slot d'accélération :
Méthode 1 : dans l'onglet Acceleration Slots, cliquez sur Create Acceleration Slot.
-
Méthode 2 : depuis la page des détails de l'instance.
RemarqueAvec cette méthode, le paramètre Instance est automatiquement défini sur l'instance d'accélération actuelle et ne peut pas être modifié.
Dans l'onglet Acceleration Instances, cliquez sur le nom de l'instance cible pour ouvrir sa page de détails.
Dans l'onglet Dataset Acceleration Slots, cliquez sur Create Acceleration Slot.
-
Dans le panneau Create Acceleration Slot, configurez les paramètres clés suivants.
Paramètre
Description
Instance
Sélectionnez une instance d'accélération existante.
Bind cloud product
Object Storage (OSS)
-
Read/Write Attributes : sélectionnez Read-only ou Read/Write.
-
Select OSS path : sélectionnez le répertoire OSS contenant le jeu de données.
General-purpose NAS, Extreme NAS,
-
Select File System : sélectionnez l'ID d'un système de fichiers existant.
-
Mount Target : sélectionnez un point de montage pour accéder au système de fichiers.
-
File System Path : sélectionnez un chemin de stockage existant dans NAS. Par défaut :
/.
Maximum Capacity
Définissez la capacité du slot d'accélération. La capacité doit être supérieure ou égale à la taille du jeu de données. Configurez ce paramètre en fonction de la taille du jeu de données à accélérer.
Acceleration instance: Free space
Ce paramètre n'est disponible que lorsque l'option Bind cloud product est définie sur MaxCompute.
Sélectionnez ou créez un point de montage pour monter Dataset Accelerator sur votre cluster d'entraînement. Pendant l'entraînement du modèle, les jobs d'entraînement accèdent au slot d'accélération via le point de montage pour lire le jeu de données associé, ce qui améliore l'efficacité de l'accès aux données.
Utilisez l'une des méthodes suivantes :
-
Bind cloud product : sélectionnez un point de montage existant.
-
Object Storage Service (OSS) : configurez les paramètres suivants pour créer un nouveau point de montage.
-
MaxCompute : seul le VPC est pris en charge.
-
Select Mount Point : sélectionnez un Virtual Private Cloud (VPC) existant. Si aucun VPC n'est disponible, cliquez sur Create Mount Target pour en créer un.
-
Mount Target Type : sélectionnez un vSwitch existant. Si aucun vSwitch n'est disponible, cliquez sur VPC Network pour en créer un.
-
Remarque-
Dataset Accelerator prend uniquement en charge les points de montage VPC.
-
Les clusters d'entraînement situés dans le même VPC peuvent utiliser un point de montage VPC, même s'ils se trouvent dans des vSwitch différents.
-
Lorsque vous ajoutez un point de montage, le système de fichiers utilise une adresse IP. Nous vous recommandons de sélectionner un vSwitch disposant d'adresses IP privées disponibles suffisantes.
-
Seuls les clusters d'entraînement situés dans le même VPC peuvent monter la cible.
vSwitch
Activez l'interrupteur create vSwitch pour configurer une durée d'exécution ou une heure d'arrêt planifiée pour le slot d'accélération.
-
-
Cliquez sur Mount Target Type.
Le système initialise le slot d'accélération. Vous pouvez utiliser le slot lorsque son Enable automatic recycling passe à Enable automatic recycling.
Gérer les slots d'accélération de jeux de données
Gérez les slots d'accélération de jeux de données sur la page Dataset Accelerator, depuis l'onglet Acceleration Slots ou depuis la page de détails d'une instance d'accélération. Les opérations disponibles sont identiques sur les deux pages. Dans l'onglet Acceleration Slots, vous pouvez afficher la liste des slots, y compris le nom/ID du slot, le point de montage, l'état de synchronisation, l'instance, le stockage accéléré, le chemin de stockage, l'état et la durée de chargement. Dans la colonne Actions, le menu More contient les options Stop et Delete.
Cliquez sur le nom d'un slot pour ouvrir sa page de détails et consulter ses Submit.
Placez le curseur sur la colonne Accelerated Storage pour afficher le type de stockage du jeu de données.
Arrêtez ou supprimez les slots inutilisés, ou clonez un slot existant. Vous pouvez également cliquer sur Status pour configurer une durée d'exécution ou une heure d'arrêt planifiée.
Gérer les points de montage
Pour gérer les points de montage, cliquez sur le nom d'un slot d'accélération pour ouvrir sa page de détails. La configuration du point de montage comprend le Mount target name, le Mount target type (tel que VPC), le VPC ID, le vSwitch ID, la zone de disponibilité, l'IP et le port.
Afficher la configuration : placez le curseur sur le nom d'un point de montage pour afficher ses détails de configuration.
Afficher la configuration de déploiement : cliquez sur le nom d'un point de montage pour afficher la configuration de déploiement du client Dataset Accelerator.
-
Télécharger la configuration de déploiement : dans le panneau Running, cliquez sur Basic Information pour télécharger le fichier YAML. Utilisez ce fichier pour configurer Dataset Accelerator dans votre cluster d'entraînement.
Vous pouvez également cliquer sur le bouton Copy pour copier le contenu YAML dans votre presse-papiers. Le fichier YAML inclut des champs tels que
apiVersion: data.datasetacc.io/v1,kind: DataSetAccelerator,metadata(qui contient le nom du slot d'accélération) etspec(qui contientfrontEndAddretfrontEndPort).
Étapes suivantes
Activez l'accélération des jeux de données lors de la création d'une instance Data Science Workshop (DSW) ou de la soumission d'un job Deep Learning Containers (DLC) pour accélérer l'accès aux données. Pour plus d'informations, consultez la section Utiliser Dataset Accelerator dans PAI.