Tous les produits
Search
Centre de documentation

Platform For AI:Créer et gérer des jeux de données

Dernière mise à jour :Aug 20, 2026

Créez et gérez des jeux de données ainsi que leurs versions dans PAI AI Asset Management. Le versionnement des jeux de données vous aide à reproduire des expériences, à suivre la lignée des données et à revenir à des versions antérieures.

Présentation des jeux de données

PAI prend en charge deux types de jeux de données : les jeux de données de base et les jeux de données étiquetés. Les jeux de données de base contiennent des données brutes non étiquetées destinées au pré-entraînement des modèles. Les jeux de données étiquetés contiennent des données annotées manuellement pour l'ajustement fin et l'évaluation.

Élément

Jeu de données de base

Jeu de données étiqueté

Définition

Données brutes non étiquetées.

Données avec des libellés ajoutés manuellement.

Traitement des données

Nettoyage des données, déduplication, etc.

Étiquetage des données, validation, etc.

Cas d'utilisation

  • Apprentissage non supervisé

  • Pré-entraîner des modèles pour capturer des caractéristiques générales.

  • Apprentissage supervisé et évaluation des modèles

  • Ajuster finement les modèles pour améliorer les performances sur des tâches spécifiques.

Accéder à la page Jeux de données

  1. Connectez-vous à la console PAI.

  2. Dans le coin supérieur gauche, sélectionnez une région.

  3. Dans le volet de navigation de gauche, cliquez sur Workspaces, puis cliquez sur le nom de l'espace de travail cible.

  4. Dans le volet de navigation de gauche, choisissez AI Computing Asset Management > Dataset.

Créer un jeu de données de base

Dans l'onglet Custom Dataset, cliquez sur Create Dataset et sélectionnez Basic pour Data Type. Les options de Storage prises en charge incluent Object Storage Service (OSS) et les systèmes de fichiers (General-purpose NAS, Extreme NAS, CPFS et AI-CPFS).

Type de stockage : OSS

Paramètre

Description

Content Type

Sélectionnez le type de données : Image, Text, Audio, Video, Tabular ou General. Le choix d'un type spécifique permet de filtrer les jeux de données dans les scénarios d'étiquetage.

Owner

Le propriétaire du jeu de données. Seuls les administrateurs d'espace de travail peuvent configurer ce paramètre.

Import Format/OSS Path

  • Si le format d'importation est défini sur file, sélectionnez un fichier pour le chemin OSS. Le jeu de données correspond à ce fichier. Couramment utilisé pour les jeux de données iTAG.

  • Si le format d'importation est un dossier, le chemin OSS doit être un chemin de dossier montable. Couramment utilisé pour DSW, DLC ou EAS.

Default Mount Path

Chemin de montage par défaut pour les données, couramment utilisé dans DSW et DLC :

  • Dans DSW, le système de fichiers est monté sur ce chemin lors de la création d'une instance.

  • Dans DLC, le système lit les fichiers à partir de ce répertoire. Par exemple, python /root/data/file.py.

Enable Version Acceleration

Si Import Format est défini sur Folder, vous pouvez activer l'accélération des versions de jeu de données. Paramètres clés :

  • Maximum Capacity : capacité du slot d'accélération, qui doit être supérieure ou égale à la taille du jeu de données.

  • Accelerated Mount Target : utilise un point de montage interne par défaut. Vous pouvez également sélectionner un point existant ou en créer un nouveau.

    Remarque

    Lors de l'utilisation des ressources de calcul intelligent Lingjun, si vous sélectionnez Accelerated Mount Target pour Create Mount Target, sélectionnez VPC pour Mount Target Type. Le VPC et le vSwitch doivent correspondre à ceux de vos ressources de calcul intelligent Lingjun.

  • Accelerated Version Default Mount Path : chemin de montage par défaut pour la version accélérée.

Type de stockage : système de fichiers

Paramètre

Description

Content Type

Sélectionnez le type de données : Image, Text, Audio, Video, Tabular ou General. Le choix d'un type spécifique permet de filtrer les jeux de données dans les scénarios d'étiquetage.

Owner

Le propriétaire du jeu de données. Seuls les administrateurs d'espace de travail peuvent configurer ce paramètre.

File System

Sélectionnez un système de fichiers correspondant au Storage sélectionné.

Mount Target

Spécifiez un point de montage pour accéder au système de fichiers NAS.

File System Path

Spécifiez un chemin de stockage existant dans le système de fichiers NAS. Par exemple, /.

Default Mount Path

Chemin de montage par défaut pour les données, couramment utilisé dans DSW et DLC :

  • Dans DSW, le système de fichiers est monté sur ce chemin lors de la création d'une instance.

  • Dans DLC, le système lit les fichiers à partir de ce répertoire. Par exemple, python /root/data/file.py.

Enable Version Acceleration

Si le Storage est General-purpose NAS, Extreme NAS ou CPFS, vous pouvez activer l'accélération des versions de jeu de données. Paramètres clés :

  • Maximum Capacity : capacité du slot d'accélération, qui doit être supérieure ou égale à la taille du jeu de données.

  • Accelerated Version Default Mount Path : chemin de montage par défaut pour la version accélérée.

Créer une version de jeu de données de base

Dans l'onglet Custom Dataset, cliquez sur Create Version dans la colonne Actions pour le jeu de données cible.

Remarques importantes :

  • Le nom du jeu de données, le type de stockage et le type de données sont hérités de la version V1 et ne peuvent pas être modifiés.

  • Le numéro de version est généré automatiquement et ne peut pas être modifié.

  • Les autres paramètres correspondent à ceux décrits dans Créer un jeu de données de base.

Consulter les jeux de données publics

PAI fournit des jeux de données publics intégrés tels que MMLU, CMMLU et GSM8K. Dans l'onglet Public Dataset, cliquez sur le nom d'un jeu de données pour afficher les détails.

Chaque jeu de données affiche le Dataset Name/ID, le Type, la Task, la Language, la Size, le Data Volume et le Publisher.

Gérer les jeux de données

Pour les jeux de données personnalisés, vous pouvez consulter l'historique des versions, créer une nouvelle version, rendre le jeu de données public ou le supprimer. Pour les jeux de données étiquetés, vous pouvez consulter les données, rendre le jeu de données public ou le supprimer.

Remarques importantes :

  • Si la Visibility d'un jeu de données est définie sur Visible Only to the Dataset Owner, vous pouvez cliquer sur Set Dataset to Public pour le partager avec tous les membres de l'espace de travail. Une fois qu'un jeu de données est rendu public, cette action est irréversible. Agissez avec prudence.

  • Si un utilisateur RAM rencontre une erreur d'accès refusé lors de la consultation des données du jeu de données, accordez les autorisations requises à l'utilisateur RAM.

  • La suppression d'un jeu de données peut affecter les tâches en cours d'exécution qui en dépendent. Cette action est irréversible. Agissez avec prudence.