Le groupe de ressources RAY de Lindorm fournit des services de calcul distribué et prend en charge le traitement de bout en bout des charges de travail d'IA. Ce groupe de ressources est entièrement compatible avec le modèle de calcul standard RAY et ses interfaces de programmation. Il s'intègre étroitement aux moteurs de stockage multimodèles de Lindorm pour traiter efficacement les tâches de prétraitement des données, d'entraînement et d'inférence. Cette rubrique explique comment activer, gérer et facturer les groupes de ressources RAY.
Le groupe de ressources RAY est actuellement en aperçu sur invitation. Pour demander l'accès, contactez le support technique Lindorm (ID DingTalk : s0s3eg3).
Prérequis
Vous avez activé Lindorm LindormTable.
Vous avez activé le moteur de calcul Lindorm.
Méthode de facturation
Le groupe de ressources RAY propose un mode résident. Les frais comprennent les deux éléments suivants :
Frais de ressources résidentes : facturés en fonction des ressources configurées pour les nœuds Head et Worker, selon la facturation par CU.
Frais de ressources élastiques : les nœuds Worker prennent en charge la mise à l'échelle automatique en fonction de la charge de travail. La facturation des nœuds Worker mis à l'échelle se fait selon la durée d'utilisation via la facturation par CU.
Activer un groupe de ressources RAY
Connectez-vous à la console Lindorm. Dans le coin supérieur gauche de la page, sélectionnez la région de l'instance. Sur la page Instances, cliquez sur l'ID de l'instance cible ou sur View Instance Details dans la colonne Actions correspondant à l'instance.
Dans la section Configurations de la page Instance Details, cliquez sur Resource Groups dans la colonne d'opération Compute Engine.
-
Sur la page Resource Group Details, cliquez sur Create Resource Group et configurez les paramètres suivants :
Resource Group Type : sélectionnez RAY.
Resource Group Name : saisissez un nom pour le groupe de ressources. Utilisez uniquement des lettres minuscules et des chiffres. Le nom ne doit pas dépasser 63 caractères. Exemple :
raycg.-
Running Mode : mode d'exécution du groupe de ressources RAY. Sélectionnez Resident ou Non-resident.
-
Resident : le cluster Ray s'exécute en mode résident. Soumettez les jobs RAY au cluster RAY spécifié. Lorsqu'aucun job n'est en cours d'exécution, le cluster fonctionne avec une rétention minimale des ressources. Lors de la soumission de jobs, le cluster alloue dynamiquement les ressources en fonction de la demande. Ce mode convient aux scénarios qui soumettent fréquemment des jobs et nécessitent une adresse d'accès interactive stable.
Si vous sélectionnez le mode Resident, vous devez configurer les paramètres du nœud Head et du groupe Worker.
Configuration du nœud Head
Élément de configuration
Description du paramètre
Head resource type
Les groupes de ressources RAY prennent en charge deux types de ressources : CPU et GPU.
Head Resource Specifications
-
Pour le type de ressource CPU, sélectionnez votre quota de CPU et de mémoire, par exemple 4 cœurs 8 Go, 4 cœurs 16 Go ou 8 cœurs 32 Go. Choisissez en fonction de la taille de votre cluster. Valeur par défaut : 4 cœurs 16 Go.
-
Pour le type de ressource GPU, la disponibilité dépend du type d'instance et des stocks. Contactez le support technique Lindorm (ID DingTalk : s0s3eg3) lorsque vous avez besoin de ressources GPU.
Head disk size
Espace disque pour le nœud Head. Utilisé pour stocker les journaux, les fichiers de débordement de mémoire et les fichiers de ressources utilisés lors de l'exécution des jobs. Valeur par défaut : 30 Go.
Configuration du groupe Worker
Sélectionnez un ou plusieurs groupes Worker en fonction de votre scénario. Chaque groupe Worker peut utiliser des spécifications de ressources différentes.
Élément de configuration
Description du paramètre
Worker resource type
Les groupes de ressources RAY prennent en charge deux types de ressources : CPU et GPU.
Worker Resource Specifications
-
Pour le type de ressource CPU, sélectionnez votre quota de CPU et de mémoire, par exemple 4 cœurs 8 Go, 4 cœurs 16 Go ou 8 cœurs 32 Go. Choisissez la spécification du groupe Worker en fonction des exigences réelles de vos jobs. Valeur par défaut : 4 cœurs 16 Go.
-
Pour le type de ressource GPU, la disponibilité dépend du type d'instance et des stocks. Contactez le support technique Lindorm (ID DingTalk : s0s3eg3) lorsque vous avez besoin de ressources GPU.
Worker disk space
Espace disque pour le nœud Worker. Utilisé pour stocker les journaux, les fichiers de débordement de mémoire et les fichiers de ressources utilisés lors de l'exécution des jobs. Valeur par défaut : 30 Go.
Minimum number of workers
Nombre minimal de réplicas en cours d'exécution dans le groupe Worker. Lorsqu'aucun job n'est en cours d'exécution, le groupe fonctionne avec ce quota de ressources.
Maximum number of workers
Nombre maximal de réplicas en cours d'exécution dans le groupe Worker. Lorsque des jobs sont en cours d'exécution, il s'agit du nombre maximal de nœuds Worker pouvant être alloués.
-
-
Non-resident (Serverless) : les ressources de calcul sont allouées et libérées à la demande. Un cluster Ray temporaire est créé automatiquement pour chaque soumission de job et récupéré une fois le job terminé. Ce mode convient aux traitements par lots peu fréquents et aux scénarios sensibles aux coûts.
Si vous sélectionnez le mode Non-resident (Serverless), configurez les paramètres suivants :
Paramètre
Description
Limite CPU (cœurs)
Utilisation maximale des ressources CPU. Valeur minimale : 100.
Limite de mémoire (Go)
Utilisation maximale des ressources mémoire. Valeur minimale : 400.
Utilisateurs autorisés
Utilisateurs autorisés à soumettre des jobs à ce groupe de ressources.
*indique tous les utilisateurs.
-
Cliquez sur OK pour créer le groupe de ressources RAY. La création prend environ 20 minutes.
Gérer les groupes de ressources RAY
Connectez-vous à la console Lindorm. Dans le coin supérieur gauche de la page, sélectionnez la région de l'instance. Sur la page Instances, cliquez sur l'ID de l'instance cible ou sur View Instance Details dans la colonne Actions correspondant à l'instance.
Dans la section Configurations de la page Instance Details, cliquez sur Resource Groups dans la colonne d'opération Compute Engine.
Sur la page Resource Group Details, placez le curseur de la souris sur WebUI dans la colonne Actions du groupe de ressources RAY pour afficher son adresse WebUI. Exemple :
http://alb-57k7r581oht8rd****.cn-hangzhou.alb.aliyuncsslb.com/ray/raycg/dashboard/.-
Dans votre navigateur, accédez à l'adresse WebUI du groupe de ressources pour consulter son statut d'exécution.
Dans la barre de navigation en haut de l'interface WebUI, basculez entre les onglets pour afficher la liste des jobs (Jobs), l'état du cluster (Cluster), la liste des acteurs (Actors) et les journaux du cluster (Logs).
Dans l'onglet Cluster, consultez l'utilisation des ressources CPU, mémoire, GPU, Object Store et autres sur tous les nœuds du cluster.
-
(Facultatif) Sur la page Resource Group Details, vous pouvez également Delete un groupe de ressources existant.
RemarqueLes groupes de ressources RAY ne prennent pas actuellement en charge les opérations de modification ou de redémarrage.