La suite cloud-native pour l'IA est une solution Container Service for Kubernetes (ACK) qui fournit une infrastructure complète pour créer et exploiter des charges de travail d'IA et de machine learning sur Kubernetes. Elle gère les ressources, l'ordonnancement des tâches, l'accélération des données et les outils du cycle de vie, afin que votre équipe puisse se concentrer sur le développement et l'entraînement des modèles plutôt que sur la gestion du cluster.
La suite expose toutes ses fonctionnalités via la CLI, des SDK multilingues et la console ACK. Elle s'intègre aux services d'IA d'Alibaba Cloud, aux frameworks open source et aux outils tiers d'IA via les mêmes interfaces.
Architecture
Bâtie sur ACK, la suite cloud-native pour l'IA gère en amont les ressources de calcul, de stockage et de réseau hétérogènes, et expose en aval des clusters Kubernetes standard ainsi que leurs API. Sur cette base, elle fournit les composants d'ordonnancement, d'orchestration des données, de workflow et de gestion du cycle de vie dont vos charges de travail d'IA ont besoin.
Intégration avec PAI
La suite s'intègre à Platform for AI (PAI) pour former une plateforme d'IA performante et élastique. ACK améliore l'élasticité et l'efficacité des services PAI Data Science Workshop (DSW), Deep Learning Containers (DLC) et Elastic Algorithm Service (EAS). Déployez Lightweight Platform for AI dans votre cluster ACK en quelques clics pour intégrer les algorithmes et moteurs profondément optimisés de PAI dans vos charges de travail conteneurisées et accélérer à la fois l'entraînement et l'inférence. Pour plus d'informations, consultez Qu'est-ce que PAI ?
Fonctionnalités clés
La suite cloud-native pour l'IA utilise Kubernetes comme socle et offre une prise en charge et une optimisation complètes pour les applications et systèmes d'IA et de machine learning. Le tableau suivant décrit les fonctionnalités clés fournies par la suite cloud-native pour l'IA.
|
Fonctionnalité |
Description |
Références |
|
Gestion des ressources hétérogènes |
|
|
|
Ordonnancement des tâches d'IA |
|
|
|
Ordonnancement élastique |
Ordonnancement élastique pour les tâches d'apprentissage profond distribué : la suite cloud-native pour l'IA met à l'échelle dynamiquement le nombre de workers et de nœuds sans affecter l'entraînement ni la précision du modèle. La suite ajoute des workers pour accélérer l'entraînement lorsque le cluster dispose de ressources inutilisées et libère des workers lorsque le cluster ne peut pas fournir suffisamment de ressources. Cela garantit que l'entraînement du modèle n'est pas affecté par un manque de ressources. Ce mode améliore considérablement l'utilisation globale des ressources du cluster et aide à éviter les pannes de nœuds. Il réduit également le temps d'attente pour le lancement des tâches. |
|
|
Orchestration et accélération des données d'IA |
Fluid : introduit le concept de jeu de données. Il fournit aux tâches d'entraînement une abstraction des données et une plateforme d'orchestration et d'accélération des données pour vous aider à gérer les jeux de données, appliquer le contrôle d'accès et accélérer l'accès aux données. ack-fluid peut ingérer des données provenant de différents services de stockage et les agréger dans un même jeu de données. Vous pouvez également connecter ack-fluid à des services de stockage dans le cloud ou sur site dans un environnement de cloud hybride pour gérer les données et accélérer leur accès. En outre, ack-fluid peut être étendu pour prendre en charge une variété de services de cache distribués. Configurez un service de cache pour chaque jeu de données et utilisez des fonctionnalités telles que le préchauffage du jeu de données, la surveillance de la capacité du cache et la mise à l'échelle élastique pour réduire considérablement les coûts liés à l'ingestion distante des données pour les tâches d'entraînement et améliorer l'efficacité du calcul GPU. |
|
|
Gestion du cycle de vie des tâches d'IA |
|
Cas d'utilisation
La suite cloud-native pour l'IA convient à l'amélioration continue de l'utilisation des ressources hétérogènes et à la gestion efficace des charges de travail hétérogènes, telles que les tâches d'IA.
Cas d'utilisation 1 : Améliorer continuellement l'utilisation des ressources hétérogènes
La suite cloud-native pour l'IA fournit une abstraction des ressources hétérogènes dans le cloud, y compris les ressources de calcul (telles que les CPU, GPU, NPU, VPU et FPGA), les ressources de stockage (OSS, NAS, CPFS et HDFS) et les ressources réseau (TCP et RDMA). Gérez, maintenez et allouez ces ressources de manière centralisée via la suite cloud-native pour l'IA, et améliorez continuellement l'utilisation des ressources grâce à la mise à l'échelle des ressources et à l'optimisation logicielle et matérielle.
Cas d'utilisation 2 : Gérer efficacement les charges de travail hétérogènes telles que les tâches d'IA
La suite cloud-native pour l'IA est compatible avec les moteurs open source principaux tels que TensorFlow, PyTorch, DeepSpeed, Ray, Horovod, Spark, Flink, Kubeflow, Kserve, vLLM et Triton Inference Server, et prend également en charge les moteurs et environnements d'exécution autogérés. La suite cloud-native pour l'IA optimise également continuellement les tâches d'entraînement en termes de performances, d'efficacité et de coûts, améliore l'expérience utilisateur en matière de développement et de maintenance, et accroît l'efficacité opérationnelle.
Rôles utilisateurs
La suite cloud-native pour l'IA définit les rôles utilisateurs suivants.
|
Rôle |
Description |
|
Administrateur O&M |
Responsable de la construction de l'infrastructure d'IA et de l'administration quotidienne. Pour plus d'informations, consultez Déployer la suite, Gérer les utilisateurs, Gérer les groupes de quotas élastiques et Gérer les jeux de données. |
|
Ingénieur en algorithmes et data scientist |
Utilise la suite cloud-native pour l'IA pour gérer les tâches. Pour plus d'informations, consultez Entraînement des modèlesEntraînement des modèles dans les clusters Kubernetes, Gérer les modèles dans MLflow Model Registry via Arena et Analyser et optimiser les modèles. |
Utiliser la suite cloud-native pour l'IA
Suivez les étapes illustrées dans la figure ci-dessous pour utiliser la suite cloud-native pour l'IA en fonction du rôle utilisateur que vous assumez.

|
Étape |
Description |
Console |
|
1. Préparatifs (Administrateur O&M) |
Créer un compte Alibaba Cloud Créez un compte Alibaba Cloud et effectuez la vérification d'identité réelle. Pour plus d'informations, consultez Inscrire un compte Alibaba Cloud. |
|
|
Créer un cluster ACK Activez ACK et créez un cluster ACK. Nous vous recommandons d'utiliser les configurations de cluster suivantes. Pour plus d'informations, consultez Créer un cluster ACK managé.
|
||
|
(Facultatif) Configurer les dépendances du cluster et créer les ressources cloud associées
|
||
|
2. Système et environnement (Administrateur O&M) |
Activer et installer la suite cloud-native pour l'IA
|
|
|
Gérer les utilisateurs et les quotas
|
Tableau de bord IA et kubectl Remarque
Les consoles IA fournies par Alibaba Cloud (y compris la console développeur et la console O&M) sont disponibles en tant que fonctionnalité sur liste d'autorisation à partir du 22 janvier 2025. Si vous avez déployé ces consoles avant l'entrée en vigueur de la liste d'autorisation, votre déploiement existant ne sera pas affecté. Les utilisateurs qui ne figurent pas sur la liste d'autorisation peuvent installer et configurer la console de la suite IA à partir de la communauté open source. Pour plus d'informations sur la configuration open source, consultez Console IA open source. |
|
|
Préparer les données
|
||
|
(Ingénieur en algorithmes et data scientist) |
La suite cloud-native pour l'IA permet aux ingénieurs en algorithmes et aux data scientists d'utiliser Arena, la console web et la console développeur IA pour développer des modèles, entraîner des modèles, déployer des services d'inférence et gérer des tâches.
|
|
|
3. Entraînement et déploiement des modèles (Ingénieur en algorithmes et data scientist) |
Lorsque vous utilisez Arena ou la console développeur IA, vous pouvez suivre les étapes suivantes pour entraîner et déployer des modèles : Développer des modèles
Entraîner des modèles
Gérer les modèles
Déployer des modèles Déployez un modèle en tant que service d'inférence. Pour plus d'informations, consultez Déploiement de services d'IADéployer des services d'IA. |
Console développeur IA et Arena |
|
Utilisez Lightweight Platform for AI pour développer, entraîner et déployer des modèles. |
S.O. |
|
|
4. Surveillance et maintenance (Administrateur O&M) |
Surveiller et maintenir les ressources Consultez les tableaux de bord de diverses ressources, y compris les clusters, les nœuds, les tâches d'entraînement et les quotas de ressources. Pour plus d'informations, consultez Tableaux de bord de surveillance cloud-native pour l'IA. |
|
|
Gérer les quotas
|
||
|
Gérer les utilisateurs Créez, interrogez, mettez à jour et supprimez des utilisateurs ou des groupes d'utilisateurs. Pour plus d'informations, consultez Gérer les utilisateurs et Gérer les groupes d'utilisateurs. |
||
|
Gérer les jeux de données
|
||
|
Gérer les tâches élastiques Consultez les tâches élastiques et les détails des tâches. Pour plus d'informations, consultez Afficher les tâches élastiques. |
||
|
5. Facturation et paiements (Administrateur O&M) |
À partir du 6 juin 2024 à 00:00:00 (UTC+8), la suite cloud-native pour l'IA est gratuite. Pour plus d'informations, consultez Facturation de la suite cloud-native pour l'IA. |
|
|
Générer des factures quotidiennement
|
Règles de facturation
Pour plus d'informations, consultez Facturation de la suite cloud-native pour l'IA.
Références
|
Référence |
Description |
|
Vous aide à appliquer rapidement la suite cloud-native pour l'IA à vos travaux de développement et d'O&M grâce à quelques pratiques. |
|
|
Décrit les notes de version de la suite cloud-native pour l'IA. |