Tous les produits
Search
Centre de documentation

Container Service for Kubernetes:Présentation de la suite cloud-native pour l'IA

Dernière mise à jour :Aug 31, 2026

La suite cloud-native pour l'IA est une solution Container Service for Kubernetes (ACK) qui fournit une infrastructure complète pour créer et exploiter des charges de travail d'IA et de machine learning sur Kubernetes. Elle gère les ressources, l'ordonnancement des tâches, l'accélération des données et les outils du cycle de vie, afin que votre équipe puisse se concentrer sur le développement et l'entraînement des modèles plutôt que sur la gestion du cluster.

La suite expose toutes ses fonctionnalités via la CLI, des SDK multilingues et la console ACK. Elle s'intègre aux services d'IA d'Alibaba Cloud, aux frameworks open source et aux outils tiers d'IA via les mêmes interfaces.

Architecture

Bâtie sur ACK, la suite cloud-native pour l'IA gère en amont les ressources de calcul, de stockage et de réseau hétérogènes, et expose en aval des clusters Kubernetes standard ainsi que leurs API. Sur cette base, elle fournit les composants d'ordonnancement, d'orchestration des données, de workflow et de gestion du cycle de vie dont vos charges de travail d'IA ont besoin.

image

Intégration avec PAI

La suite s'intègre à Platform for AI (PAI) pour former une plateforme d'IA performante et élastique. ACK améliore l'élasticité et l'efficacité des services PAI Data Science Workshop (DSW), Deep Learning Containers (DLC) et Elastic Algorithm Service (EAS). Déployez Lightweight Platform for AI dans votre cluster ACK en quelques clics pour intégrer les algorithmes et moteurs profondément optimisés de PAI dans vos charges de travail conteneurisées et accélérer à la fois l'entraînement et l'inférence. Pour plus d'informations, consultez Qu'est-ce que PAI ?

Fonctionnalités clés

La suite cloud-native pour l'IA utilise Kubernetes comme socle et offre une prise en charge et une optimisation complètes pour les applications et systèmes d'IA et de machine learning. Le tableau suivant décrit les fonctionnalités clés fournies par la suite cloud-native pour l'IA.

Fonctionnalité

Description

Références

Gestion des ressources hétérogènes

  • Prise en charge des ressources hétérogènes : outre les ressources prises en charge par ACK, la suite cloud-native pour l'IA prend également en charge des ressources hétérogènes telles que les GPU NVIDIA, les NPU, les FPGA, les VPU et RDMA. Ordonnancez, gérez et maintenez ces ressources de manière centralisée via la suite cloud-native pour l'IA.

  • Surveillance et maintenance : la suite cloud-native pour l'IA surveille les GPU selon plusieurs dimensions et affiche des informations visualisées sur l'allocation, l'utilisation et l'état de santé des GPU.

  • Amélioration de l'utilisation des ressources : la suite cloud-native pour l'IA prend en charge le partage des GPU, l'isolation de la mémoire GPU et l'ordonnancement des GPU conscient de la topologie pour vous aider à améliorer l'utilisation des ressources.

Ordonnancement des tâches d'IA

  • Politiques d'ordonnancement multiples : l'ordonnanceur ACK étend le framework d'ordonnancement natif de Kubernetes pour les tâches par lots, telles que les tâches d'entraînement distribué d'IA. Une variété de politiques d'ordonnancement par lots sont prises en charge, notamment l'ordonnancement gang (coscheduling), l'ordonnancement FIFO (First In First Out), l'ordonnancement basé sur la capacité, le partage équitable, ainsi que le bin packing et le spread.

  • Files d'attente de tâches : la suite cloud-native pour l'IA fournit des files d'attente de tâches basées sur les priorités, ce qui vous permet de personnaliser les priorités des tâches et de configurer des quotas élastiques pour les locataires.

  • Orchestration de workflows : intégrez Kubeflow Pipelines ou Argo Workflows pour orchestrer les workflows des tâches d'IA complexes.

Ordonnancement élastique

Ordonnancement élastique pour les tâches d'apprentissage profond distribué : la suite cloud-native pour l'IA met à l'échelle dynamiquement le nombre de workers et de nœuds sans affecter l'entraînement ni la précision du modèle. La suite ajoute des workers pour accélérer l'entraînement lorsque le cluster dispose de ressources inutilisées et libère des workers lorsque le cluster ne peut pas fournir suffisamment de ressources. Cela garantit que l'entraînement du modèle n'est pas affecté par un manque de ressources. Ce mode améliore considérablement l'utilisation globale des ressources du cluster et aide à éviter les pannes de nœuds. Il réduit également le temps d'attente pour le lancement des tâches.

Entraînement élastique basé sur Kubernetes

Orchestration et accélération des données d'IA

Fluid : introduit le concept de jeu de données. Il fournit aux tâches d'entraînement une abstraction des données et une plateforme d'orchestration et d'accélération des données pour vous aider à gérer les jeux de données, appliquer le contrôle d'accès et accélérer l'accès aux données. ack-fluid peut ingérer des données provenant de différents services de stockage et les agréger dans un même jeu de données. Vous pouvez également connecter ack-fluid à des services de stockage dans le cloud ou sur site dans un environnement de cloud hybride pour gérer les données et accélérer leur accès. En outre, ack-fluid peut être étendu pour prendre en charge une variété de services de cache distribués. Configurez un service de cache pour chaque jeu de données et utilisez des fonctionnalités telles que le préchauffage du jeu de données, la surveillance de la capacité du cache et la mise à l'échelle élastique pour réduire considérablement les coûts liés à l'ingestion distante des données pour les tâches d'entraînement et améliorer l'efficacité du calcul GPU.

Gestion du cycle de vie des tâches d'IA

  • Arena : simplifie le processus de production d'IA, couvrant des aspects clés tels que la gestion des données, le développement de modèles, l'entraînement et le déploiement de services d'inférence, tout en masquant les détails complexes de l'ordonnancement des ressources, de la configuration de l'environnement et de la surveillance. Arena est compatible avec les piles technologiques d'IA principales comme TensorFlow et PyTorch. Il prend également en charge des SDK multilingues pour un développement ultérieur. ack-arena est optimisé pour simplifier les opérations dans l'outil de gestion des tâches Arena. Installez ack-arena dans la console Container Service for Kubernetes (ACK) en quelques clics pour déployer Arena efficacement dans vos clusters ACK.

  • O&M visualisée : fournit des tableaux de bord faciles à utiliser et une console développeur pour vous permettre de consulter l'état de votre cluster et de soumettre rapidement des tâches d'entraînement.

Cas d'utilisation

La suite cloud-native pour l'IA convient à l'amélioration continue de l'utilisation des ressources hétérogènes et à la gestion efficace des charges de travail hétérogènes, telles que les tâches d'IA.Scenarios.png

Cas d'utilisation 1 : Améliorer continuellement l'utilisation des ressources hétérogènes

La suite cloud-native pour l'IA fournit une abstraction des ressources hétérogènes dans le cloud, y compris les ressources de calcul (telles que les CPU, GPU, NPU, VPU et FPGA), les ressources de stockage (OSS, NAS, CPFS et HDFS) et les ressources réseau (TCP et RDMA). Gérez, maintenez et allouez ces ressources de manière centralisée via la suite cloud-native pour l'IA, et améliorez continuellement l'utilisation des ressources grâce à la mise à l'échelle des ressources et à l'optimisation logicielle et matérielle.

Cas d'utilisation 2 : Gérer efficacement les charges de travail hétérogènes telles que les tâches d'IA

La suite cloud-native pour l'IA est compatible avec les moteurs open source principaux tels que TensorFlow, PyTorch, DeepSpeed, Ray, Horovod, Spark, Flink, Kubeflow, Kserve, vLLM et Triton Inference Server, et prend également en charge les moteurs et environnements d'exécution autogérés. La suite cloud-native pour l'IA optimise également continuellement les tâches d'entraînement en termes de performances, d'efficacité et de coûts, améliore l'expérience utilisateur en matière de développement et de maintenance, et accroît l'efficacité opérationnelle.

Rôles utilisateurs

La suite cloud-native pour l'IA définit les rôles utilisateurs suivants.

Rôle

Description

Administrateur O&M

Responsable de la construction de l'infrastructure d'IA et de l'administration quotidienne. Pour plus d'informations, consultez Déployer la suite, Gérer les utilisateurs, Gérer les groupes de quotas élastiques et Gérer les jeux de données.

Ingénieur en algorithmes et data scientist

Utilise la suite cloud-native pour l'IA pour gérer les tâches. Pour plus d'informations, consultez Entraînement des modèlesEntraînement des modèles dans les clusters Kubernetes, Gérer les modèles dans MLflow Model Registry via Arena et Analyser et optimiser les modèles.

Utiliser la suite cloud-native pour l'IA

Suivez les étapes illustrées dans la figure ci-dessous pour utiliser la suite cloud-native pour l'IA en fonction du rôle utilisateur que vous assumez.

Workflow.png

Étape

Description

Console

1. Préparatifs

(Administrateur O&M)

Créer un compte Alibaba Cloud

Créez un compte Alibaba Cloud et effectuez la vérification d'identité réelle. Pour plus d'informations, consultez Inscrire un compte Alibaba Cloud.

Page d'inscription Alibaba Cloud

Créer un cluster ACK

Activez ACK et créez un cluster ACK. Nous vous recommandons d'utiliser les configurations de cluster suivantes. Pour plus d'informations, consultez Créer un cluster ACK managé.

  • Type de cluster : cluster ACK Pro, cluster ACK Serverless Pro ou cluster ACK Edge Pro.

  • Version Kubernetes : 1,18 ou ultérieure.

  • Région : la région dans laquelle vous avez activé ACK.

Console ACK

(Facultatif) Configurer les dépendances du cluster et créer les ressources cloud associées

  • Installer et configurer le tableau de bord IA et la console développeur IA :

    • Installez l'agent Prometheus et Logtail dans le cluster ACK.

    • Créez une politique pour le cluster dans la console Resource Access Management (RAM). Pour plus d'informations, consultez AutorisationAutorisation.

    • Si vous souhaitez utiliser un nom de domaine interne ou public pour accéder au tableau de bord IA et à la console développeur IA, installez le contrôleur NGINX Ingress et activez l'accès interne ou Internet pour le contrôleur.

    • Pour utiliser une base de données MySQL préinstallée comme stockage, assurez-vous que les nœuds du cluster sont équipés de disques SSD Enterprise (ESSD).

    • Pour utiliser une base de données ApsaraDB RDS comme stockage, vous devez acheter une instance ApsaraDB RDS et créer un secret nommé kubeai-rds dans le namespace kube-ai.

    Pour plus d'informations, consultez Configurer la console IA.

  • Installer et configurer Kubeflow Pipelines :

2. Système et environnement

(Administrateur O&M)

Activer et installer la suite cloud-native pour l'IA

  1. Accédez à la page d'activation pour activer la suite cloud-native pour l'IA.

  2. Installez la suite cloud-native pour l'IA et les composants associés. Pour plus d'informations, consultez Déployer la suite cloud-native pour l'IA. Pour plus d'informations sur les composants utilisés pour installer la suite cloud-native pour l'IA, consultez Présentation des composants et historique des versions.

Console ACK

Gérer les utilisateurs et les quotas

  1. Ajoutez des nœuds de quota et définissez des quotas de ressources.

  2. Créez des utilisateurs et des groupes d'utilisateurs, allouez des ressources et associez des groupes de quotas.

    Pour plus d'informations, consultez Gérer les utilisateurs, Gérer les groupes d'utilisateurs et Gérer les groupes de quotas élastiques.

  3. Générez un fichier kubeconfig et un jeton de connexion pour un utilisateur nouvellement créé. Pour plus d'informations, consultez Générer un kubeconfig et un jeton.

Tableau de bord IA et kubectl

Remarque

Les consoles IA fournies par Alibaba Cloud (y compris la console développeur et la console O&M) sont disponibles en tant que fonctionnalité sur liste d'autorisation à partir du 22 janvier 2025. Si vous avez déployé ces consoles avant l'entrée en vigueur de la liste d'autorisation, votre déploiement existant ne sera pas affecté. Les utilisateurs qui ne figurent pas sur la liste d'autorisation peuvent installer et configurer la console de la suite IA à partir de la communauté open source. Pour plus d'informations sur la configuration open source, consultez Console IA open source.

Préparer les données

  1. Créez des jeux de données.

  2. (Facultatif) Accélérez les jeux de données. Pour plus d'informations, consultez Jeux de données élastiques.

(Ingénieur en algorithmes et data scientist)

La suite cloud-native pour l'IA permet aux ingénieurs en algorithmes et aux data scientists d'utiliser Arena, la console web et la console développeur IA pour développer des modèles, entraîner des modèles, déployer des services d'inférence et gérer des tâches.

  • Utiliser la CLI ou la console

    Installez la CLI Arena ou la console développeur IA. Pour plus d'informations, consultez Configurer le client Arena et Configurer la console IA.

    Remarque

    Les consoles IA fournies par Alibaba Cloud (y compris la console développeur et la console O&M) sont disponibles en tant que fonctionnalité sur liste d'autorisation à partir du 22 janvier 2025. Si vous avez déployé ces consoles avant l'entrée en vigueur de la liste d'autorisation, votre déploiement existant ne sera pas affecté. Les utilisateurs qui ne figurent pas sur la liste d'autorisation peuvent installer et configurer la console de la suite IA à partir de la communauté open source. Pour plus d'informations sur la configuration open source, consultez Console IA open source.

  • Utiliser Lightweight Platform for AI

Console ACK

3. Entraînement et déploiement des modèles

(Ingénieur en algorithmes et data scientist)

Lorsque vous utilisez Arena ou la console développeur IA, vous pouvez suivre les étapes suivantes pour entraîner et déployer des modèles :

Développer des modèles

  1. Créez et utilisez un notebook Jupyter. Pour plus d'informations, consultez Créer et utiliser un notebook Jupyter.

  2. Utilisez le notebook Jupyter pour développer et tester un modèle.

  3. Utilisez le notebook Jupyter pour soumettre du code à un dépôt Git.

Entraîner des modèles

  1. Soumettez une tâche d'entraînement à l'aide de la console développeur IA ou d'Arena.

  2. Consultez les journaux ou les données TensorBoard de la tâche.

    Pour plus d'informations, consultez Entraînement des modèlesEntraînement des modèles.

Gérer les modèles

  1. Créez un modèle et associez-le à une tâche d'entraînement.

  2. Utilisez la console développeur IA ou la CLI Arena pour gérer le modèle. Pour plus d'informations, consultez Gérer les modèles dans MLflow Model Registry via Arena.

Déployer des modèles

Déployez un modèle en tant que service d'inférence. Pour plus d'informations, consultez Déploiement de services d'IADéployer des services d'IA.

Console développeur IA et Arena

Utilisez Lightweight Platform for AI pour développer, entraîner et déployer des modèles.

S.O.

4. Surveillance et maintenance

(Administrateur O&M)

Surveiller et maintenir les ressources

Consultez les tableaux de bord de diverses ressources, y compris les clusters, les nœuds, les tâches d'entraînement et les quotas de ressources. Pour plus d'informations, consultez Tableaux de bord de surveillance cloud-native pour l'IA.

Tableau de bord IA

Gérer les quotas

  • Créez, interrogez, mettez à jour et supprimez des groupes de quotas et des ressources dans les groupes de quotas.

  • Modifiez les types de ressources.

    Pour plus d'informations, consultez Gérer les groupes de quotas élastiques.

Gérer les utilisateurs

Créez, interrogez, mettez à jour et supprimez des utilisateurs ou des groupes d'utilisateurs. Pour plus d'informations, consultez Gérer les utilisateurs et Gérer les groupes d'utilisateurs.

Gérer les jeux de données

Gérer les tâches élastiques

Consultez les tâches élastiques et les détails des tâches. Pour plus d'informations, consultez Afficher les tâches élastiques.

5. Facturation et paiements

(Administrateur O&M)

À partir du 6 juin 2024 à 00:00:00 (UTC+8), la suite cloud-native pour l'IA est gratuite. Pour plus d'informations, consultez Facturation de la suite cloud-native pour l'IA.

Dépenses et coûts

Générer des factures quotidiennement

  • Interrogez les factures.

  • Interrogez les détails de facturation.

  • Interrogez les détails d'utilisation des ressources.

  • Interrogez l'utilisation des services et les prix.

    Pour plus d'informations, consultez Facturation de la suite cloud-native pour l'IA.

Règles de facturation

Pour plus d'informations, consultez Facturation de la suite cloud-native pour l'IA.

Références

Référence

Description

Vous aide à appliquer rapidement la suite cloud-native pour l'IA à vos travaux de développement et d'O&M grâce à quelques pratiques.

Notes de version

Décrit les notes de version de la suite cloud-native pour l'IA.