PAI-Lingjun Intelligent Computing Service

Plateforme complète de calcul IA pour les tâches de calcul haute performance, telles que l'entraînement de grands modèles de langage (LLM).

PAI-Lingjun Intelligent Computing Service est actuellement disponible uniquement en Chine (Ulanqab) et à Singapour. Veuillez contacter les ventes pour tout achat ou toute consultation.

Pourquoi PAI-Lingjun Intelligent Computing Service

PAI-Lingjun Intelligent Computing Service est un service PaaS dédié à l'apprentissage profond à grande échelle et au calcul intelligent intégré. Ce service propose à la fois la Serverless Edition sur le cloud public Alibaba Cloud et l'Exclusive Edition. Grâce à une technologie d'optimisation intégrée logicielle et matérielle, PAI-Lingjun Intelligent Computing Service offre une base de calcul hétérogène haute performance et des capacités d'IA pour l'ingénierie de processus. Ses principaux avantages sont la haute performance, l'efficacité et l'utilisation optimale des ressources, répondant aux exigences du calcul haute performance pour l'entraînement de modèles de fondation, la conduite autonome, la recherche scientifique et la finance.

  • Serverless

    Lingjun Serverless Edition vous permet de configurer et d'exécuter rapidement des tâches de calcul IA. Cette édition gère les systèmes hétérogènes complexes grâce à une exploitation et maintenance (O&M) automatisée, et s'intègre de manière transparente aux services de calcul, de stockage et de réseau d'Alibaba Cloud.

  • Réseau RDMA haute performance

    Les réseaux Remote Direct Memory Access (RDMA) haute performance d'Alibaba Cloud accélèrent considérablement l'entraînement IA, grâce à une transmission à haut débit et faible latence à 800 Gbit/s et à des technologies de connexion directe GPU qui améliorent la stabilité et la sécurité de la transmission.

  • Système de stockage CPFS performant

    Cloud Paralleled File System (CPFS) utilise une architecture de stockage entièrement parallèle et prend en charge les protocoles POSIX/MPI-IO et Network File System (NFS). Un seul cluster offre un débit de données pouvant atteindre 2 To/s et 30 millions d'IOPS, fournissant des services de stockage performants et fiables pour l'entraînement IA.

  • Accélération IA complète

    Notre moteur d'accélération de l'entraînement distribué fournit l'accélération des jeux de données, l'accélération du calcul, l'optimisation des algorithmes, des algorithmes d'ordonnancement et l'optimisation des ressources. Cela garantit une utilisation optimale de la puissance de calcul et améliore considérablement la vitesse et l'efficacité de l'entraînement et de l'inférence IA.

Éditions

PAI-Lingjun Intelligent Computing Service Serverless Edition

La Serverless Edition offre une option flexible et économique. Vous pouvez acquérir des services réseau et de stockage en fonction de vos besoins métier et les faire évoluer en quelques clics. Après l'achat des noeuds de calcul, vous bénéficiez d'une exploitation et maintenance sans coût supplémentaire, sans avoir à planifier de noeuds de gestion CPU.

  • Composants principaux :

  • GPU pour PAI-Lingjun Intelligent Computing Service

  • Système de stockage CPFS

PAI-Lingjun Intelligent Computing Service Exclusive Edition

L'Exclusive Edition vous permet de créer des clusters exclusivement dédiés sur Alibaba Cloud, qui met à votre disposition une plateforme d'IA et des services d'exploitation et maintenance exclusivement réservés à votre activité, ainsi qu'une gestion simplifiée des opérations reposant sur les services de calcul, de stockage et de réseau standardisés et interconnectés d'Alibaba Cloud.

  • Composants principaux :

  • GPU pour PAI-Lingjun Intelligent Computing Service

  • Lingjun Cloud Connection

  • Système de stockage CPFS

  • Container Service for Kubernetes (ACK) pour Lingjun

  • Instances Elastic Compute Service (ECS)

  • ApsaraDB RDS

Fonctionnalités

Plateforme de calcul IA nouvelle génération offrant une puissance de calcul IA à grande échelle

Plateforme de développement IA de niveau entreprise

Capacités complètes d'ingénierie IA couvrant l'ensemble du cycle de vie : développement et entraînement IA, gestion des rôles IA et gestion des ressources de calcul.

Services de calcul IA tout-en-un

Vous pouvez activer et gérer des clusters de calcul, des systèmes de stockage hautes performances, des services de conteneurs et des plateformes de développement IA en quelques clics. Vous pouvez également gérer les cycles de vie et exécuter rapidement des tâches de calcul IA grâce à une exploitation et maintenance entièrement automatisée.

Calcul distribué simple d'utilisation

Les tâches d'entraînement de modèles de fondation peuvent être distribuées pour s'exécuter automatiquement et simultanément après de simples configurations. Les architectures optimisées de calcul, de réseau, de communication et de stockage améliorent l'utilisation des ressources et accélèrent l'entraînement des modèles, réduisant considérablement les coûts et les délais.

Gestion des clusters

Vous pouvez créer rapidement des clusters via la console ou par appel d'API, surveiller les clusters et diagnostiquer les erreurs d'hôtes et de services de manière visuelle grâce à un large éventail de métriques de surveillance, d'événements et de statistiques. Vous pouvez également effectuer des analyses de cause racine et optimiser les performances à l'aide d'outils de diagnostic et d'analyse associés pour les hôtes, les réseaux et les tâches.

Réseau RDMA

Les réseaux RDMA hautes performances de calcul, de stockage et de contrôle permettent un accès performant et hautement disponible aux services Alibaba Cloud, avec des fonctionnalités telles que l'isolation de sécurité renforcée, le déploiement en quelques minutes, l'accélération continue et la haute fiabilité.

Stockage hautes performances

L'architecture d'E/S parallèles améliore les performances de stockage. Un seul cluster prend en charge un débit de données allant jusqu'à 2 To/s et 30 millions d'IOPS, et peut communiquer avec les systèmes de stockage cloud et sur site.

Fonctionnement

Présentation

PAI-Lingjun Intelligent Computing Service prend en charge le développement d'IA avec le calcul serverless, ainsi que l'entraînement de modèles de fondation tels que Stable Diffusion, Llama 2 et Open Pre-trained Transformer (OPT). Ce service fournit des capacités de calcul intelligent hautement optimisées pour le traitement d'images (comme la génération d'images par IA générative), le traitement du langage naturel (comme la génération de texte par IA générative), le traitement audio et le traitement vidéo, afin d'améliorer les performances et l'efficacité de l'entraînement IA.

Optimisation complète pour une efficacité accrue

  • Débit et IOPS ultra-élevés

    Pour les tâches d'entraînement IA, les données sont préchargées dans un stockage persistant afin de garantir une bande passante élevée pour le chargement et l'écriture des données, ce qui améliore l'efficacité de l'entraînement.

  • Utilisation optimale des ressources

    La segmentation fine et l'ordonnancement hautement efficace des ressources GPU facilitent le développement collaboratif. Cette technologie a été validée lors d'applications à grande échelle pendant le Double 11 Global Shopping Festival, avec une multiplication par 3 de l'utilisation des ressources.

Présentation

La puissance de calcul intégrée à très grande échelle prend en charge le déploiement et l'ordonnancement unifiés des tâches d'apprentissage profond et de calcul haute performance. Elle fournit également des services de calcul standard unifiés pour la recherche scientifique, la R&D médicale et la simulation d'ingénierie, favorisant l'innovation, améliorant l'efficacité et facilitant l'intégration des écosystèmes IA et HPC.

Développement intégré pour l'innovation

  • Prise en charge de la recherche scientifique

    Lingjun prend en charge le développement d'applications d'IA cloud natif et de HPC, et fournit des services de calcul unifiés pour la recherche scientifique, la R&D médicale et la simulation d'ingénierie. Ce service améliore la collaboration inter-régions, l'utilisation des ressources et l'intégration des écosystèmes techniques.

  • Plateforme complète pour la recherche scientifique

    Grâce au réseau RDMA et à la bibliothèque de communication haute performance d'Alibaba Cloud, Lingjun réduit la latence point à point des applications d'IA et de HPC à 2 microsecondes, et permet à des dizaines de milliers de nœuds de calcul de fonctionner en parallèle, améliorant considérablement l'efficacité du calcul scientifique à grande échelle.

Lingjun accélère l'IA générative d'Alibaba Cloud

Guide d'utilisation

1
Acheter des noeuds de calcul
Contacter les ventes
  • Vous pouvez acheter des noeuds de calcul du type souhaité en fonction de vos besoins métier.
  • 1. Connectez-vous à la console Lingjun Intelligent Computing Service.
  • 2. Dans le volet de navigation de gauche, sélectionnez Cluster and Node > Node Management.
  • 3. Cliquez sur Buy a new node pour accéder à la page d'achat, puis sélectionnez les spécifications du produit.
2
Acheter Lingjun Cloud Connection
Contacter les ventes
  • Un cluster de noeuds Lingjun ne peut être connecté au cloud public que par une seule instance Lingjun Cloud Connection.
  • 1. Connectez-vous à la console Lingjun Intelligent Computing Service et accédez à la page d'achat de Lingjun Cloud Connection.
  • 2. Sélectionnez les spécifications, puis cliquez sur Acheter et finalisez le paiement selon les instructions.
3
Acheter le stockage CPFS
Contacter les ventes
  • Nos experts techniques vous aideront à finaliser la configuration réseau après l'achat.
  • 1. Accédez à la page d'achat du système de stockage CPFS.
  • 2. Sélectionnez les spécifications, puis cliquez sur Acheter et finalisez le paiement selon les instructions.
  • Remarque : le système de stockage CPFS doit se trouver dans la même région que Lingjun Intelligent Computing Service. Le stockage CPFS est facturé séparément.

Assistance améliorée pour vous

Conseil de prévente individualisé, assistance technique 24 h/24, 7 j/7, réponse plus rapide et plus de tickets.

Conseil de prévente individualisé

Conseils d’experts du cloud expérimentés. En savoir plus

Assistance technique 24 h/24, 7 j/7

Temps de service prolongé de 10 heures, 5 jours par semaine à 24 heures sur 24, 7 jours sur 7. En savoir plus

6 tickets gratuits par trimestre

Le nombre de tickets gratuits a doublé, passant de 3 à 6 par trimestre. En savoir plus

Réponse plus rapide

Temps de réponse après-vente raccourci de 36 heures à 18 heures. En savoir plus
phone Contacter
Hi, I'm Alibaba Cloud AI Assistant!
I can help with questions and solutions.