EAS (Elastic Algorithm Service) vous permet de déployer des modèles entraînés sous forme de service d’inférence en ligne ou d’application web IA. EAS prend en charge des ressources hétérogènes et combine des fonctionnalités telles que la mise à l’échelle automatique, les tests de charge en un clic, le déploiement canari et la surveillance en temps réel afin de garantir la stabilité du service dans des scénarios à forte concurrence, tout en réduisant les coûts.
Architecture du produit

Fonctionnalités principales
EAS couvre l’intégralité du flux de travail, de la gestion des ressources et du déploiement des modèles jusqu’à l’exploitation et la maintenance (O&M) des services.
Gestion flexible des ressources et des coûts
Prise en charge du matériel hétérogène : Prend en charge les CPU, les GPU et les instances spécialisées d’accélérateurs IA pour répondre aux besoins de performance de différents modèles.
Optimisation des coûts : Prend en charge les instances préemptibles pour réduire considérablement les coûts de calcul. Grâce à la mise à l’échelle planifiée, définissez des politiques basées sur les cycles métier afin de contrôler précisément l’allocation des ressources.
Pool de ressources élastique : Lorsqu’un groupe de ressources dédiées est entièrement utilisé, EAS planifie automatiquement de nouvelles instances vers le groupe de ressources public, équilibrant ainsi le contrôle des coûts et la stabilité du service.
Stabilité et haute disponibilité
Mise à l’échelle élastique : Ajuste automatiquement le nombre de réplicas de service en fonction de la charge de travail en temps réel pour gérer les pics de trafic imprévisibles, évitant ainsi la sous-utilisation des ressources ou la surcharge du service.
Mécanisme de haute disponibilité : La récupération automatique après incident assure la continuité du service. Les ressources dédiées sont isolées physiquement, éliminant le risque de préemption des ressources.
Déploiements sécurisés : Prend en charge le déploiement canari, qui permet de diriger un pourcentage du trafic vers une nouvelle version pour validation. Il prend également en charge la mise en miroir du trafic, qui copie le trafic de production vers un service de test pour vérifier la fiabilité sans affecter les requêtes des utilisateurs réels.
Déploiement et O&M efficaces
Test de charge en un clic : Augmente dynamiquement la charge pour sonder les limites de performance du service. Consultez les données de surveillance au niveau de la seconde et les rapports de test de charge en temps réel pour évaluer rapidement les capacités de votre service.
Surveillance en temps réel : Fournit une surveillance en temps réel des métriques clés telles que les QPS, le temps de réponse et l’utilisation du CPU. Activez les alertes de surveillance des services pour rester informé de l’état de santé de votre service.
Plusieurs méthodes de déploiement : Prend en charge le déploiement de services à l’aide d’une image d’exécution (recommandée) ou d’un déploiement par processeur pour s’adapter à différentes piles technologiques.
Modes d’inférence diversifiés
Inférence synchrone en temps réel : Offre un débit élevé et une faible latence, ce qui la rend adaptée aux scénarios sensibles à la latence, tels que les recommandations de recherche et les bots conversationnels.
Inférence asynchrone quasi temps réel : Inclut une file d’attente de messages intégrée, idéale pour les tâches de longue durée telles que la génération d’images à partir de texte et le traitement vidéo. Elle prend en charge la mise à l’échelle automatique en fonction de l’arriéré de la file d’attente pour éviter l’accumulation de requêtes.
Inférence par lots hors ligne : Adaptée aux scénarios de traitement par lots non sensibles aux temps de réponse, tels que la conversion par lots de données vocales. Elle prend également en charge les instances préemptibles pour réduire les coûts.
Procédure
Étape 1 : Préparer les ressources et les fichiers
-
Préparer les ressources d’inférence : Sélectionnez un type de ressource EAS approprié en fonction de la taille de votre modèle, de vos besoins en concurrence et de votre budget. Pour obtenir des conseils sur la sélection et l’achat de ressources, consultez Vue d’ensemble des ressources de déploiement EAS.
RemarqueVous pouvez utiliser directement les ressources publiques sans les acheter au préalable. D’autres types de ressources, tels que les groupes de ressources EAS et les quotas de ressources, doivent être achetés avant utilisation.
Préparer les fichiers : Téléchargez votre modèle entraîné, votre code de traitement et vos dépendances vers un service de stockage cloud tel qu’Object Storage Service (OSS). Vous pouvez ensuite accéder à ces fichiers depuis votre service en utilisant le montage du stockage.
Étape 2 : Déployer le service
Déployez et gérez des services à l’aide de la console, de l’outil de ligne de commande EASCMD ou d’un SDK. Pour plus d’informations, consultez la section Déploiement de service.
Console : Propose des options de déploiement personnalisé et de déploiement basé sur des scénarios faciles à utiliser, idéales pour les débutants. Pour les modèles sans solution de déploiement prédéfinie dans EAS, tels que les modèles tiers comme MinerU, créez un service à l’aide de la fonctionnalité Custom Deployment. Pour ce faire, préparez les fichiers de modèle et de configuration et téléchargez-les vers un service de stockage cloud tel qu’OSS.
Outil de ligne de commande EASCMD : Prend en charge des opérations telles que la création, la mise à jour et la consultation des services. Il convient aux développeurs d’algorithmes familiarisés avec EAS.
SDK : Idéal pour la planification et l’O&M unifiées à grande échelle.
Étape 3 : Appeler et tester le service sous charge
Application web : Si vous déployez votre service en tant qu’application web IA, ouvrez directement la page interactive dans un navigateur pour la tester.
Service API : Utilisez la fonctionnalité de débogage en ligne pour vérifier la fonctionnalité du service, ou appelez l’API de manière synchrone ou asynchrone. Pour plus d’informations, consultez la section Appel de service.
Test de charge du service : Utilisez l’outil intégré de test de charge en un clic pour tester les performances de votre service sous pression. Pour plus d’informations, consultez la section Test de charge du service.
Étape 4 : Surveiller et gérer le service
Surveillance et alertes : Dans la liste des services d’inférence, affichez l’état d’exécution et les informations sur le groupe de ressources pour vos services, et filtrez-les par groupe de ressources. Nous vous recommandons d’activer les alertes de surveillance des services pour rester informé en temps réel de l’état de santé du service.
Mise à l’échelle élastique : Configurez des politiques de mise à l’échelle élastique ou de mise à l’échelle planifiée en fonction de vos besoins métier pour gérer dynamiquement les ressources de calcul.
-
Mises à jour du service : Dans la colonne Actions, cliquez sur Update pour déployer une nouvelle version. Une fois la mise à jour terminée, affichez les informations de version ou basculez entre les versions.
AvertissementLes mises à jour du service provoquent une interruption temporaire du service, ce qui peut entraîner l’échec des requêtes dépendantes. Agissez avec prudence.
Migration de service : Pour migrer la configuration d’un service EAS d’une région à une autre, utilisez l’outil de ligne de commande EASCMD pour exporter la configuration du service depuis la région source. Utilisez ensuite la configuration exportée pour créer un nouveau service dans la région de destination.
Remarques importantes
Si un service EAS reste dans un état autre que Running pendant 180 jours consécutifs, le système le supprime automatiquement.
EAS prend en charge les régions répertoriées dans la section Régions et zones de disponibilité.
Facturation
Pour plus d’informations, consultez la section Facturation d’Elastic Algorithm Service (EAS).
Démarrage rapide
Consultez le guide Démarrage rapide pour Elastic Algorithm Service (EAS).
Cas d’utilisation
LLM : Déployer un grand modèle de langage (LLM) | Déployer un modèle Mixture-of-Experts (MoE) en utilisant le parallélisme d’experts et la séparation du parallélisme pipeline-données
AIGC : Génération vidéo IA - Déployer ComfyUI | Génération artistique IA - Déployer SD-WebUI
Autres : Accéder à une passerelle dédiée entièrement gérée entre VPC | Meilleures pratiques pour PAI-EAS Spot
FAQ
Q : Ressources dédiées ou ressources publiques ?
Ressources publiques : Adaptées au développement, aux tests ou aux applications à petite échelle sensibles aux coûts et pouvant tolérer des fluctuations de performance. Elles sont peu coûteuses, mais peuvent subir une contention des ressources pendant les heures de pointe.
Ressources dédiées : Idéales pour les environnements de production nécessitant une grande stabilité et de hautes performances. Elles sont isolées physiquement, éliminant le risque de préemption des ressources. La fonctionnalité de pool de ressources élastique permet aux charges de travail de déborder vers les ressources publiques lorsque la capacité dédiée est épuisée, équilibrant ainsi le coût et la stabilité pendant les heures de pointe. Pour réserver des types d’instances dont l’inventaire est limité, vous devez les acheter en tant que ressources dédiées.
Q : EAS ou services auto-gérés
EAS fournit une O&M gérée. Il gère automatiquement la planification des ressources, la récupération après incident et la surveillance, et inclut des fonctionnalités intégrées telles que la mise à l’échelle élastique et le déploiement canari. Cela permet aux développeurs de se concentrer sur le développement de modèles, réduisant ainsi la charge opérationnelle et accélérant la mise sur le marché.
Références
Documentation API : Vue d’ensemble de l’API
FAQ : FAQ sur EAS