Les instances CPU de base suffisent généralement aux scénarios de calcul généraliste sur Function Compute, tels que les services web et le traitement des données. Toutefois, pour les cas d'usage nécessitant un calcul parallèle à grande échelle ou du deep learning (traitement audio et vidéo, inférence d'intelligence artificielle, édition d'images), les instances accélérées par GPU améliorent considérablement l'efficacité des calculs.
Pour les instances GPU, Function Compute propose trois types d'instances : élastiques, provisionnées et mixtes (provisionnées + élastiques). Sélectionnez le type et les spécifications adaptés à vos besoins métier afin de garantir la stabilité des opérations tout en optimisant l'utilisation des ressources et les performances.
Choix du type d'instance
Les fonctions CPU prennent uniquement en charge les instances élastiques. Les fonctions GPU sont compatibles avec trois types d'instances, entre lesquels vous pouvez basculer à tout moment sans interruption de service.
Guide de décision
Répondez aux questions suivantes pour identifier le type d'instance approprié :
Votre charge de travail est-elle sensible à la latence et interactive ? Par exemple, un chatbot en temps réel ou une API de génération d'images. Dans ce cas, utilisez des instances provisionnées pour éliminer les démarrages à froid et garantir les temps de réponse.
Votre trafic suit-il une base prévisible avec des pics occasionnels ? Optez pour le mode mixte (instances provisionnées + élastiques) afin de maintenir une capacité de base stable tout en absorbant les pics de trafic.
Votre trafic est-il variable, irrégulier ou peu fréquent ? Privilégiez les instances élastiques pour ne payer que l'utilisation active.
Comparaison des types d'instances
|
Instance élastique |
Instance provisionnée |
Instances provisionnées + élastiques (mode mixte) |
|
|
Cas d'usage |
Fonctions CPU (seule option) ; fonctions GPU |
Fonctions GPU uniquement |
Fonctions GPU uniquement |
|
Démarrage à froid |
Oui, si le nombre minimal d'instances est égal à 0. Définissez ce minimum à 1 ou plus pour préallouer des ressources et réduire les démarrages à froid. |
Aucun. Toutes les requêtes dans la limite de la capacité allouée reçoivent une réponse en temps réel. |
Partiel. Les requêtes traitées par le pool provisionné n'ont pas de démarrage à froid, contrairement à celles gérées par les instances élastiques issues de la mise à l'échelle automatique. |
|
Modèle de facturation |
Paiement à l'utilisation |
Abonnement |
Abonnement (partie provisionnée) + paiement à l'utilisation (partie élastique) |
|
Idéal pour |
Trafic variable ou peu fréquent ; charges de travail sensibles aux coûts |
Charges de travail sensibles à la latence ou à trafic stable |
Charges de travail avec une base prévisible et des pics de trafic imprévisibles |
Instance élastique
Les instances élastiques s'adaptent automatiquement au volume de requêtes et sont libérées lorsqu'elles sont inactives. En définissant le nombre minimal d'instances à 0, vous adoptez un modèle de paiement à l'utilisation pur : vous ne payez que pour l'utilisation active.
Comportement de démarrage à froid : les démarrages à froid surviennent lors de la mise à l'échelle depuis zéro instance. Pour en réduire la latence, définissez le nombre minimal d'instances à 1 ou plus. Cela permet de préallouer des ressources élastiques afin que les instances soient prêtes à traiter rapidement les requêtes entrantes.
Facturation : les coûts incluent les instances actives ainsi que celles en état d'hibernation légère. En hibernation légère, les ressources vCPU ne sont pas facturées et les ressources GPU sont facturées au cinquième du tarif actif. Si vous définissez le nombre minimal d'instances à 1 ou plus, activez l'hibernation légère pour réduire les coûts liés à l'inactivité.
Privilégiez les instances élastiques lorsque :
Votre trafic est variable, irrégulier ou peu fréquent
Vous souhaitez payer uniquement pour l'utilisation réelle
Votre charge de travail tolère une latence occasionnelle due aux démarrages à froid (ou vous l'atténuez via un nombre minimal d'instances)
Instance provisionnée
Les instances provisionnées concernent exclusivement les fonctions GPU. Achetez un pool de ressources provisionnées à l'avance, puis allouez un nombre et un type d'instances spécifiques à votre fonction. Cette approche élimine les démarrages à froid dans la limite de la capacité allouée et garantit des coûts fixes et prévisibles.
Après l'achat d'un pool de ressources provisionnées mensuel, la plateforme fournit un quota supplémentaire d'instances boost sans frais supplémentaires.
Comportement de démarrage à froid : aucun. Toutes les requêtes dans la limite de votre capacité allouée reçoivent une réponse en temps réel. Nombre maximal de requêtes simultanées = (Nombre d'instances provisionnées allouées) × (Concurrence par instance) + quota d'instances boost. Les requêtes dépassant cette limite sont limitées.
Facturation : le montant total de l'abonnement correspond à l'ensemble des pools de ressources provisionnées achetés. Les instances boost ne sont pas facturées.
Les instances provisionnées sont disponibles uniquement pour les fonctions GPU des séries Ada, Ada.2, Ada.3, Hopper ou Xpu.1.
Optez pour les instances provisionnées lorsque :
Votre charge de travail est sensible à la latence et interactive (par exemple, un chatbot en temps réel ou une API de génération d'images)
Votre trafic est régulier et prévisible
Vous avez besoin d'une capacité garantie et de temps de réponse constants
Instances provisionnées + élastiques (mode mixte)
Le mode mixte s'applique uniquement aux fonctions GPU. Il combine instances provisionnées et élastiques : le pool provisionné traite en priorité le trafic de fond, tandis que les instances élastiques se mettent à l'échelle automatiquement lorsque les requêtes dépassent la capacité provisionnée. Vous bénéficiez ainsi d'une base garantie tout en conservant la flexibilité nécessaire pour absorber les pics de trafic soudains.
Comportement de démarrage à froid : partiel. Les requêtes traitées au sein du pool provisionné ne subissent aucun démarrage à froid. En revanche, celles qui déclenchent la mise à l'échelle automatique vers de nouvelles instances élastiques en entraînent un.
Facturation : la partie provisionnée est déduite du quota de votre pool de ressources provisionnées acheté. Les instances élastiques lancées au-delà de ce quota sont facturées selon le modèle de paiement à l'utilisation, aux mêmes tarifs que les instances élastiques actives ou en hibernation légère.
Choisissez le mode mixte lorsque :
Votre trafic présente une base prévisible mais connaît des pics occasionnels
Vous recherchez des performances stables pour une charge normale, avec la capacité d'absorber un trafic ponctuel élevé
Vous souhaitez trouver un équilibre entre prévisibilité des coûts et flexibilité de mise à l'échelle
Spécifications des instances
-
Instances CPU
vCPU (cœur)
Taille de la mémoire (Mo)
Taille maximale du package de code (Go)
Durée maximale d'exécution de la fonction (s)
Taille maximale du disque (Go)
Bande passante maximale (Gbit/s)
0,05 à 16
Remarque : La valeur doit être un multiple de 0,05.
128 à 32 768
Remarque : La valeur doit être un multiple de 64.
10
86 400
10
Valeurs valides :
512 Mo. Il s'agit de la valeur par défaut.
10 Go.
5
RemarqueLe ratio entre les vCPU et la taille de la mémoire (en Go) doit être compris entre 1:1 et 1:4.
-
Spécifications matérielles des instances GPU
Type d'instance
Mémoire GPU
Puissance de calcul FP16
Puissance de calcul FP32
Cartes max. par instance
fc.gpu.tesla.1
16 Go
65 TFLOPS
8 TFLOPS
4 cartes
fc.gpu.ampere.1
24 Go
125 TFLOPS
31,2 TFLOPS
8 cartes
fc.gpu.ada.1
48 Go
119 TFLOPS
60 TFLOPS
fc.gpu.ada.2
24 Go
166 TFLOPS
83 TFLOPS
fc.gpu.ada.3
48 Go
148 TFLOPS
73,5 TFLOPS
fc.gpu.hopper.1
96 Go
148 TFLOPS
44 TFLOPS
fc.gpu.hopper.2
141 Go
148 TFLOPS
44 TFLOPS
fc.gpu.blackwell.1
32 Go
104,8 TFLOPS
104,8 TFLOPS
fc.gpu.xpu.1
96 Go
123 TFLOPS
61,5 TFLOPS
16 cartes
-
Règles de configuration des vCPU et de la mémoire pour les instances GPU
RemarqueFormule pour les ressources multi-cartes : Total vCPU = vCPU par carte × Nombre de cartes, et Mémoire totale = Mémoire par carte × Nombre de cartes.
Type d'instance
vCPU (par carte)
Plage de mémoire par carte
Incrément de mémoire
fc.gpu.tesla.1
4 cœurs
4 à 16 Go (4 096 à 16 384 Mo)
4 Go (4 096 Mo)
8 cœurs
8 à 32 Go (8 192 à 32 768 Mo)
16 cœurs
16 à 64 Go (16 384 à 65 536 Mo)
fc.gpu.ampere.1
8 cœurs
8 à 32 Go (8 192 à 32 768 Mo)
16 cœurs
16 à 32 Go (16 384 à 32 768 Mo)
fc.gpu.ada.1
fc.gpu.ada.2
fc.gpu.ada.3
4 cœurs
16 à 32 Go (16 384 à 32 768 Mo)
8 cœurs
32 à 64 Go (32 768 à 65 536 Mo)
16 cœurs
64 à 120 Go (65 536 à 122 880 Mo)
fc.gpu.hopper.1
4 cœurs
16 à 32 Go (16 384 à 32 768 Mo)
8 cœurs
32 à 64 Go (32 768 à 65 536 Mo)
16 cœurs
64 à 96 Go (65 536 à 98 304 Mo)
24 cœurs
96 à 120 Go (98 304 à 122 880 Mo)
fc.gpu.hopper.2
4 cœurs
16 à 32 Go (16 384 à 32 768 Mo)
8 cœurs
32 à 64 Go (32 768 à 65 536 Mo)
16 cœurs
64 à 128 Go (65 536 à 131 072 Mo)
24 cœurs
96 à 248 Go (98 304 à 253 952 Mo)
fc.gpu.blackwell.1
4 cœurs
16 à 32 Go (16 384 à 32 768 Mo)
8 cœurs
32 à 64 Go (32 768 à 65 536 Mo)
16 cœurs
64 à 120 Go (65 536 à 122 880 Mo)
24 cœurs
96 à 184 Go (98 304 à 188 416 Mo)
fc.gpu.xpu.1
4 cœurs
16 à 48 Go (16 384 à 49 152 Mo)
8 cœurs
32 à 96 Go (32 768 à 98 304 Mo)
12 cœurs
48 à 120 Go (49 152 à 122 880 Mo)
-
Les instances accélérées par GPU prennent également en charge les spécifications de ressources suivantes.
Taille de l'image (Go)
Durée maximale d'exécution de la fonction (s)
Taille du disque
Bande passante maximale (Gbit/s)
ACR Enterprise Edition (Standard Edition) : 15
ACR Enterprise Edition (Premium Edition) : 15
ACR Enterprise Edition (Basic Edition) : 15
ACR Personal Edition (Free) : 15
86 400
512 Mo
10 Go à 200 Go, par incréments de 10 Go
5
RemarqueDéfinir le type d'instance sur g1 équivaut à le définir sur fc.gpu.tesla.1.
Les instances accélérées par GPU de la série Tesla sont prises en charge dans les régions suivantes : Chine (Hangzhou), Chine (Shanghai), Chine (Pékin), Chine (Zhangjiakou), Chine (Shenzhen), Japon (Tokyo), États-Unis (Virginie) et Singapour.
Les instances accélérées par GPU de la série Ada sont disponibles dans les régions suivantes : Chine (Pékin), Chine (Hangzhou), Chine (Shanghai), Chine (Shenzhen), Singapour et États-Unis (Virginie).
Relation entre les spécifications des instances GPU et la concurrence par instance
Un GPU Ada.1 dispose de 48 Go de mémoire, tandis qu'un GPU de la série Tesla en possède 16 Go. Function Compute alloue l'intégralité de la mémoire d'une carte GPU à un seul conteneur GPU. Étant donné que le quota par défaut est limité à 30 cartes GPU par région, un maximum de 30 conteneurs GPU peuvent s'exécuter simultanément dans cette région.
Si la concurrence par instance d'une fonction GPU est de 1, celle-ci peut traiter jusqu'à 30 requêtes d'inférence simultanément dans une région donnée.
Si la concurrence par instance d'une fonction GPU est de 5, celle-ci peut traiter jusqu'à 150 requêtes d'inférence simultanément dans une région donnée.
Concurrence par instance unique
Pour optimiser l'utilisation des ressources, configurez la concurrence par instance unique en fonction des besoins de votre application. Cette configuration permet d'exécuter plusieurs tâches sur une seule instance en partageant les ressources CPU et mémoire, ce qui améliore le rendement global. Pour plus d'informations, consultez Configurer la concurrence des instances.
Durée d'exécution pour une instance unique à concurrence unique
Lorsqu'une instance traite une seule requête, la durée d'exécution est mesurée depuis l'arrivée de la requête sur l'instance jusqu'à la fin de son traitement.
Durée d'exécution pour une instance unique à concurrence multiple
Lorsqu'une instance exécute plusieurs requêtes simultanément, la durée d'exécution est mesurée de l'arrivée de la première requête sur l'instance jusqu'à l'achèvement de la dernière. Cette mutualisation des ressources contribue à réduire les coûts.
Références
Pour plus d'informations sur les méthodes de facturation et les éléments facturables de Function Compute, consultez Vue d'ensemble de la facturation.
Lors de la création d'une fonction via une API, utilisez le paramètre
instanceTypepour spécifier le type d'instance. Pour plus d'informations, consultez CreateFunction.Pour savoir comment spécifier le type et les spécifications d'instance dans la console, consultez Création de fonction.